Kríza kolapsu modelov: Prečo inbreeding AI zničí inteligenciu
The Habsburg Problem in Digital Form
In European history, the House of Habsburg was one of the most powerful royal dynasties. They ruled vast territories for centuries. But they had a fatal flaw: in their quest to consolidate power and keep their bloodline "pure," they married their cousins. Over generations, this recursive inbreeding led to the famous "Habsburg Jaw" and a host of genetic deformities and health issues. The gene pool became too small, too recursive, and ultimately, the line collapsed. Charles II of Spain, the last Habsburg ruler of the Spanish Empire, was so inbred that he could barely chew his own food.
In 2025, we are witnessing the digital equivalent of this phenomenon. Researchers call it Model Collapse.
For the first decade of the Deep Learning revolution (roughly 2012-2022), we lived in a Golden Age of data. We trained our models on the organic output of humanity. We scraped books written by human authors, code written by human engineers, forums filled with human arguments, and art created by human hands. This data was messy, yes. But it was rich. It was varied. It contained the "tails" of the distribution: the weird, the creative, the unexpected. It was grounded in physical reality.
But then came ChatGPT, Midjourney, and Copilot. Suddenly, the cost of generating content dropped to near zero. The internet was flooded with AI-generated text, AI-generated images, and AI-generated code. SEO spammers used LLMs to generate millions of "listicle" articles to farm clicks. Bots began talking to bots on social media. LinkedIn filled with AI-written posts about "thought leadership." Medium overflowed with AI-generated think pieces about AI.
Today, a significant and growing percentage of the public web is synthetic. Estimates suggest that by 2025, 30-50% of text on the public internet was generated by AI. And here is the problem: when we scrape the web to train the next generation of models, we are inevitably scraping data generated by their predecessors. We are feeding the AI its own output. We are closing the loop. We are creating Habsburg AI.
Matematika regresie
Toto nie je len filozofická otázka. Je to matematická istota. Výskumníci z Oxfordu, Cambridge a Torontskej univerzity tento efekt dokázali v prísnych recenzovaných štúdiách. Nazývajú ho "Prekliatie rekurzie."
Matematika je v svojej pochmúrnosti vlastne celkom elegantná. Keď sa pravdepodobnostný model (Model B) trénuje na dátach vygenerovaných iným pravdepodobnostným modelom (Model A), Model B sa učí Model A aproximáciu skutočného rozdelenia, nie skutočné rozdelenie samotné. Učí sa chyby spolu so signálom.
Ale je to ešte horšie. Tréningový proces Modelu B inherentne zdôrazňuje oblasti s vysokou pravdepodobnosťou vo výstupe Modelu A. Zriedkavé udalosti, kreatívne odľahlé hodnoty, "chvosty" rozdelenia, sú v syntetickom výstupe Modelu A nedostatočne zastúpené (pretože sú, podľa definície, zriedkavé). Takže Model B vidí ešte menej príkladov týchto chvostov ako Model A. Stráca varianciu.
Teraz trénujte Model C na výstupe Modelu B. Chvosty sa ďalej zmenšujú. Trénujte Model D na Model C. Ešte viac. Po dostatočnom počte generácií sa rozdelenie zrúti do jedného bodu. Všetky výstupy sa stanú rovnakými: "priemer" pôvodného rozdelenia, zbavený všetkej rozmanitosti.
Predstavte si to ako robenie kópie z kópie z kópie. Prvá kópia vyzerá prijateľne. Druhá je trochu rozmazaná. Pri desiatej kópii sa ostré hrany zmenia na šum, detaily sú rozmyté a obraz sa zmení na sivú kašu. Signál s každou generáciou exponenciálne degraduje.
Strata chvostov
V modeloch umelej inteligencie sa to prejavuje ako strata kreativity a nuáns. Modely sa stávajú "bezfarebnými." Ich písanie je generické, opakujúce sa a bezpečné. Ich umenie konverguje k špecifickej, lesklej, hyper-vyleštenej estetike, ktorej chýba drsnosť a textúra reality. Ich kód sa stáva syntakticky dokonalým, ale funkčne generickým, bez dômyselných optimalizačných trikov, ktoré by mohol použiť ľudský expert.
"Chvosty" rozdelenia sú miestom, kde žije inovácia. Shakespeare je v chvostoch. Einstein je v chvostoch. Zvláštne startupové nápady, z ktorých sa stanú miliardové spoločnosti, sú v chvostoch. Keď odstránite chvosty, odstránite možnosť génia. Dostanete svet kompetentnej priemernosti.
Zosilnenie halucinácií
Horšie ako strata kreativity je možno získanie sebavedomej nesprávnosti. Keď sa modely trénujú na halucináciách svojich predchodcov, tieto chyby sa posilňujú. Lož vyslovená raz je anomália. Lož zopakovaná miliónkrát v tréningovej množine sa stane faktom.
Predstavte si hypotetický prípad: GPT-5 halucinuje, že určitý liek je bezpečný počas tehotenstva (nie je). Táto halucinácia sa zverejní v tisíckach článkov o zdraví vytvorených umelou inteligenciou. GPT-6 sa trénuje na týchto článkoch. Teraz „verí" tomuto nepravdivému faktu s ešte vyššou istotou, pretože ho videl toľkokrát. GPT-7 s ním zaobchádza ako so zavedeným lekárskym poznatkom.
Model Collapse nie je len o tom, že sa stávame nudnými; je to o odpútaní sa od reality. Je to o vytvorení umelej inteligencie, ktorá je maximálne presvedčená o vesmíre faktov, ktoré neexistujú.
Dôkazy sú už tu
Nečakáme, kým Model Collapse nastane. Sledujeme, ako sa odohráva v reálnom čase.
Stack Overflow zaznamenal obrovský pokles ľudskej návštevnosti, zatiaľ čo objem kódu vytvoreného umelou inteligenciou na GitHube explodoval. Ak trénujete model na kódovanie na dátach z GitHubu z roku 2025, trénujete ho na kóde, ktorý pravdepodobne napísal (alebo aspoň pomáhal písať) Copilot v roku 2024. Ak mal tento kód z roku 2024 jemnú chybu (povedzme bezpečnostnú zraniteľnosť, ktorú AI zvykne navrhovať), model z roku 2025 sa túto chybu naučí ako osvedčený postup. Bude ju zosilňovať.
Výskumníci v Googli pozorovali, že novšie výsledky vyhľadávania obsahujú čoraz opakujúcejšie frázovacie vzorce charakteristické pre výstup LLM. Rovnaké frázy sa objavujú znova a znova: „Je dôležité poznamenať, že...", „V dnešnom rýchlo sa meniacom svete...", „Poďme sa do toho ponoriť...". Tieto jazykové tiky sa šíria korpusom ako vírus.
Amazon oznámil, že významné percento zákazníckych recenzií na ich platforme je teraz vytvorených umelou inteligenciou. Popisy produktov sú vytvorené umelou inteligenciou. Recenzie týchto produktov sú vytvorené umelou inteligenciou. Čoskoro budú súhrny týchto recenzií vytvorené umelou inteligenciou. Sú to korytnačky až dole.
„Zákony škálovania", ktoré poháňali boom umelej inteligencie (myšlienka, že jednoduché pridanie väčšieho množstva dát a väčšieho výpočtového výkonu vždy prináša lepší výkon), narážajú na stenu. Dáta už nie sú obmedzením; obmedzením je realita. Minuli sme čisté ľudské dáta. Otrávili sme si vlastnú studňu.
Riešenie Dweve: Epistemologická prísnosť
V spoločnosti Dweve sme túto krízu predvídali. Už skoro sme si uvedomili, že stratégia „zoškrabkať všetko“ je neudržateľná. Ak chcete vybudovať robustné systémy, ktoré sa nezrútia do halucinácií, musíte uprednostniť pôvod údajov: vedieť presne, odkiaľ vaše údaje pochádzajú a či predstavujú realitu.
Preto sme vytvorili Dweve Spindle: našu platformu na riadenie podnikových znalostí. Spindle nie je len dátový pipeline. Je to epistemologický systém. Premieňa surové informácie na overené znalosti pripravené pre AI prostredníctvom prísneho sedemstupňového procesu.
Sedemstupňový epistemologický pipeline
Každá informácia, ktorá vstúpi do ekosystému Dweve, prechádza týmto procesom:
Stupeň 1: Kandidát. Surové informácie sú identifikované a označené na spracovanie. Môže ísť o webovú stránku, dokument, záznam v databáze alebo údaj zo senzora. V tomto štádiu vieme len to, že informácia existuje, nie či je pravdivá alebo užitočná.
Stupeň 2: Extrahované. Štruktúrované informácie sú parsované zo surového zdroja. Entity sú identifikované. Fakty sú extrahované. Neštruktúrovaný chaos sa stáva kandidátom na štruktúrovaný znalostný graf.
Stupeň 3: Analyzované. Tvrdenia sú rozložené na atómové fakty. Veta ako „Einstein dostal Nobelovu cenu za teóriu relativity“ je rozdelená na overiteľné zložky: „Einstein existoval“, „Einstein dostal Nobelovu cenu“, „Cena bola za fyziku“, „Cena bola udelená za prácu na teórii relativity“. (Poznámka: posledné tvrdenie je v skutočnosti nepravdivé, čo by pipeline zachytil.)
Stupeň 4: Prepojené. Atómové fakty sú prepojené s našou existujúcou znalostnou sieťou. Je táto nová informácia v rozpore so zavedenými faktami? Potvrdzuje ich? Vypĺňa medzery? Integrácia do grafu odhaľuje konzistentnosť a konflikty.
Stupeň 5: Overené. Prebieha validácia z viacerých zdrojov. Dokážeme nájsť nezávislé potvrdenie z autoritatívnych zdrojov? Prejde tvrdenie kontrolami logickej konzistentnosti? Aký je pôvod pôvodného zdroja?
Stupeň 6: Certifikované. Zabezpečenie kvality je dokončené. Informácia dosiahla skóre spoľahlivosti nad 0,7 v našich šiestich dimenziách kvality. Je označená ako spoľahlivá na použitie v downstream aplikáciách.
Stupeň 7: Kanonické. Informácia sa stáva autoritatívnymi znalosťami pripravenými pre AI. Môže sa použiť na trénovanie, inferenciu a vyhľadávanie. Je to základná pravda.
Vojenská hierarchia 32 agentov
Tento pipeline nevykonáva jeden algoritmus. Orchestruje ho špecializovaný tím 32 agentov AI, organizovaných do hierarchie vojenského typu:
- Prieskumná brigáda (6 agentov): Skauti, ktorí identifikujú a získavajú potenciálne zdroje znalostí
- Extrakčný zbor (5 agentov): Špecialisti na parsovanie, NER a štruktúrovanie surových údajov
- Analytická divízia (6 agentov): Logici, ktorí rozkladajú tvrdenia a identifikujú závislosti
- Prepojovacia sieť (4 agenti): Špecialisti na grafy, ktorí integrujú nové znalosti
- Stráž kvality (4 agenti): Validátori, ktorí krížovo kontrolujú a odhaľujú nezrovnalosti
- Rada pre riadenie (12 agentov): Senior agenti, ktorí robia konečné rozhodnutia o certifikácii
Každý agent má špecializované odborné znalosti. Diskutujú. Spochybňujú vzájomné závery. Vyžadujú konsenzus, kým informácia postúpi do ďalšej fázy. Tento proces overovania s viacerými agentmi je oveľa robustnejší ako akýkoľvek prístup s jedným modelom na kontrolu faktov.
Detekcia 47 typov zaujatosti
Spindle je špecificky navrhnutý na detekciu a označovanie zaujatosti v tréningových údajoch. Náš systém identifikuje 47 rôznych typov zaujatosti v štyroch kategóriách:
- Štatistická zaujatosť: Výberová zaujatosť, selekčná zaujatosť, zaujatosť prežitia, potvrdzovacia zaujatosť pri zbere údajov
- Kognitívna zaujatosť: Kotvenie, heuristika dostupnosti, rámcovanie v zdrojovom materiáli
- Jazyková zaujatosť: Zavádzajúci jazyk, eufemizmy, vágne formulácie, presviedčacie rámcovanie
- Systémová zaujatosť: Medzery v zastúpení, historické zaujatosti zakódované v texte, kultúrne slepé miesta
Keď sa zistí zaujatosť, informácia sa buď opraví (ak je to možné), označí sa (ak je oprava neistá), alebo sa zamietne (ak je zaujatosť zásadná a neopraviteľná). Tým sa zabráni zosilňovaniu zaujatostí, ktoré postihuje modely trénované na surových dátach zo zoškrabovaných webových stránok.
Štyri piliere pôvodu dát
Okrem pipeline Spindle stojí naša širšia dátová stratégia na štyroch pilieroch:
1. Nedotknutý web (archívy spred roku 2023)
Obrovský dôraz kladieme na dáta vytvorené pred masovým rozšírením generatívnej AI (zhruba koniec roka 2022 a začiatok roka 2023). Toto obdobie vnímame ako „nedotknutý web“. Tieto archívne dáta sú základom nášho tréningu. Sú základnou pravdou ľudskej tvorby spred začiatku kontaminácie.
Do získavania a kurátorstva datasetov spred roku 2022 sme investovali veľa: digitalizované knihy, akademické archívy, repozitáre kódu s históriou commitov dokazujúcou ľudské autorstvo, fórove archívy z éry, keď každý príspevok písal človek.
Tieto dáta sú nenahraditeľné. Keď sa web kontaminoval, už sme ho nemohli odkontaminovať. Môžeme však zachovávať a uprednostňovať čisté archívy.
2. Certifikované ľudské zdroje
Pri moderných dátach sa nespoliehame na bezhlavé scrapovanie webu. Priamo spolupracujeme s dôveryhodnými inštitúciami. Licencujeme dáta od:
- Akademických vydavateľstiev: Recenzované články píšu (väčšinou) ľudia a posudzujú ich ľudia. Proces recenzovania poskytuje filter kvality.
- Knižných vydavateľstiev: Redakčné procesy zaručujú úroveň ľudského dohľadu, ktorá webovému obsahu chýba.
- Repozitárov kódu s CI/CD: Toto je kľúčové. Kód len nescrapujeme. Scrapujeme kód, ktorý prejde testami. Ak sa funkcia neskompiluje, zahodíme ju. Ak neprejde testovacou sadou, zahodíme ju. Fungujúci kód má oveľa väčšiu šancu, že ho napísal človek (alebo ho aspoň človek overil), ako náhodné útržky.
- Podnikových partnerov: Firmy nám poskytujú proprietárne dáta výmenou za modely na mieru. Tieto dáta sú z definície generované ľuďmi a relevantné pre podnikanie.
3. Symbolická verifikácia ako imunitný systém
Toto je jedinečné pre náš neuro-symbolický prístup. Keďže náš systém vďaka architektúre založenej na obmedzeniach rozumie logike a štruktúre kódu, môžeme na filtrovanie tréningových dát použiť symbolickú verifikáciu.
Ak trénujeme model na písanie v Pythone, nekŕmime ho len surovými textovými súbormi. Kód spustíme cez kompilátor. Ak má syntaktické chyby, zahodíme ho. Spustíme ho cez statický analyzátor. Ak má zjavné bezpečnostné chyby, zahodíme ho. Spustíme ho proti testovacím prípadom. Ak zlyhá, zahodíme ho.
Pri faktickom obsahu krížovo overujeme tvrdenia proti nášmu overenému znalostnému grafu. Ak dokument tvrdí, že Paríž je hlavné mesto Nemecka, symbolická vrstva zachytí nekonzistentnosť a označí dokument ako nespoľahlivý.
Funguje to ako imunitný systém proti Model Collapse. Halucinácie a chybný kód generovaný inými AI zlyhajú v našich overovacích kontrolách a sú odfiltrované skôr, než môžu kontaminovať náš tréning.
4. Stratégia zachovania chvostov
Zámerne nadmerne vzorkujeme „chvosty" distribúcie. Hľadáme dáta, ktoré sú vysoko kvalitné, ale nekonvenčné. Nechceme, aby bol náš model „priemerný." Chceme, aby rozumel okrajovým prípadom, kreatívnym skokom, brilantným výnimkám.
Väčšina tréningových pipeline pre LLM agresívne filtruje „odľahlé hodnoty", aby stabilizovala tréning. My ich starostlivo vyberáme. Inovácia sa nedeje v priemere; deje sa na okrajoch. Ďalší prelomový nápad nebude znieť ako každý iný nápad. Bude znieť zvláštne. Chceme toto zvláštnosť zachovať.
Hodnota reality
V blízkej budúcnosti sa „dáta generované ľuďmi" stanú prémiovou triedou aktív. Obrovský oceán verejného internetu sa bude považovať za „odpadové dáta": užitočné možno ako výplň alebo na učenie sa základnej gramatiky, ale nebezpečné pre základné poznatky.
Spoločnosti, ktoré majú prístup k proprietárnym dátam z reálneho sveta (denníky senzorov zo skutočných tovární, záznamy pacientov od skutočných lekárov, transakčné dáta z reálnych ekonomík), budú mať obrovskú konkurenčnú výhodu. Vlastnia „základnú pravdu."
Model Collapse je existenčnou hrozbou pre bublinu generatívnej AI. Naznačuje, že nemôžeme len donekonečna škálovať. Nemôžeme sa jednoducho presimulovať k superinteligencii. Musíme zostať ukotvení v realite. Musíme kurátorovať. Musíme uprednostniť kvalitu pred kvantitou.
AI budúcnosti nebude postavená na celom internete. Bude postavená na overenom internete. Bude postavená na pravde.
Regulačný rozmer
Toto nie je len technický problém. Regulátori si začínajú uvedomovať dôsledky kontaminácie syntetickými dátami.
EÚ AI Act výslovne vyžaduje dokumentáciu pôvodu tréningových dát pre systémy AI s vysokým rizikom. Ak bol váš model trénovaný na kontaminovaných dátach a produkuje škodlivé výstupy, musíte byť schopní preukázať, že ste podnikli rozumné kroky na zabezpečenie kvality dát. „Zoškrabali sme web" nebude prijateľná odpoveď.
GDPR už dnes vyžaduje, aby organizácie viedli záznamy o činnostiach spracúvania údajov. Rozšíriť túto požiadavku na tréningové dáta pre AI je prirodzený vývoj. Odkiaľ pochádzajú vaše tréningové dáta? Viete dokázať, že boli získané legálne? Viete preukázať, že odrážajú realitu, a nie halucinácie AI?
Spoločnosti, ktoré na tieto otázky nedokážu odpovedať, sa stretnú s čoraz prísnejším regulačným dohľadom. Spoločnosti, ktoré dokážu preukázať dôsledný pôvod údajov (napríklad tie, ktoré používajú Dweve Spindle), získajú konkurenčnú výhodu v oblasti súladu s predpismi.
Cesta vpred
Model Collapse nie je nevyhnutný. Je dôsledkom laxných postupov pri práci s údajmi. Ak budeme naďalej zoškrabávať kontaminovaný web a kŕmiť ním stále väčšie modely, dostaneme Habsburskú AI: sebavedomú, zdanlivo schopnú, ale v základe degenerovanú.
Ale ak investujeme do kvality údajov, ak vybudujeme epistemologické systémy, ktoré dokážu rozlíšiť pravdu od halucinácie, ak zachováme rozmanitosť ľudského myslenia namiesto toho, aby sme ju rozdrvili na syntetickú kašu, môžeme vybudovať AI, ktorá zostane ukotvená v realite.
To si vyžaduje náročnejšiu prácu. Vyžaduje si to väčšie investície. Vyžaduje si to pristupovať k údajom ako k vzácnemu zdroju, nie ako ku komodite, ktorú treba povrchovo vyťažiť. Ale je to jediná cesta k systémom AI, ktoré zostanú užitočné, presné a dôveryhodné z dlhodobého hľadiska.
V spoločnosti Dweve sme si túto cestu zvolili. Naša kombinácia nedotknutých archívnych údajov, certifikovaných ľudských zdrojov, symbolickej verifikácie a zachovávania rozmanitosti zaručuje, že naše modely zostanú prepojené s reálnym svetom. Budujeme filter medzi realitou a simuláciou.
Ľahká cesta vedie k Model Collapse. Náročná cesta vedie k inteligencii, ktorá skutočne funguje. Vieme, ktorou sa vyberieme.