Kolaps modelů: Proč inbreeding AI zničí inteligenci

Výzkumníci varují: trénink AI na AI-generovaném obsahu vede k „modelovému kolapsu“. Jak udržet AI při smyslech, když se web plní syntetickým smetím?

Kolaps modelů: Proč inbreeding AI zničí inteligenci

The Habsburg Problem in Digital Form

In European history, the House of Habsburg was one of the most powerful royal dynasties. They ruled vast territories for centuries. But they had a fatal flaw: in their quest to consolidate power and keep their bloodline "pure," they married their cousins. Over generations, this recursive inbreeding led to the famous "Habsburg Jaw" and a host of genetic deformities and health issues. The gene pool became too small, too recursive, and ultimately, the line collapsed. Charles II of Spain, the last Habsburg ruler of the Spanish Empire, was so inbred that he could barely chew his own food.

In 2025, we are witnessing the digital equivalent of this phenomenon. Researchers call it Model Collapse.

For the first decade of the Deep Learning revolution (roughly 2012-2022), we lived in a Golden Age of data. We trained our models on the organic output of humanity. We scraped books written by human authors, code written by human engineers, forums filled with human arguments, and art created by human hands. This data was messy, yes. But it was rich. It was varied. It contained the "tails" of the distribution: the weird, the creative, the unexpected. It was grounded in physical reality.

But then came ChatGPT, Midjourney, and Copilot. Suddenly, the cost of generating content dropped to near zero. The internet was flooded with AI-generated text, AI-generated images, and AI-generated code. SEO spammers used LLMs to generate millions of "listicle" articles to farm clicks. Bots began talking to bots on social media. LinkedIn filled with AI-written posts about "thought leadership." Medium overflowed with AI-generated think pieces about AI.

Today, a significant and growing percentage of the public web is synthetic. Estimates suggest that by 2025, 30-50% of text on the public internet was generated by AI. And here is the problem: when we scrape the web to train the next generation of models, we are inevitably scraping data generated by their predecessors. We are feeding the AI its own output. We are closing the loop. We are creating Habsburg AI.

Kolaps modelu: Degradace při rekurzivním trénování Každá generace trénovaná na výstupu té předchozí ztrácí rozmanitost i přesnost GEN 1 (2012-2022) "Nedotčený web" 100 % lidských dat VYSOKÁ ROZMANITOST Plné rozložení Trénink GEN 2 (2023-2024) "Smíšený web" 65 % lidských, 35 % AI SLÁBNOUCÍ CHVOSTY Rozptyl se zmenšuje Trénink GEN 3 (2025+) "Kontaminovaný web" 35 % lidských, 65 % AI KOLAPS Splývání módů Trénink GEN 4 (Budoucnost?) "Syntetický brak" 8 % lidských, 92 % AI ZKOLABOVALO Degenerovaný bod Čtyři příznaky kolapsu modelu Ztráta chvostů rozložení Kreativní a neobvyklé výstupy mizí. Vše konverguje k průměru. Okrajové případy navždy ztraceny. "Bežová AI" Zesilování halucinací Chyby z GEN 1 se stanou "fakty" v GEN 2 a pak kanonickým poznáním. Lži se stávají pravdou. "Sebevědomé lži" Homogenizace stylu Všechny výstupy znějí stejně. Generické, bezpečné, uhlazené, ale bez duše. Jedinečný hlas umírá. "AI výplod" Odpoutání od reality Modely ztrácejí ukotvení ve fyzické realitě. Čistá manipulace se symboly bez významu. "Nekonečná regrese" Kolaps modelu není teoretické riziko. Děje se právě teď. Internet je už kontaminovaný.
Rizika spojená s „The Habsburg Problem in Digital Form" se dají zvládnout, jakmile dostanou jména a vlastníky.

Matematika regrese

Toto není jen filozofická obava. Je to matematická jistota. Výzkumníci z Oxfordu, Cambridge a Torontské univerzity tento efekt prokázali v přísných recenzovaných studiích. Říkají mu „Prokletí rekurze".

Matematika je ve své ponurosti vlastně docela elegantní. Když se pravděpodobnostní model (Model B) trénuje na datech vytvořených jiným pravděpodobnostním modelem (Model A), Model B se učí aproximaci skutečného rozdělení, kterou vytvořil Model A, nikoli skutečné rozdělení samo. Učí se chyby spolu se signálem.

Ale je to ještě horší. Trénovací proces Modelu B ze své podstaty zdůrazňuje oblasti s vysokou pravděpodobností ve výstupu Modelu A. Vzácná událost, tvořivé odchylky, „ocasy" rozdělení, jsou v syntetickém výstupu Modelu A nedostatečně zastoupeny (protože jsou ze své definice vzácné). Model B tedy vidí těchto ocasů ještě méně než Model A. Ztrácí variabilitu.

Teď trénujte Model C na výstupu Modelu B. Ocasy se dále zmenšují. Trénujte Model D na Modelu C. Ještě dál. Po dostatečném počtu generací se rozdělení zhroutí do jediného bodu. Všechny výstupy se stanou stejnými: „průměrem" původního rozdělení, zbaveným veškeré rozmanitosti.

Představte si to jako pořizování kopie kopie kopie. První kopie vypadá přijatelně. Druhá je trochu rozmazaná. Do desáté kopie se ostré hrany změní v šum, detaily se ztratí a obraz se promění v šedou kaši. Signál s každou generací exponenciálně slábne.

Ztráta ocasů

U modelů umělé inteligence se to projevuje jako ztráta kreativity a nuancí. Modely se stávají „bežovými". Jejich psaní se stává generickým, opakujícím se a bezpečným. Jejich umění konverguje ke specifické, lesklé, přeleštěné estetice, která postrádá drsnost a texturu skutečnosti. Jejich kód se stává syntakticky dokonalým, ale funkčně generickým, bez chytrých optimalizačních triků, které by použil lidský odborník.

„Ocasy" rozdělení jsou místem, kde žije inovace. Shakespeare je v ocasu. Einstein je v ocasu. Podivné startupové nápady, ze kterých se stanou miliardové společnosti, jsou v ocasu. Když ocasy odstraníte, odstraníte i možnost geniality. Získáte svět kompetentní průměrnosti.

Zesilování halucinací

Snad horší než ztráta kreativity je nabytí sebejisté mylnosti. Když se modely trénují na halucinacích svých předchůdců, tyto chyby se posilují. Lež pronesená jednou je anomálie. Lež zopakovaná milionkrát v tréninkové sadě se stane faktem.

Představme si hypotetický případ: GPT-5 si vymyslí, že určitý lék je bezpečný v těhotenství (není). Tato halucinace se objeví v tisících článků o zdraví vytvořených umělou inteligencí. GPT-6 se na těchto článcích trénuje. Nyní tomuto nepravdivému faktu „věří" s ještě větší jistotou, protože ho viděl tolikrát. GPT-7 ho považuje za zavedenou lékařskou znalost.

Model Collapse není jen o tom, že se model stane nudným; jde o to, že se odpoutá od reality. Jde o vytvoření umělé inteligence, která je naprosto sebejistá ve vesmíru faktů, které neexistují.

Důkazy tu již jsou

Na Model Collapse nečekáme. Sledujeme, jak se odvíjí v přímém přenosu.

Stack Overflow zaznamenal obrovský pokles lidské návštěvnosti, zatímco objem kódu generovaného umělou inteligencí na GitHubu explodoval. Pokud trénujete model na kódu z GitHubu z roku 2025, trénujete ho na kódu, který byl pravděpodobně napsán (nebo alespoň upraven) nástrojem Copilot v roce 2024. Pokud měl tento kód z roku 2024 skrytou chybu (řekněme bezpečnostní zranitelnost, kterou umělá inteligence často navrhuje), model z roku 2025 se tuto chybu naučí jako osvědčený postup. Bude ji dále zesilovat.

Výzkumníci ve společnosti Google pozorovali, že novější výsledky vyhledávání obsahují stále častěji opakující se frázové vzorce typické pro výstup LLM. Stejné fráze se objevují znovu a znovu: „Je důležité poznamenat, že...", „V dnešním uspěchaném světě...", „Pojďme se do toho ponořit...". Tyto jazykové tiky se šíří korpusem jako virus.

Společnost Amazon uvedla, že značné procento zákaznických recenzí na její platformě je nyní generováno umělou inteligencí. Popisy produktů jsou generovány umělou inteligencí. Recenze těchto produktů jsou generovány umělou inteligencí. Brzy budou souhrny těchto recenzí generovány umělou inteligencí. Jsou to želvy až dolů.

„Škálovací zákony", které poháněly boom umělé inteligence (myšlenka, že pouhé přidání více dat a většího výpočetního výkonu vždy vede k lepším výsledkům), narážejí na zeď. Data již nejsou omezením; omezením je realita. Došly nám čistá lidská data. Otrávili jsme si vlastní studnu.

Dweve Spindle: Sedmistupňová epistemologická obrana Přeměna surových informací na ověřené znalosti připravené pro AI Sedmistupňový epistemologický pipeline 1. KANDIDÁT Surová informace identifikována Web scrape označen 2. EXTRAHOVÁNO Strukturovaná informace zpracována Extrakce entit/faktů 3. ANALYZOVÁNO Rozloženo na atomické fakty Dekompozice tvrzení 4. PROPOJENO Propojeno se znalostní sítí Integrace do grafu 5. OVĚŘENO Validace z více zdrojů Křížové kontroly 6. CERTIFIKOVÁNO QA dokončeno >0,7 jistota Kvalita zaručena 7. KANONICKÉ Autoritativní připravené pro AI Základní pravda pro trénování Šest dimenzí kvality (hodnoceno v každé fázi) Ověřitelnost Lze tvrzení nezávisle potvrdit? Objektivita Je to fakt, nebo názor? Detekce zkreslení. Úplnost Je zahrnut kritický kontext? Konzistence Je v rozporu se známými fakty? Časová Je stále aktuální a relevantní? Diverzita zdrojů Více nezávislých potvrzení? Vojenská hierarchie 32 agentů (zpracování každé znalostní jednotky) Průzkumná brigáda 6 agentů: Najít zdroje Extrakční sbor 5 agentů: Zpracovat data Analytická divize 6 agentů: Rozložit Stráž kvality 4 agenti: Ověřit pravdu Rada pro řízení 12 agentů: Certifikovat

Řešení Dweve: Epistemologická přísnost

Ve společnosti Dweve jsme tuto krizi předvídali. Již brzy jsme si uvědomili, že strategie „vše seškrábat" je neudržitelná. Chcete-li budovat robustní systémy, které se nezhroutí do halucinací, musíte upřednostnit původ dat: vědět přesně, odkud vaše data pocházejí a zda představují realitu.

Proto jsme vytvořili Dweve Spindle: naši platformu pro správu podnikových znalostí. Spindle není jen datový kanál. Je to epistemologický systém. Přeměňuje surové informace na ověřené znalosti připravené pro AI prostřednictvím přísného sedmistupňového procesu.

Sedmistupňový epistemologický kanál

Každá informace, která vstoupí do ekosystému Dweve, prochází tímto kanálem:

Fáze 1: Kandidát. Surová informace je identifikována a označena ke zpracování. Může to být webová stránka, dokument, databázový záznam nebo údaj ze senzoru. V této fázi víme pouze to, že informace existuje, nikoli zda je pravdivá nebo užitečná.

Fáze 2: Extrahováno. Strukturované informace jsou parsovány ze surového zdroje. Jsou identifikovány entity. Jsou extrahována fakta. Nestrukturovaný chaos se stává kandidátem na strukturovaný znalostní graf.

Fáze 3: Analyzováno. Tvrzení jsou rozložena na atomická fakta. Věta jako „Einstein získal Nobelovu cenu za relativitu" je rozdělena na ověřitelné součásti: „Einstein existoval", „Einstein získal Nobelovu cenu", „Cena byla za fyziku", „Cena byla udělena za práci na relativitě." (Poznámka: toto poslední tvrzení je ve skutečnosti nepravdivé, což by kanál odhalil.)

Fáze 4: Propojeno. Atomická fakta jsou propojena s naší stávající znalostní sítí. Odporují tyto nové informace zavedeným faktům? Potvrzují je? Vyplňují mezery? Integrace grafu odhaluje konzistenci a konflikty.

Fáze 5: Ověřeno. Probíhá validace z více zdrojů. Můžeme najít nezávislé potvrzení z autoritativních zdrojů? Projde tvrzení kontrolami logické konzistence? Jaký je původ původního zdroje?

Fáze 6: Certifikováno. Zajištění kvality je dokončeno. Informace dosáhla skóre spolehlivosti nad 0,7 v našich šesti dimenzích kvality. Je označena jako spolehlivá pro použití v navazujících aplikacích.

Fáze 7: Kanonické. Informace se stává autoritativní znalostí připravenou pro AI. Lze ji použít pro trénování, pro inferenci, pro vyhledávání. Je to základní pravda.

Vojenská hierarchie 32 agentů

Tento kanál není prováděn jediným algoritmem. Je řízen specializovaným týmem 32 agentů AI, organizovaných do hierarchie ve vojenském stylu:

  • Průzkumná brigáda (6 agentů): Zvědové, kteří identifikují a získávají potenciální zdroje znalostí
  • Sbor pro extrakci (5 agentů): Specialisté na parsování, NER a strukturování surových dat
  • Analytická divize (6 agentů): Logici, kteří rozkládají tvrzení a identifikují závislosti
  • Síť pro propojení (4 agenti): Specialisté na grafy, kteří integrují nové znalosti
  • Stráž kvality (4 agenti): Validátoři, kteří křížově odkazují a odhalují nesrovnalosti
  • Rada pro správu (12 agentů): Vyšší agenti, kteří činí konečná rozhodnutí o certifikaci

Každý agent má specializované odborné znalosti. Diskutují. Zpochybňují vzájemné závěry. Vyžadují konsenzus, než informace postoupí do další fáze. Tento proces víceagentního ověřování je mnohem robustnější než jakýkoli přístup k ověřování faktů založený na jediném modelu.

Detekce 47 typů zkreslení

Spindle je specificky navržen k detekci a označování zkreslení v trénovacích datech. Náš systém identifikuje 47 různých typů zkreslení ve čtyřech kategoriích:

  • Statistické zkreslení: Zkreslení výběru vzorku, zkreslení výběru, zkreslení přežití, konfirmační zkreslení při sběru dat
  • Kognitivní zkreslení: Kotvení, heuristika dostupnosti, efekty rámování ve zdrojovém materiálu
  • Jazykové zkreslení: Zabarvená slova, eufemismy, vágní formulace, přesvědčovací rámování
  • Systémové zkreslení: Mezery v zastoupení, historická zkreslení zakódovaná v textu, kulturní slepá místa

Když je zkreslení zjištěno, informace je buď opravena (pokud je to možné), označena příznakem (pokud je oprava nejistá), nebo odmítnuta (pokud je zkreslení zásadní a neopravitelné). Tím se zabrání zesilování zkreslení, které sužuje modely trénované na surových datech z webu.

Strategie původu dat na čtyřech pilířích Jak Dweve udržuje integritu trénovacích dat v době syntetického obsahu 1 NEDOTČENÝ WEB Archivy před rokem 2023 Obsah psaný lidmi z doby před ChatGPT: - Knihy digitalizované před rokem 2022 - Akademické práce - Repozitáře kódu (2010-2021) - Archivy fór - Redakční žurnalistika Základní pravda 2 CERTIFIKOVANÉ ZDROJE Licencovaná lidská data Přímá partnerství s ověřenými lidskými tvůrci: - Akademičtí vydavatelé - Knižní vydavatelé - Kód s CI/CD testy - Podnikoví partneři - Profesionální autoři Ověřený původ 3 SYMBOLICKÝ FILTR Ověřování na základě logiky Kontroly založené na omezeních odmítají syntetický odpad: - Ověřování syntaxe - Statická analýza - Logická konzistence - Křížová kontrola faktů - Detekce halucinací Imunitní systém 4 ZACHOVÁNÍ OCASŮ Ochrana rozmanitosti Aktivní kurátorství kreativních odlehlých hodnot: - Nadměrné vzorkování odlehlých hodnot - Zachování okrajových případů - Kurátorství neobvyklých dat - Ochrana kreativity - Oceňování menšinových názorů Zdroj inovací Původ dat je nový konkurenční příkop. Kvalita nad kvantitou. Realita nad simulací.
„The Dweve Solution: Epistemological Rigor“ je smyčka: pozoruj, zvol, jednej a znovu testuj.

Čtyři pilíře původu dat

Kromě pipeline Spindle stojí naše širší datová strategie na čtyřech pilířích:

1. Nedotčený web (archivy před rokem 2023)

Přikládáme obrovský důraz datům vytvořeným před masovým rozšířením generativní umělé inteligence (zhruba konec roku 2022/začátek roku 2023). Tuto éru vnímáme jako „nedotčený web“. Tato archivní data jsou základním kamenem našeho tréninku. Jsou základní pravdou lidského výstupu před začátkem kontaminace.

Do získávání a správy datových sad z doby před rokem 2022 jsme investovali značné prostředky: digitalizované knihy, akademické archivy, repozitáře kódu s historií commitů dokazující lidské autorství, archivy fór z éry, kdy každý příspěvek psal člověk.

Tato data jsou nenahraditelná. Jakmile byl web kontaminován, nemohli jsme ho odkontaminovat. Můžeme ale zachovat a upřednostnit čisté archivy.

2. Certifikované lidské zdroje

U moderních dat se nespoléháme na bezhlavé stahování z webu. Přímo spolupracujeme s důvěryhodnými institucemi. Licencujeme data od:

  • Akademičtí vydavatelé: Recenzované články jsou (většinou) psané lidmi a posuzované lidmi. Proces recenzního řízení poskytuje filtr kvality.
  • Knižní vydavatelé: Redakční procesy zajišťují úroveň lidského dohledu, která webovému obsahu chybí.
  • Repozitáře kódu s CI/CD: To je zásadní. Nestahujeme jen tak nějaký kód. Stahujeme kód, který prochází testy. Pokud se funkce nezkompiluje, zahodíme ji. Pokud neprojde testovací sadou, zahodíme ji. Fungující kód má mnohem větší pravděpodobnost, že ho napsal člověk (nebo ho alespoň člověk ověřil), než náhodné úryvky.
  • Podnikoví partneři: Společnosti nám poskytují proprietární data výměnou za modely na míru. Tato data jsou z definice vytvořená lidmi a relevantní pro byznys.

3. Symbolická verifikace jako imunitní systém

To je unikátní pro náš neuro-symbolický přístup. Protože náš systém díky architektuře založené na omezeních rozumí logice a struktuře kódu, můžeme k filtrování tréninkových dat použít symbolickou verifikaci.

Pokud trénujeme model na psaní v Pythonu, nekrmíme ho jen holými textovými soubory. Kód spustíme přes kompilátor. Pokud má syntaktické chyby, zahodíme ho. Spustíme ho přes statický analyzátor. Pokud má zjevné bezpečnostní chyby, zahodíme ho. Spustíme ho proti testovacím případům. Pokud selže, zahodíme ho.

U faktického obsahu křížově porovnáváme tvrzení s naším ověřeným znalostním grafem. Pokud dokument tvrdí, že Paříž je hlavní město Německa, symbolická vrstva zachytí nekonzistenci a označí dokument jako nespolehlivý.

Toto funguje jako imunitní systém proti Model Collapse. Halucinace a chybný kód generovaný jinými umělými inteligencemi neprojdou našimi ověřovacími kontrolami a jsou odfiltrovány dříve, než mohou kontaminovat náš trénink.

4. Strategie zachování ocasů rozdělení

Vědomě nadměrně vzorkujeme „ocasy" rozdělení. Hledáme data, která jsou vysoce kvalitní, ale nekonvenční. Nechceme, aby byl náš model „průměrný". Chceme, aby rozuměl okrajovým případům, tvůrčím skokům a skvělým výjimkám.

Většina tréninkových pipeline pro LLM agresivně odfiltrovává „odlehlé hodnoty", aby stabilizovala trénink. My je pečlivě kurátorujeme. Inovace nevznikají v průměru; vznikají na okrajích. Další průlomový nápad nebude znít jako všechny ostatní. Bude znít podivně. A my chceme tuto podivnost zachovat.

„The Four Pillars of Data Provenance" je smyčka: pozoruj, vyber, jednej a znovu testuj.

Hodnota reality

V blízké budoucnosti se „data generovaná lidmi" stanou prémiovou třídou aktiv. Rozlehlý oceán veřejného internetu bude považován za „odpadní data": užitečná možná jako výplň nebo pro naučení základní gramatiky, ale nebezpečná pro základní znalosti.

Společnosti, které mají přístup k proprietárním datům z reálného světa (logy ze senzorů ze skutečných továren, záznamy pacientů od skutečných lékařů, transakční data z reálných ekonomik), budou mít obrovskou konkurenční výhodu. Vlastní „ground truth".

Model Collapse je existenční hrozbou pro bublinu generativní umělé inteligence. Naznačuje, že nemůžeme jen donekonečna škálovat. Nemůžeme si cestu k superinteligenci jen nasimulovat. Musíme zůstat nohama na zemi. Musíme kurátorovat. Musíme upřednostňovat kvalitu před kvantitou.

Umělá inteligence budoucnosti nebude postavena na celém internetu. Bude postavena na ověřeném internetu. Bude postavena na pravdě.

Regulační rozměr

Toto není jen technický problém. Regulátoři si začínají uvědomovat důsledky kontaminace syntetickými daty.

Akt o umělé inteligenci EU výslovně vyžaduje dokumentaci původu tréninkových dat pro vysoce rizikové systémy umělé inteligence. Pokud byl váš model trénován na kontaminovaných datech a produkuje škodlivé výstupy, musíte být schopni prokázat, že jste podnikli přiměřené kroky k zajištění kvality dat. „Stáhli jsme web" nebude přijatelná odpověď.

GDPR už nyní vyžaduje, aby organizace vedly záznamy o činnostech zpracování údajů. Rozšířit tuto povinnost na data pro trénování AI je přirozený vývoj. Odkud vaše trénovací data pocházejí? Dokážete prokázat, že byla získána legálně? Dokážete prokázat, že představují realitu, a ne halucinace AI?

Společnosti, které na tyto otázky nedokážou odpovědět, se budou potýkat se stále přísnější regulací. Společnosti, které dokážou prokázat důkladný původ dat (například ty, které používají Dweve Spindle), budou mít konkurenční výhodu v oblasti souladu s předpisy.

Prostor kolem "The Regulatory Dimension" se zmenšuje, když se setkají pravidla, vyhledávání a důkazy.

Cesta vpřed

Model Collapse není nevyhnutelný. Je důsledkem líných postupů při práci s daty. Pokud budeme nadále stahovat kontaminovaný web a krmit jím stále větší modely, získáme Habsburskou AI: sebevědomou, zdánlivě schopnou, ale v zásadě degenerovanou.

Pokud ale investujeme do kvality dat, pokud vybudujeme epistemologické systémy, které dokážou rozlišit pravdu od halucinace, pokud zachováme rozmanitost lidského myšlení, místo abychom ji zhutnili do syntetické kaše, můžeme vytvořit AI, která zůstane ukotvená v realitě.

To vyžaduje tvrdší práci. Vyžaduje to větší investice. Vyžaduje to přistupovat k datům jako ke vzácnému zdroji, ne jako ke komoditě určené k povrchové těžbě. Ale je to jediná cesta k systémům AI, které zůstanou dlouhodobě užitečné, přesné a důvěryhodné.

Ve společnosti Dweve jsme si tuto cestu zvolili. Naše kombinace nedotčených archivních dat, certifikovaných lidských zdrojů, symbolického ověřování a zachování rozmanitosti zajišťuje, že naše modely zůstávají propojené s reálným světem. Stavíme filtr mezi realitou a simulací.

Snadná cesta vede k Model Collapse. Těžká cesta vede k inteligenci, která skutečně funguje. Víme, kterou z nich se vydáváme.