Modellkollapskrisen: Därför kommer inavlad AI att döda intelligensen
The Habsburg Problem in Digital Form
In European history, the House of Habsburg was one of the most powerful royal dynasties. They ruled vast territories for centuries. But they had a fatal flaw: in their quest to consolidate power and keep their bloodline "pure," they married their cousins. Over generations, this recursive inbreeding led to the famous "Habsburg Jaw" and a host of genetic deformities and health issues. The gene pool became too small, too recursive, and ultimately, the line collapsed. Charles II of Spain, the last Habsburg ruler of the Spanish Empire, was so inbred that he could barely chew his own food.
In 2025, we are witnessing the digital equivalent of this phenomenon. Researchers call it Model Collapse.
For the first decade of the Deep Learning revolution (roughly 2012-2022), we lived in a Golden Age of data. We trained our models on the organic output of humanity. We scraped books written by human authors, code written by human engineers, forums filled with human arguments, and art created by human hands. This data was messy, yes. But it was rich. It was varied. It contained the "tails" of the distribution: the weird, the creative, the unexpected. It was grounded in physical reality.
But then came ChatGPT, Midjourney, and Copilot. Suddenly, the cost of generating content dropped to near zero. The internet was flooded with AI-generated text, AI-generated images, and AI-generated code. SEO spammers used LLMs to generate millions of "listicle" articles to farm clicks. Bots began talking to bots on social media. LinkedIn filled with AI-written posts about "thought leadership." Medium overflowed with AI-generated think pieces about AI.
Today, a significant and growing percentage of the public web is synthetic. Estimates suggest that by 2025, 30-50% of text on the public internet was generated by AI. And here is the problem: when we scrape the web to train the next generation of models, we are inevitably scraping data generated by their predecessors. We are feeding the AI its own output. We are closing the loop. We are creating Habsburg AI.
Regressionens matematik
Detta är inte bara en filosofisk fråga. Det är en matematisk säkerhet. Forskare från Oxford, Cambridge och University of Toronto har visat denna effekt i rigorösa peer-reviewed-studier. De kallar den "The Curse of Recursion."
Matematiken är faktiskt ganska elegant i sin dysterhet. När en probabilistisk modell (Modell B) tränas på data som genererats av en annan probabilistisk modell (Modell A), lär sig Modell B Modell A:s approximation av den sanna fördelningen, inte den sanna fördelningen i sig. Den lär sig felen tillsammans med signalen.
Men det blir värre. Modell B:s träningsprocess betonar i sig de högsta sannolikhetsregionerna i Modell A:s utdata. De sällsynta händelserna, de kreativa avvikelserna, fördelningens "svansar", är underrepresenterade i Modell A:s syntetiska utdata (eftersom de per definition är sällsynta). Så Modell B ser ännu färre exempel på dessa svansar än Modell A gjorde. Den förlorar varians.
Träna nu Modell C på Modell B:s utdata. Svansarna krymper ytterligare. Träna Modell D på Modell C. Ännu mer. Efter tillräckligt många generationer kollapsar fördelningen till en punkt. Alla utdata blir desamma: "medelvärdet" av den ursprungliga fördelningen, berövad all mångfald.
Tänk på det som att göra en fotokopia av en fotokopia av en fotokopia. Den första kopian ser acceptabel ut. Den andra är lite suddig. Vid den tionde kopian blir de skarpa kanterna brus, detaljerna är utsuddade och bilden förvandlas till grå sörja. Signalen avtar exponentiellt med varje generation.
Förlusten av svansar
I AI-modeller visar sig detta som en förlust av kreativitet och nyans. Modellerna blir "beige". Deras skrivande blir generiskt, repetitivt och säkert. Deras konst konvergerar mot en specifik, glansig, hyperpolerad estetik som saknar verklighetens grus och textur. Deras kod blir syntaktiskt perfekt men funktionellt generisk, utan de smarta optimeringstricks som en mänsklig expert skulle kunna använda.
Fördelningens "svansar" är där innovationen bor. Shakespeare finns i svansarna. Einstein finns i svansarna. De märkliga startup-idéerna som blir miljardföretag finns i svansarna. När du eliminerar svansarna eliminerar du möjligheten till genialitet. Du får en värld av kompetent medelmåttighet.
Hallucinationsförstärkning
Kanske värre än att förlora kreativiteten är att vinna självsäker felaktighet. När modeller tränas på sina föregångares hallucinationer förstärks dessa fel. En lögn som berättas en gång är en avvikelse. En lögn som upprepas en miljon gånger i träningsdata blir ett faktum.
Betrakta ett tankeexperiment: GPT-5 hallucinerar att ett visst läkemedel är säkert under graviditet (det är det inte). Den hallucinationen publiceras i tusentals AI-genererade hälsoartiklar. GPT-6 tränas på dessa artiklar. Den "tror" nu på detta falska faktum med ännu högre säkerhet, eftersom den har sett det så många gånger. GPT-7 behandlar det som etablerad medicinsk kunskap.
Model Collapse handlar inte bara om att bli tråkig; det handlar om att bli frånkopplad från verkligheten. Det handlar om att skapa en AI som är ytterst självsäker i ett universum av fakta som inte existerar.
Bevisen finns redan här
Vi väntar inte på att Model Collapse ska hända. Vi ser det utvecklas i realtid.
Stack Overflow har sett en massiv minskning av mänsklig trafik, medan mängden AI-genererad kod på GitHub har exploderat. Om du tränar en kodmodell på GitHub-data från 2025, tränar du den på kod som troligen skrevs (eller åtminstone assisterades av) Copilot 2024. Om den där 2024-koden hade en subtil bugg (säg en säkerhetsrisk som AI:n tenderar att föreslå), kommer 2025-modellen att lära sig den buggen som en bästa praxis. Den kommer att förstärka den.
Forskare på Google har observerat att nyare sökresultat innehåller allt mer repetitiva frasmönster som är typiska för LLM-genererad text. Samma fraser dyker upp om och om igen: "Det är viktigt att notera att...", "I dagens snabba värld...", "Låt oss dyka in...". Dessa språkliga tics sprider sig genom korpusen som ett virus.
Amazon har rapporterat att en betydande andel av kundrecensionerna på deras plattform nu är AI-genererade. Produktbeskrivningar är AI-genererade. Recensionerna av dessa produkter är AI-genererade. Snart kommer sammanfattningarna av dessa recensioner att vara AI-genererade. Det är sköldpaddor hela vägen ner.
"Scaling Laws" som drev AI-boomen (idén att att helt enkelt lägga till mer data och mer beräkningskraft alltid ger bättre prestanda) håller på att slå i en vägg. Data är inte längre begränsningen; verkligheten är begränsningen. Vi har fått slut på ren mänsklig data. Vi har förgiftat vår egen brunn.
Dweve-lösningen: epistemologisk stringens
På Dweve förutsåg vi denna kris. Vi insåg tidigt att strategin att "skrapa allt" inte var hållbar. För att bygga robusta system som inte kollapsar i hallucinationer måste du prioritera dataproviniens: att veta exakt var dina data kommer ifrån och om de återspeglar verkligheten.
Det är därför vi byggde Dweve Spindle: vår plattform för styrning av företagskunskap. Spindle är inte bara en datapipeline. Det är ett epistemologiskt system. Det omvandlar rå information till verifierad, AI-redo kunskap genom en rigorös process i sju steg.
Den sjustegs epistemologiska pipelinen
Varje informationsbit som kommer in i Dweve-ekosystemet går igenom denna pipeline:
Steg 1: Kandidat. Rå information identifieras och flaggas för bearbetning. Det kan vara en webbsida, ett dokument, en databaspost eller en sensoravläsning. I detta skede vet vi bara att informationen finns, inte om den är sann eller användbar.
Steg 2: Extraherad. Strukturerad information parsas från den råa källan. Entiteter identifieras. Fakta extraheras. Den ostrukturerade röran blir en kandidat till en strukturerad kunskapsgraf.
Steg 3: Analyserad. Påståenden delas upp i atomära fakta. En mening som "Einstein fick Nobelpriset för relativitetsteorin" bryts ner i verifierbara komponenter: "Einstein fanns", "Einstein fick ett Nobelpris", "Priset gällde fysik", "Priset tilldelades för arbete med relativitetsteorin." (Observera: det sista påståendet är faktiskt falskt, vilket pipelinen skulle fånga upp.)
Steg 4: Kopplad. Atomära fakta länkas till vårt befintliga kunskapsnätverk. Motsäger den nya informationen etablerade fakta? Styrker den dem? Fyller den luckor? Grafintegrationen avslöjar konsistens och konflikter.
Steg 5: Verifierad. Validering mot flera källor sker. Kan vi hitta oberoende bekräftelse från auktoritativa källor? Klarar påståendet logiska konsistenskontroller? Vad är ursprunget till den ursprungliga källan?
Steg 6: Certifierad. Kvalitetssäkringen är klar. Informationen har uppnått en konfidenspoäng över 0,7 på våra sex kvalitetsdimensioner. Den markeras som tillförlitlig för användning i nedströmsapplikationer.
Steg 7: Kanonisk. Informationen blir auktoritativ, AI-redo kunskap. Den kan användas för träning, för inferens, för hämtning. Den är grundsanning.
Militärhierarkin med 32 agenter
Denna pipeline utförs inte av en enda algoritm. Den orkestreras av ett specialiserat team på 32 AI-agenter, organiserade i en militärliknande hierarki:
- Upptäcktsbrigaden (6 agenter): Spejare som identifierar och hämtar potentiella kunskapskällor
- Extraktionskåren (5 agenter): Specialister på parsning, NER och strukturering av rå data
- Analysdivisionen (6 agenter): Logiker som bryter ner påståenden och identifierar beroenden
- Kopplingsnätverket (4 agenter): Grafspecialister som integrerar ny kunskap
- Kvalitetsvakten (4 agenter): Validerare som korsrefererar och upptäcker inkonsekvenser
- Styrningsrådet (12 agenter): Seniora agenter som fattar slutgiltiga certifieringsbeslut
Varje agent har specialiserad expertis. De debatterar. De utmanar varandras slutsatser. De kräver konsensus innan information går vidare till nästa steg. Denna multiagentverifieringsprocess är långt mer robust än någon enmodellsansats för faktakontroll.
Upptäcka 47 typer av bias
Spindle är specifikt utformat för att upptäcka och flagga bias i träningsdata. Vårt system identifierar 47 distinkta bias-typer inom fyra kategorier:
- Statistisk skevhet: Urvalsfel, selektionsfel, överlevnadsfel, bekräftelsefel i datainsamling
- Kognitiv skevhet: Ankring, tillgänglighetsheuristik, inramningseffekter i källmaterial
- Lingvistisk skevhet: Värdeladdat språk, eufemismer, svävande formuleringar, övertalande inramning
- Systemisk skevhet: Representationsluckor, historiska skevheter inbakade i text, kulturella blinda fläckar
När skevhet upptäcks korrigeras informationen (om möjligt), flaggas (om korrigeringen är osäker) eller avvisas (om skevheten är grundläggande och inte går att korrigera). Detta förhindrar att skevheter förstärks, något som plågar modeller som tränats på råa webbskrapningar.
De fyra pelarna för datas ursprung
Bortom Spindle-pipelinen vilar vår bredare datastrategi på fyra pelare:
1. Den orörda webben (arkiv från före 2023)
Vi lägger enorm vikt vid data som skapats innan den generativa AI:ns stora genomslag (ungefär slutet av 2022/början av 2023). Vi ser denna era som den "orörda webben". Denna arkivdata är grunden för vår träning. Den är sanningen om mänskliga alster innan kontamineringen började.
Vi har investerat kraftigt i att införskaffa och kuratera dataset från före 2022: digitaliserade böcker, akademiska arkiv, kodförråd med commit-historik som bevisar mänskligt författarskap, forumarkiv från en tid då varje inlägg var skrivet av en människa.
Denna data är oersättlig. När webben väl var kontaminerad kunde vi inte avkontaminera den. Men vi kan bevara och prioritera de rena arkiven.
2. Certifierade mänskliga källor
För modern data förlitar vi oss inte på blind webbskrapning. Vi samarbetar direkt med betrodda institutioner. Vi licensierar data från:
- Akademiska förlag: Peer-reviewed artiklar är (mestadels) skrivna av människor och granskade av människor. Granskningsprocessen utgör ett kvalitetsfilter.
- Bokförlag: Redaktionella processer säkerställer en nivå av mänsklig tillsyn som webbinnehåll saknar.
- Kodförråd med CI/CD: Detta är avgörande. Vi skrapar inte bara kod. Vi skrapar kod som klarar tester. Om en funktion inte kompilerar, kasserar vi den. Om den misslyckas med sin testsvit, kasserar vi den. Fungerande kod är mycket mer sannolikt mänskligt skriven (eller åtminstone mänskligt verifierad) än slumpmässiga utdrag.
- Företagspartners: Företag förser oss med proprietär data i utbyte mot skräddarsydda modeller. Denna data är per definition mänskligt genererad och affärsrelevant.
3. Symbolisk verifiering som immunsystem
Detta är unikt för vår neurosymboliska ansats. Eftersom vårt system förstår logik och kodstruktur genom vår begränsningsbaserade arkitektur, kan vi använda symbolisk verifiering för att filtrera träningsdata.
Om vi tränar en modell att skriva Python, matar vi den inte bara med råa textfiler. Vi kör koden genom en kompilator. Om den har syntaxfel, kasserar vi den. Vi kör den genom en statisk analysator. Om den har uppenbara säkerhetsbrister, kasserar vi den. Vi exekverar den mot testfall. Om den misslyckas, kasserar vi den.
För faktamässigt innehåll korsrefererar vi påståenden mot vår verifierade kunskapsgraf. Om ett dokument påstår att Paris är Tysklands huvudstad, fångar det symboliska lagret inkonsekvensen och flaggar dokumentet som opålitligt.
Detta fungerar som ett immunsystem mot modellkollaps. De hallucinationer och buggiga koder som genereras av andra AI:er klarar inte våra verifieringskontroller och filtreras bort innan de kan förorena vår träning.
4. Strategin för att bevara svansarna
Vi överprovsamlar medvetet "svansarna" i fördelningen. Vi letar efter data som är högkvalitativ men okonventionell. Vi vill inte att vår modell ska vara "genomsnittlig". Vi vill att den ska förstå gränsfallen, de kreativa sprången, de lysande undantagen.
De flesta LLM-träningspipelines filtrerar aggressivt bort "avvikare" för att stabilisera träningen. Vi kuraterar dem noggrant. Innovation sker inte vid medelvärdet; den sker vid kanterna. Nästa genombrottsidé kommer inte att låta som alla andra idéer. Den kommer att låta märklig. Vi vill bevara den märkligheten.
Värdet av verklighet
Inom en snar framtid kommer "mänskligt genererad data" att bli en premiumtillgångsklass. Det stora havet av det offentliga internetet kommer att betraktas som "skräpdata": användbart som fyllnad, kanske, eller för att lära sig grundläggande grammatik, men farligt för grundläggande kunskap.
Företag som har tillgång till proprietär, verklig data (sensorloggar från riktiga fabriker, patientjournaler från riktiga läkare, transaktionsdata från riktiga ekonomier) kommer att ha en enorm konkurrensfördel. De besitter "grundsanningen".
Modellkollaps är det existentiella hotet mot den generativa AI-bubblan. Det tyder på att vi inte bara kan skala upp i all oändlighet. Vi kan inte bara simulera oss fram till superintelligens. Vi måste hålla oss förankrade i verkligheten. Vi måste kuratera. Vi måste värdera kvalitet framför kvantitet.
Framtidens AI kommer inte att byggas på hela internetet. Den kommer att byggas på det verifierade internetet. Den kommer att byggas på sanning.
Den regulatoriska dimensionen
Detta är inte bara en teknisk fråga. Regulatorer börjar vakna upp till konsekvenserna av kontaminering med syntetisk data.
EU:s AI-förordning kräver uttryckligen dokumentation av träningsdatans ursprung för AI-system med hög risk. Om din modell har tränats på kontaminerad data och producerar skadliga utdata måste du kunna visa att du har vidtagit rimliga åtgärder för att säkerställa datakvalitet. "Vi skrapade webben" kommer inte att vara ett acceptabelt svar.
GDPR kräver redan att organisationer för register över databehandlingsaktiviteter. Att utvidga detta till AI-träningsdata är en naturlig utveckling. Var kom din träningsdata ifrån? Kan du bevisa att den samlades in lagligt? Kan du visa att den representerar verkligheten snarare än AI-hallucinationer?
Företag som inte kan svara på dessa frågor kommer att möta allt strängare regulatorisk granskning. Företag som kan uppvisa rigorös dataproviniens (som de som använder Dweve Spindle) kommer att ha en regelefterlevnadsfördel.
Vägen framåt
Model Collapse är inte oundvikligt. Det är en följd av slarviga datapraxis. Om vi fortsätter att skrapa den kontaminerade webben och mata allt större modeller med den får vi Habsburg-AI: självsäker, till synes kompetent, men i grunden degenererad.
Men om vi investerar i datakvalitet, om vi bygger epistemologiska system som kan skilja sanning från hallucination, om vi bevarar mångfalden i mänskligt tänkande snarare än att kollapsa den till syntetisk gröt, kan vi bygga AI som förblir förankrad i verkligheten.
Detta kräver hårdare arbete. Det kräver mer investeringar. Det kräver att vi behandlar data som en värdefull resurs snarare än en råvara att dagbrottsbryta. Men det är den enda vägen till AI-system som förblir användbara, korrekta och pålitliga över tid.
På Dweve har vi valt denna väg. Vår kombination av orörd arkivdata, certifierade mänskliga källor, symbolisk verifiering och bevarande av mångfald säkerställer att våra modeller förblir kopplade till den verkliga världen. Vi bygger filtret mellan verklighet och simulering.
Den lätta vägen leder till Model Collapse. Den svåra vägen leder till intelligens som faktiskt fungerar. Vi vet vilken vi tar.