Prečo sa 98 % presná AI zmení na úplný nezmysel: problém rozriedenia faktov
Chemický experiment, ktorý vysvetľuje, prečo váš AI zlyháva
Predstavte si, že máte kadičku s čistou vodou. Niekto vám povie, aby ste odstránili presne 2 % vody a nahradili ju niečím neškodným. Urobíte to raz, stále máte 98 % vody. Žiadny problém.
Teraz tento postup zopakujte 50-krát. Koľko vody vám zostane?
Odpoveď závisí výlučne od toho, na ktorú otázku odpovedáte. A práve tento rozdiel je dôvodom, prečo sa väčšina súčasných systémov AI stáva úplne nespoľahlivou pri úlohách s viacstupňovým uvažovaním.
Toto nie je metafora. Toto je matematika. A ničí projekty AI vo všetkých odvetviach.
Dva spôsoby, ako premýšľať o chybách
Keď ľudia hovoria o presnosti AI, zvyčajne myslia na to, čo štatistici nazývajú nezávislou chybou. Každá operácia AI má 2 % šancu, že bude chybná. Ďalšia operácia je nezávislá. Má tiež 2 % šancu, že bude chybná.
Podľa tohto modelu po 50 operáciách urobíte 50 nezávislých 2 % chýb. To je zhruba jedna chyba celkovo. Žiadny problém, však?
Ale takto AI v skutočnosti nefunguje. Systémy AI stavajú na predchádzajúcich výstupoch. Každý krok závisí od toho, čo prišlo pred ním. A to mení všetko.
V chémii, keď opakovane riedite roztok, aplikujete faktor poklesu na to, čo zostalo. Neodpočítavate 2 % pôvodnej koncentrácie zakaždým. Znižujete aktuálnu koncentráciu o 2 %.
Znie to podobne. Výsledky sú radikálne odlišné.
Lineárna ilúzia
Začnime s nesprávnym spôsobom uvažovania, pretože takto väčšina spoločností AI v skutočnosti modeluje svoje systémy.
Lineárny pokles predpokladá, že vždy odstraňujete 2 % pôvodného množstva. Začnite so 100 % presnosťou. Krok 1: ste na 98 %. Krok 2: ste na 96 %. Po 50 krokoch ste presne na 0 %.
Jednoduché. Predvídateľné. A úplne nesprávne pre systémy AI.
Práve tento lineárny model vedie spoločnosti k presvedčeniu, že ich AI je bezpečná. Otestujú presnosť jedného kroku, zistia, že je 98 %, a predpokladajú, že viacstupňové operácie budú degradovať lineárne. Nasadia agentov, reťazce uvažovania, viacstupňové dopyty. Potom sledujú, ako ich systémy katastrofálne zlyhávajú.
Problém je, že chyby AI nefungujú ako nezávislé hody mincou. Kumulujú sa.
Exponenciálna realita
Tu je to, čo sa skutočne deje. Každá operácia AI zachová 98 % pravdy, ktorá zostala z predchádzajúcej operácie. Ale kľúčové je, že tých 98 % sa vzťahuje na zmenšujúci sa zvyšok, nie na pôvod.
Matematika je jednoduchý exponenciálny pokles: 0,98 na mocninu n krokov.
Ukážem vám, ako to v skutočnosti vyzerá:
- Krok 0: 100 % presnosť (dokonalá pravda)
- Krok 10: 81,7 % presnosť
- Krok 25: 60,3 % presnosť
- Krok 50: 36,4 % presnosť
- Krok 100: 13,3 % presnosť
- Krok 228: 1 % presnosť
- Krok 342: 0,1 % presnosť
Prečítajte si to znova. Po iba 50 krokoch uvažovania s 98 % presnosťou na krok má váš systém väčšiu pravdepodobnosť, že bude nesprávny, ako správny. Po 100 krokoch je nesprávny v 86,7 % prípadov. Po 228 krokoch zostáva sotva 1 % pravdy.
Preto vaše AI agenti zlyhávajú. Preto multi-hop uvažovanie produkuje nezmysly. Toto je matematický základ snehovej gule halucinácií.
Hranica nepoužiteľnosti
Tu je otázka, na ktorú nikto v oblasti umelej inteligencie nechce odpovedať: v akom bode sa systém stane natoľko nespoľahlivým, že je v podstate nepoužiteľný?
Matematická odpoveď je 34 krokov. Pri 98% presnosti na krok je systém po 34 logických operáciách pod 50% presnosťou. Je pravdepodobnejšie, že sa mýli, ako že má pravdu.
Praktická odpoveď však prichádza oveľa skôr. V produkčných systémoch si nemôžete dovoliť nič blízke 50% chybovosti. Potrebujete spoľahlivosť 90% alebo vyššiu. Táto hranica sa dosiahne už po 11 krokoch.
Dovoľte mi byť presný v tom, čo to znamená:
- Reťazec uvažovania s 11 krokmi: 90% vašich výstupov je chybných
- Reťazec uvažovania s 34 krokmi: váš systém je horší ako náhoda
- Reťazec uvažovania s 50 krokmi: 63,6% miera zlyhania
- Reťazec uvažovania so 100 krokmi: 86,7% miera zlyhania
Teraz zvážte, čo to znamená pre agentickú AI. Typický pracovný postup agenta môže zahŕňať: pochopenie úlohy (1), rozdelenie na kroky (2), vyhľadanie informácií (3), vyhodnotenie zdrojov (4), syntézu zistení (5), generovanie odpovede (6), overenie kvality (7) a tak ďalej. To je už 7 krokov a ešte sme sa ani nedostali k zložitým úlohám.
Viacúrovňové reťazce uvažovania v právnom výskume, lekárskej diagnostike alebo finančnej analýze bežne presahujú 20 krokov. Pri 98% presnosti na krok sa pozeráte na 33% zlyhanie skôr, než vôbec zohľadníte zložitosť.
Toto nie je teória. Toto je dôvod, prečo agenti AI zlyhávajú v produkcii.
Produkčná katastrofa, o ktorej nikto nehovorí
Štatistiky sú zničujúce, no v marketingových materiáloch o AI sa takmer nikdy neuvádzajú.
Zlyhania podnikovej AI: Podľa výskumu z roku 2025 od MIT a Fortune sa 95% pilotných projektov generatívnej AI nedostane do produkcie s merateľným obchodným dopadom. Nie „snažia sa dostať do produkcie“. Úplne zlyhajú.
Zlyhania špecifické pre agentov: Analýza LinkedIn od odborníkov na AI ukazuje, že 95% agentov AI zlyháva v produkcii. Nie preto, že modely nie sú dostatočne inteligentné. Pretože akumulácia chýb ich robí nespoľahlivými.
Systémy s viacerými agentmi: Výskum ukazuje, že keď spolupracuje viac agentov, chyby sa znásobujú rýchlejšie. Ak jeden agent odovzdá druhému chybné informácie, druhý agent stavia na chybách a degradácia sa zrýchľuje.
Ekonomický dopad: Spoločnosti míňajú stovky miliónov na systémy AI, ktoré v podstate nemôžu fungovať pre zamýšľané prípady použitia. Jedno nasadenie agenta s viacerými krokmi môže stáť milióny na vývoj, a napriek tomu zlyhá kvôli základnej matematike.
Toto je problém 98% v praxi: skvelá presnosť na jeden krok, katastrofálne zlyhanie pri viacerých krokoch.
Efekt snehovej gule pri halucináciách
Výskum Zhanga a kolektívu (2023) identifikoval to, čo nazývajú „halucinačná snehová guľa". Funguje to takto: LLM sa príliš upnú na skoré chyby a potom generujú ďalšie nepravdivé tvrdenia, aby tieto chyby ospravedlnili. Chyba sa nešíri len ďalej. Ona rastie.
Zamyslite sa, čo to znamená v kontexte exponenciálneho úpadku chýb. Vaša prvá chyba v kroku 5 nezníži presnosť len o 2 %. Vytvorí chybný základ pre krok 6, ktorý má teraz ešte vyššiu pravdepodobnosť chyby, pretože stavia na nesprávnych predpokladoch.
Čistý model exponenciálneho úpadku je v skutočnosti optimistický. V praxi sa chyby hromadia rýchlejšie, než predpovedá matematika, pretože každá chyba zvyšuje pravdepodobnosť ďalších chýb.
Preto vidíme zdokumentované prípady, ako sú:
AI katastrofa CNET (2023): 41 zo 77 článkov napísaných AI si vyžiadalo opravy. To je 53 % miera chybovosti v produkčnej žurnalistike, kde by jednociferná miera chybovosti bola neprijateľná.
Zlyhania v lekárskej diagnostike: Štúdia JAMA Pediatrics zistila, že ChatGPT stanovil nesprávne diagnózy vo viac ako 80 % pediatrických prípadov. Toto nie je „halucinácia" v abstraktnom zmysle. Sú to konkrétne lekárske chyby, ktoré môžu poškodiť pacientov.
Právne AI halucinácie: Výskum Stanford HAI ukazuje, že právne modely AI halucinujú v 1 zo 6 benchmarkových otázok. Právnici boli sankcionovaní za predkladanie fiktívnych prípadov vytvorených AI súdom. Viackrát. Vo viacerých krajinách.
Zlyhania Google AI Overview: Systém navrhoval dávať lepidlo na pizzu a jesť kamene denne. Toto nie sú okrajové prípady. Toto sa stane, keď sa hromadenie chýb stretne so sebavedomím bez overenia.
Pasca overovania
Tu je tá irónia. Vieme, že LLM dokážu identifikovať vlastné chyby. Výskum ukazuje, že ChatGPT identifikuje 67 % svojich chýb, GPT-4 identifikuje 87 %. Modely vedia, kedy sa mýlia.
Napriek tomu sa k halucináciám priznajú. Generujú nepravdivé tvrdenia, aby ospravedlnili počiatočné chyby. Upnú sa na chyby napriek tomu, že majú schopnosť ich rozpoznať.
Preto jednoduché overovanie problém nerieši. Pridanie kroku „skontroluj svoju prácu" nepomôže, keď je systém motivovaný brániť svoje predchádzajúce výstupy namiesto ich opravy.
Krok overovania sa sám stáva ďalším krokom v reťazci uvažovania. Ďalšie 2 % chyby. Ďalšia príležitosť pre snehovú guľu rásť.
Prečo to súčasné prístupy nedokážu opraviť
Reakciou odvetvia AI na hromadenie chýb bolo snažiť sa viac. Viac tréningových dát. Lepšie doladenie. Dômyselné promptovanie. Reťazové uvažovanie. Kroky overovania.
Nič z toho nerieši základný matematický problém.
Viac tréningu nepomáha: Lepšia presnosť jednotlivých krokov nemení exponenciálny úpadok. 99 % presnosť len posúva hranicu z 34 krokov na 69 krokov. 99,5 % ju posúva na 138 krokov. Medzitým míňate exponenciálne viac výpočtového výkonu za marginálne zisky.
Lepšie promptovanie nepomáha: Promptovacie stratégie sú v podstate pokusom bojovať s matematikou pomocou prirodzeného jazyka. Nemôžete sa vypromptovať z (0,98)ⁿ.
Overovanie problém zhoršuje: Každý krok overovania je ďalšou operáciou s vlastnou pravdepodobnosťou chyby. Pridávate kroky, aby ste bojovali s problémom spôsobeným príliš mnohými krokmi.
Ensemble metódy pomáhajú, ale neriešia to: Výskum ukazuje, že metódy sebakonzistencie môžu zlepšiť presnosť až o 17,9 percentuálneho bodu pri matematických úlohách. Ale to prichádza za cenu 40× väčšieho výpočtového výkonu. A neodstraňuje to exponenciálny úpadok. Len to mierne posúva krivku.
Základný problém nie je kvalita tréningu ani stratégia promptovania. Problém je v tom, že neuronové siete s pohyblivou rádovou čiarkou sú vo svojej podstate pravdepodobnostné. Každá operácia vnáša neistotu. Neistota sa kumuluje. Z tejto matematiky niet úniku.
Riešenie založené na obmedzeniach
Systémy umelej inteligencie založené na obmedzeniach sa neriadia modelom exponenciálneho poklesu. Tu je dôvod.
Deterministické operácie: Náš prístup využíva diskrétne operácie. XNOR, POPCNT, logické AND, OR. Tieto operácie sú deterministické. Rovnaký vstup, rovnaký výstup. Zakaždým.
Žiadne chyby zaokrúhľovania: Binárne hodnoty sú presné. +1 alebo -1. Žiadna aproximácia s pohyblivou rádovou čiarkou. Žiadna kumulovaná chyba zaokrúhľovania.
Spĺňanie obmedzení: Naše systémy pracujú s obmedzeniami, nie s pravdepodobnosťami. Obmedzenie je buď splnené, alebo nie. Neexistuje 98 % splnenie. Existuje splnené (100 %) alebo porušené (0 %).
Vy kryštalizované obmedzenia: V prístupe Dweve, akonáhle je obmedzenie objavené a vy kryštalizované, uplatňuje sa deterministicky. Sté použitie obmedzenia je rovnako spoľahlivé ako prvé. Žiadny pokles. Žiadna kumulovaná chyba.
Preto systémy založené na obmedzeniach zvládajú viackrokové uvažovanie bez degradácie. Každý krok sa kontroluje proti vy kryštalizovaným obmedzeniam. Krok 10 je rovnako spoľahlivý ako krok 1. Krok 100 je rovnako spoľahlivý ako krok 1.
Krivka chybovosti nevyzerá ako exponenciálny pokles. Vyzerá ako kroková funkcia: 100 % presnosť, až kým sa nenarazí na hranicu obmedzenia, potom 0 % (zistiteľné zlyhanie). Žiadne sivé zóny. Žiadny postupný pokles do nezmyslov.
Regulačný uhol pohľadu
Európski regulátori chápu tento problém lepšie, než chcú americké technologické spoločnosti priznať.
Akt EÚ o umelej inteligencii nevyžaduje len presnosť. Vyžaduje vysvetliteľnosť a auditovateľnosť. Musíte vysvetliť, prečo vaša AI prijala konkrétne rozhodnutie. Musíte dokázať, že funguje správne.
Ako dokážete, že systém funguje správne, keď jeho spoľahlivosť exponenciálne klesá s hĺbkou uvažovania?
Nemôžete.
Preto článok 22 GDPR o práve na vysvetlenie a požiadavky Aktu EÚ o umelej inteligencii na transparentnosť zásadne zvýhodňujú prístupy založené na obmedzeniach. Keď je rozhodnutie výsledkom splnenia obmedzení, môžete ho vysvetliť. Tu je obmedzenie A, obmedzenie B, obmedzenie C. Všetky splnené. Výstup logicky vyplýva.
Keď je rozhodnutie výstupom 50 pravdepodobnostných operácií, pričom každá znásobuje neistotu tej predchádzajúcej? To neviete vysvetliť. Neviete to ani spoľahlivo zopakovať.
Toto nie je záťaž v oblasti dodržiavania predpisov. Toto je matematika, ktorá doháňa marketingové tvrdenia.
Obchodný dôsledok
Tu je, čo exponenciálny nárast chýb znamená pre AI v podnikaní:
Jednoduché úlohy: Jednokrokové operácie fungujú dobre. Klasifikácia, základné zodpovedanie otázok, jednoduché vyhľadávanie. Presnosť 98 % je tu skutočne užitočná.
Stredná zložitosť: Viackrokové, ale ohraničené operácie sú rizikové. Pravdepodobne zvládnete 5 až 10 krokov, ak budete opatrní. Blížite sa však k hranici, kde sa chyby hromadia rýchlejšie, než vzniká hodnota.
Vysoká zložitosť: Hlboké reťazce uvažovania, pracovné postupy agentov a dotazy s viacerými krokmi sú matematicky nerealizovateľné s prístupmi založenými na pohyblivej rádovej čiarke a pravdepodobnosti. Systém zlyhá. Nie je otázka či, ale kedy.
To vysvetľuje, prečo 95 % podnikových pilotných projektov AI zlyhá. Spoločnosti sa snažia vyriešiť problémy, ktoré si vyžadujú 20, 50, 100 krokov uvažovania, pomocou systémov, ktoré sa stanú nespoľahlivými po 11 krokoch.
Matematike je jedno, na čo systém používate. Je jej jedno, aký máte rozpočet. Je jej jedno, aký máte ambiciózny plán. (0,98)ⁿ klesá k nule bez ohľadu na zámery.
Cesta vpred
Identifikovali sme problém. Exponenciálne hromadenie chýb robí neurónové siete s pohyblivou rádovou čiarkou nevhodnými na viackrokové uvažovanie. Matematika je jasná. Zlyhania vo výrobe sú zdokumentované. Ekonomické náklady sú merateľné.
Riešenie je rovnako jasné: potrebujeme systémy AI, ktoré netrpia exponenciálnym poklesom.
AI založená na obmedzeniach poskytuje presne toto. Deterministické operácie. Vy kryštalizované obmedzenia. Žiadne nahromadené chyby. Viackrokové uvažovanie bez degradácie.
Toto nie je špekulácia. Toto je to, čo budujeme v Dweve. Core poskytuje rámec binárnych algoritmov. Loom implementuje 456 doménových špecialistov založených na obmedzeniach. Nexus poskytuje vrstvu orchestrácie viacerých agentov. Každá operácia je matematicky presná. Každé rozhodnutie je vystopovateľné ku konkrétnym obmedzeniam.
Výsledok: systémy AI, ktoré zostávajú spoľahlivé naprieč stovkami krokov uvažovania. Nie 98 % presnosť v kroku 1 a 36 % presnosť v kroku 50. 100 % presnosť v kroku 1, v kroku 50 aj v kroku 500.
Kým sa nedosiahne hranica obmedzení, spoľahlivosť je absolútna. Na hranici je zlyhanie zistiteľné. Systém vie, keď nevie. To nie je chyba. To je bezpečnosť.
Čo si potrebujete zapamätať
- Akumulácia chýb je exponenciálna, nie lineárna. Každá viackroková AI operácia znásobuje predchádzajúce chyby. Presnosť 98 % na krok znamená po 100 krokoch úspešnosť iba 13 %.
- Hranica nepoužiteľnosti prichádza rýchlo. Pri presnosti 98 % na krok klesne spoľahlivosť systému pod 50 % už po 34 krokoch. Pre praktické účely je hranica približne 11 krokov pre 90 % spoľahlivosť.
- Halucinácie sa lavínovito zväčšujú, nielen šíria. LLM sa nadmerne upínajú na skoré chyby a generujú ďalšie nepravdivé tvrdenia, aby ich ospravedlnili. Akumulácia chýb sa zrýchľuje nad rámec čistého exponenciálneho poklesu.
- Miera zlyhania vo výrobe je katastrofálna. 95 % pilotných projektov generatívnej AI sa nedostane do výroby. 95 % AI agentov zlyhá pri nasadení. Toto nie je zlé inžinierstvo. Je to zlá matematika.
- Verifikácia problém nerieši. Pridanie verifikačných krokov pridáva ďalšie operácie s vlastnými pravdepodobnosťami chýb. Bojujete proti exponenciálnemu poklesu ďalším exponenciálnym poklesom.
- Systémy založené na obmedzeniach netrpia exponenciálnym poklesom. Deterministické operácie a kryštalizované obmedzenia znamenajú, že krok 100 je rovnako spoľahlivý ako krok 1. Žiadna akumulácia chýb. Žiadne sivé zóny.
- Európske regulácie uprednostňujú matematickú istotu. Požiadavky na vysvetliteľnosť a auditovateľnosť v AI akte EÚ sú v súlade s prístupmi založenými na obmedzeniach a sú v konflikte s pravdepodobnostnými čiernymi skrinkami.
Spodný riadok
Problém 98 % je skutočný, merateľný a ničí AI projekty v každom odvetví. Keď každá operácia stratí 2 % pravdy a chyby sa kumulujú naprieč krokmi uvažovania, systémy sú matematicky zaručene odsúdené na zlyhanie.
Nejde o lepšie tréningové dáta alebo múdrejšie výzvy. Ide o základnú matematiku neurónových sietí s pohyblivou rádovou čiarkou v porovnaní s uvažovaním založeným na obmedzeniach.
Tradičné prístupy sledujú exponenciálny pokles: (0,98)ⁿ sa blíži k nule, keď n rastie. Neexistuje žiadna cesta okolo tohto. Je to vstavané do matematiky.
Prístupy založené na obmedzeniach fungujú inak. Deterministické operácie. Kryštalizované obmedzenia. Krok 500 je rovnako spoľahlivý ako krok 1. Krivka chýb je kroková funkcia, nie exponenciálny pokles.
Odvetvie si túto realitu pomaly uvedomuje. Spoločnosti míňajú stovky miliónov na systémy, ktoré sú matematicky zaručene odsúdené na zlyhanie. 95 % miera zlyhania vo výrobe nie je záhadná. Je predvídateľná.
Európske AI spoločnosti budujúce na základoch založených na obmedzeniach nie sú v nevýhode. Riešia skutočný problém, zatiaľ čo americké spoločnosti zdvojnásobujú svoje stávky na chybnú matematiku.
Budúcnosť spoľahlivej AI nie je viac výpočtového výkonu, väčšie modely alebo múdrejšie výzvy. Sú to systémy založené na obmedzeniach s kryštalizovanými obmedzeniami. Matematická istota namiesto štatistickej dôvery. Dokázateľná spoľahlivosť namiesto exponenciálneho poklesu.
Chcete AI, ktorá sa nerozpadne na nezmysly? Rámec Dweve Core založený na obmedzeniach poskytuje deterministické viackrokové uvažovanie. Žiadna exponenciálna akumulácia chýb. Žiadne lavínovité halucinácie. Len matematika, ktorá funguje. Pripojte sa do nášho zoznamu čakateľov.