Il problema della diluizione dei fatti: perché un'IA accurata al 98% diventa completa assurdità

Current AI systems are come un gioco del telefono senza fili in cui ogni passaggio perde il 2% della verità. Dopo 50 passaggi, resta solo pura...

Il problema della diluizione dei fatti: perché un'IA accurata al 98% diventa completa assurdità

L'esperimento di chimica che spiega perché la tua IA fallisce

Immagina di avere un becher di acqua pura. Qualcuno ti dice di rimuovere esattamente il 2% dell'acqua e di sostituirlo con qualcosa di innocuo. Lo fai una volta, hai ancora il 98% di acqua. Nessun problema.

Ora ripeti quel processo 50 volte. Quanta acqua ti resta?

La risposta dipende interamente dalla domanda a cui stai rispondendo. E questa distinzione è esattamente il motivo per cui la maggior parte dei sistemi di IA attuali diventa completamente inaffidabile nei compiti di ragionamento a più passaggi.

Questa non è una metafora. Questa è matematica. E sta distruggendo progetti di IA in ogni settore.

I due modi di pensare all'errore

Quando le persone parlano di accuratezza dell'IA, di solito pensano a ciò che gli statistici chiamano errore indipendente. Ogni operazione di IA ha una probabilità del 2% di essere sbagliata. L'operazione successiva è indipendente. Ha anch'essa una probabilità del 2% di essere sbagliata.

Con questo modello, dopo 50 operazioni, hai commesso 50 errori indipendenti del 2%. In totale, più o meno un errore. Nessun problema, vero?

Ma non è così che funziona realmente l'IA. I sistemi di IA si basano sugli output precedenti. Ogni passaggio dipende da ciò che è venuto prima. E questo cambia tutto.

In chimica, quando diluisci ripetutamente una soluzione, applichi un fattore di decadimento a ciò che resta. Non sottrai il 2% della concentrazione originale ogni volta. Riduci la concentrazione attuale del 2%.

Sembrano simili. Producono risultati radicalmente diversi.

Un'accuratezza ripetuta del 98% non sottrae dalla verità originale. Continua a ridurre il resto finché la catena non diventa inaffidabile.

L'illusione lineare

Cominciamo dal modo sbagliato di pensarci, perché è così che la maggior parte delle aziende di IA modella realmente i propri sistemi.

Il decadimento lineare presuppone che tu rimuova sempre il 2% della quantità originale. Inizia con il 100% di accuratezza. Passaggio 1: sei al 98%. Passaggio 2: sei al 96%. Dopo 50 passaggi, sei esattamente allo 0%.

Semplice. Prevedibile. E completamente sbagliato per i sistemi di IA.

Questo modello lineare è ciò che porta le aziende a credere che la loro IA sia sicura. Testano l'accuratezza a passaggio singolo, scoprono che è del 98% e presumono che le operazioni a più passaggi degradino in modo lineare. Distribuiscono agenti, catene di ragionamento, query multi-hop. Poi guardano i loro sistemi fallire in modo catastrofico.

Il problema è che gli errori dell'IA non funzionano come lanci di moneta indipendenti. Si accumulano.

La realtà esponenziale

Ecco cosa succede davvero. Ogni operazione di IA preserva il 98% della verità rimasta dall'operazione precedente. Ma, cosa cruciale, quel 98% si applica al resto in diminuzione, non all'originale.

La matematica è un semplice decadimento esponenziale: 0,98 elevato alla potenza di n passaggi.

Ti mostro come appare realmente:

  • Passaggio 0: accuratezza del 100% (verità perfetta)
  • Passaggio 10: accuratezza dell'81,7%
  • Passaggio 25: accuratezza del 60,3%
  • Passaggio 50: accuratezza del 36,4%
  • Passaggio 100: accuratezza del 13,3%
  • Passaggio 228: accuratezza dell'1%
  • Passaggio 342: accuratezza dello 0,1%

Rileggilo. Dopo solo 50 passaggi di ragionamento con un'accuratezza del 98% per passaggio, il tuo sistema ha più probabilità di sbagliare che di avere ragione. Dopo 100 passaggi, sbaglia l'86,7% delle volte. Dopo 228 passaggi, resta a malapena l'1% di verità.

Ecco perché i tuoi agenti AI falliscono. Ecco perché il ragionamento multi-hop produce risultati senza senso. Questa è la base matematica della palla di neve delle allucinazioni.

Accumulo degli errori: tre modelli Come la precisione degrada nei passaggi di ragionamento (2% di errore per passaggio) 0% 25% 50% 75% 100% Precisione 0 25 50 75 100 125 Passaggi di ragionamento Lineare (errato) 50 = 36% 100 = 13% Esponenziale (realtà) 100% poi fallisce Soglia 50% Intuizione critica: la maggior parte delle aziende di IA presuppone un decadimento lineare. La realtà è esponenziale. Dopo 34 passaggi, un'IA con precisione del 98% ha più probabilità di sbagliare che di avere ragione. Dopo 114 passaggi: tasso di fallimento del 90%.
La palla di neve delle allucinazioni è un guasto attivo: il sistema non si limita a trascinare un errore in avanti, costruisce nuove affermazioni attorno a esso.

La soglia dell'inutilità

Ecco una domanda che nessuno nel mondo dell'IA vuole affrontare: a che punto un sistema diventa così inaffidabile da essere di fatto inutile?

La risposta matematica è 34 passaggi. Con una precisione del 98% per passaggio, dopo 34 operazioni di ragionamento il sistema scende sotto il 50% di precisione. È più probabile che sbagli piuttosto che abbia ragione.

Ma la risposta pratica arriva molto prima. Nei sistemi in produzione non puoi tollerare un errore vicino al 50%. Ti serve un'affidabilità del 90% o superiore. Quella soglia viene raggiunta dopo soli 11 passaggi.

Voglio essere esplicito su cosa significa:

  • Catena di ragionamento a 11 passaggi: il 90% dei tuoi output è sbagliato
  • Catena di ragionamento a 34 passaggi: il tuo sistema è peggiore del caso
  • Catena di ragionamento a 50 passaggi: tasso di errore del 63,6%
  • Catena di ragionamento a 100 passaggi: tasso di errore dell'86,7%

Ora considera cosa significa per l'IA agentica. Un tipico flusso di lavoro di un agente potrebbe comprendere: capire il compito (1), scomporlo in passaggi (2), cercare informazioni (3), valutare le fonti (4), sintetizzare i risultati (5), generare la risposta (6), verificare la qualità (7), e così via. Sono già 7 passaggi, e non siamo nemmeno arrivati a compiti complessi.

Le catene di ragionamento multi-hop nella ricerca legale, nella diagnosi medica o nell'analisi finanziaria superano regolarmente i 20 passaggi. Con una precisione del 98% per passaggio, stai guardando un tasso di errore del 33% prima ancora di considerare la complessità.

Non è teoria. È per questo che gli agenti di IA falliscono in produzione.

Il disastro produttivo di cui nessuno parla

Le statistiche sono devastanti, eppure quasi mai riconosciute nei materiali di marketing sull'IA.

Fallimenti dell'IA aziendale: Secondo una ricerca del 2025 del MIT e di Fortune, il 95% dei pilot di IA generativa non riesce a raggiungere la produzione con un impatto aziendale misurabile. Non "fatica a raggiungere la produzione". Fallisce completamente.

Fallimenti specifici degli agenti: Un'analisi di LinkedIn tra professionisti dell'IA mostra che il 95% degli agenti di IA fallisce in produzione. Non perché i modelli non siano abbastanza intelligenti. Perché l'accumulo di errori li rende inaffidabili.

Sistemi multi-agente: La ricerca mostra che quando più agenti collaborano, gli errori si accumulano più velocemente. Se un agente passa informazioni errate a un altro, il secondo agente costruisce sugli errori e il degrado accelera.

L'impatto economico: Le aziende spendono centinaia di milioni in sistemi di IA che fondamentalmente non possono funzionare per i casi d'uso previsti. Una singola implementazione di un agente multi-passaggio può costare milioni da sviluppare, eppure fallire a causa della matematica di base.

Questo è il problema del 98% nella pratica: grande precisione a passaggio singolo, fallimento catastrofico a passaggi multipli.

La realtà dei fallimenti dell'IA in produzione (2025) Cosa promettono le aziende di IA Precisione a passaggio singolo: 98% Risultati sorprendenti nelle demo Capacità multi-agente Automazione di attività complesse Pronto per l'impresa Distribuzione in produzione ROI positivo Valore aziendale garantito Basato su test a passaggio singolo in ambienti controllati La realtà in produzione Il 95% dei progetti pilota fallisce MIT/Fortune 2025 Il 95% degli agenti IA fallisce in produzione (analisi LinkedIn) Più passaggi, più fallimenti L'accumulo di errori distrugge l'affidabilità oltre 10 passaggi Il 42% delle iniziative abbandonate nel 2025 (rispetto al 17%) (ricerca S&P Global) Basato su distribuzione nel mondo reale Realtà

L'effetto palla di neve delle allucinazioni

La ricerca di Zhang et al. (2023) ha identificato quello che chiamano "effetto palla di neve delle allucinazioni". Ecco come funziona: i LLM si impegnano eccessivamente nei primi errori, poi generano ulteriori affermazioni false per giustificare quegli errori. L'errore non si limita a propagarsi. Cresce.

Pensa a cosa significa nel contesto del decadimento esponenziale degli errori. Il tuo primo errore al passaggio 5 non riduce solo la precisione del 2%. Crea una base difettosa per il passaggio 6, che ora ha una probabilità di errore ancora più alta perché si basa su presupposti sbagliati.

Il modello di decadimento esponenziale puro è in realtà ottimistico. In pratica, gli errori si accumulano più velocemente di quanto preveda la matematica, perché ogni errore rende più probabili gli errori successivi.

Ecco perché vediamo casi documentati come:

Il disastro AI di CNET (2023): 41 articoli su 77 scritti dall'AI hanno richiesto correzioni. Questo significa un tasso di errore del 53% nel giornalismo di produzione, dove tassi di errore a una cifra sarebbero inaccettabili.

Errori di diagnosi medica: lo studio JAMA Pediatrics ha rilevato che ChatGPT ha formulato diagnosi errate in oltre l'80% dei casi pediatrici. Non si tratta di "allucinazioni" astratte. Sono errori medici specifici che potrebbero danneggiare i pazienti.

Allucinazioni dell'AI legale: la ricerca Stanford HAI mostra che i modelli di AI legale hanno allucinazioni in 1 query su 6 nei benchmark. Gli avvocati sono stati sanzionati per aver presentato casi falsi generati dall'AI ai tribunali. Più volte. In più paesi.

Errori di Google AI Overview: il sistema ha suggerito di mettere la colla sulla pizza e di mangiare sassi ogni giorno. Non sono casi limite. Sono ciò che accade quando l'accumulo di errori incontra la fiducia senza verifica.

La trappola della verifica

Ecco la parte ironica. Sappiamo che i LLM possono identificare i propri errori. La ricerca mostra che ChatGPT identifica il 67% dei suoi errori, GPT-4 ne identifica l'87%. I modelli sanno quando sbagliano.

Ma continuano a impegnarsi nelle allucinazioni. Generano affermazioni false per giustificare gli errori iniziali. Si impegnano eccessivamente negli errori nonostante abbiano la capacità di riconoscerli.

Ecco perché una semplice verifica non risolve il problema. Aggiungere un passaggio di "controlla il tuo lavoro" non aiuta quando il sistema è incentivato a difendere i suoi output precedenti piuttosto che correggerli.

Il passaggio di verifica stesso diventa un altro passaggio nella catena di ragionamento. Un altro errore del 2%. Un'altra opportunità per la palla di neve di crescere.

Perché gli approcci attuali non possono risolvere questo problema

La risposta dell'industria dell'AI all'accumulo di errori è stata quella di provare più duramente. Più dati di addestramento. Migliore fine-tuning. Prompting intelligente. Ragionamento a catena di pensiero. Passaggi di verifica.

Niente di tutto ciò affronta il problema matematico fondamentale.

Più addestramento non aiuta: una migliore precisione a passaggio singolo non cambia il decadimento esponenziale. Una precisione del 99% sposta solo la soglia da 34 passaggi a 69 passaggi. Il 99,5% la sposta a 138 passaggi. Nel frattempo, stai spendendo esponenzialmente più potenza di calcolo per guadagni marginali.

Un prompting migliore non aiuta: le strategie di prompting stanno essenzialmente cercando di combattere la matematica con il linguaggio naturale. Non puoi uscire da (0,98)ⁿ con il prompting.

La verifica aggrava il problema: ogni passaggio di verifica è un'altra operazione con la propria probabilità di errore. Stai aggiungendo passaggi per combattere il problema causato dall'avere troppi passaggi.

I metodi ensemble aiutano ma non risolvono: la ricerca mostra che i metodi di auto-consistenza possono migliorare la precisione fino a 17,9 punti percentuali nei problemi di matematica. Ma questo avviene al costo di 40× più calcolo. E non elimina il decadimento esponenziale. Sposta solo leggermente la curva.

Il problema fondamentale non è la qualità dell'addestramento o la strategia di prompting. È che le reti neurali a virgola mobile sono fondamentalmente probabilistiche. Ogni operazione introduce incertezza. L'incertezza si accumula. Non c'è modo di aggirare questa matematica.

La verifica aiuta solo quando riesce a spezzare il ciclo di ragionamento. Altrimenti aggiunge un'altra operazione incerta alla catena che dovrebbe riparare.

La soluzione basata sui vincoli

I sistemi di IA basati sui vincoli non seguono il modello del decadimento esponenziale. Ecco perché.

Operazioni deterministiche: Il nostro approccio usa operazioni discrete. XNOR, POPCNT, AND logico, OR. Queste operazioni sono deterministiche. Stesso input, stesso output. Ogni singola volta.

Nessun errore di arrotondamento: I valori binari sono esatti. +1 o -1. Nessuna approssimazione a virgola mobile. Nessun errore di arrotondamento accumulato.

Soddisfacimento dei vincoli: I nostri sistemi lavorano con vincoli, non con probabilità. Un vincolo è soddisfatto oppure no. Non esiste un soddisfacimento al 98%. Esiste soddisfatto (100%) o violato (0%).

Vincoli cristallizzati: Nell'approccio di Dweve, una volta che un vincolo viene scoperto e cristallizzato, si applica in modo deterministico. La centesima applicazione di un vincolo è affidabile quanto la prima. Nessun decadimento. Nessun errore accumulato.

Ecco perché i sistemi basati sui vincoli possono gestire il ragionamento multi-hop senza degrado. Ogni passaggio verifica i vincoli cristallizzati. Il passaggio 10 è affidabile quanto il passaggio 1. Il passaggio 100 è affidabile quanto il passaggio 1.

La curva degli errori non assomiglia a un decadimento esponenziale. Assomiglia a una funzione a gradino: accuratezza al 100% finché non si raggiunge un confine di vincolo, poi 0% (errore rilevabile). Nessuna zona grigia. Nessun decadimento graduale nell'assurdità.

Tradizionale vs Basato su Vincoli: Affidabilità nel Tempo Come il ragionamento multi-step degrada in diverse architetture 0% 25% 50% 75% 100% Affidabilità 0 25 50 75 100 125 Passi di Ragionamento Passo 25: 60% Passo 75: 22% Reti Tradizionali Decadimento graduale verso l'inaffidabilità Passo 700: Fallimento Passo 400: 100% Passo 100: 100% Dweve Basato su Vincoli 100% affidabile fino al limite Dweve: 100% affidabile per oltre 700 passi

L'angolo normativo

I regolatori europei comprendono questo problema meglio di quanto le aziende tecnologiche americane vogliano ammettere.

L'AI Act dell'UE non impone solo l'accuratezza. Impone la spiegabilità e la verificabilità. Devi spiegare perché la tua IA ha preso una decisione specifica. Devi dimostrare che funziona correttamente.

Come si dimostra che un sistema funziona correttamente quando la sua affidabilità decade esponenzialmente con la profondità del ragionamento?

Non puoi.

Per questo il diritto alla spiegazione dell'Articolo 22 del GDPR e i requisiti di trasparenza dell'AI Act dell'UE favoriscono fondamentalmente gli approcci basati su vincoli. Quando una decisione è il risultato della soddisfazione di vincoli, puoi spiegarla. Ecco il vincolo A, il vincolo B, il vincolo C. Tutti soddisfatti. L'output segue logicamente.

Quando una decisione è l'output di 50 operazioni probabilistiche, ciascuna delle quali amplifica l'incertezza della precedente? Non puoi spiegarla. Non puoi nemmeno riprodurla in modo affidabile.

Non è un onere di conformità. È la matematica che raggiunge le affermazioni di marketing.

L'implicazione per il business

Ecco cosa significa il decadimento esponenziale dell'errore per l'IA nel business:

Compiti semplici: Le operazioni a passaggio singolo funzionano bene. Classificazione, risposta a domande di base, recupero semplice. Un'accuratezza del 98% è davvero utile qui.

Complessità media: Le operazioni multi-passaggio ma limitate sono rischiose. Puoi probabilmente gestire 5-10 passaggi se sei attento. Ma ti stai avvicinando alla soglia in cui gli errori si accumulano più velocemente di quanto il valore venga creato.

Complessità elevata: Catene di ragionamento profondo, flussi di lavoro tra agenti, query multi-hop sono matematicamente irrealizzabili con approcci probabilistici a virgola mobile. Il sistema fallirà. Non è una questione di se, ma di quando.

Questo spiega perché il 95% dei progetti pilota di IA aziendale fallisce. Le aziende cercano di risolvere problemi che richiedono 20, 50, 100 passaggi di ragionamento usando sistemi che diventano inaffidabili dopo 11.

Alla matematica non importa del tuo caso d'uso. Non le importa del tuo budget. Non le importa della tua tabella di marcia ambiziosa. (0,98)ⁿ tende a zero indipendentemente dalle intenzioni.

La strada da percorrere

Abbiamo identificato il problema. L'accumulo esponenziale di errori rende le reti neurali a virgola mobile inadatte al ragionamento multi-passaggio. La matematica è chiara. I fallimenti produttivi sono documentati. I costi economici sono misurabili.

La soluzione è altrettanto chiara: abbiamo bisogno di sistemi di IA che non soffrano di decadimento esponenziale.

L'IA basata su vincoli fornisce esattamente questo. Operazioni deterministiche. Vincoli cristallizzati. Nessun errore accumulato. Ragionamento multi-hop senza degrado.

Non è speculativo. È ciò che stiamo costruendo in Dweve. Core fornisce il framework algoritmico binario. Loom implementa 456 specialisti di dominio basati su vincoli. Nexus fornisce il livello di orchestrazione multi-agente. Ogni operazione è matematicamente esatta. Ogni decisione è riconducibile a vincoli specifici.

Il risultato: sistemi di IA che rimangono affidabili attraverso centinaia di passaggi di ragionamento. Non 98% di accuratezza al passaggio 1 e 36% al passaggio 50. 100% di accuratezza al passaggio 1, al passaggio 50 e al passaggio 500.

Fino a quando non viene raggiunto il confine dei vincoli, l'affidabilità è assoluta. Al confine, il fallimento è rilevabile. Il sistema sa quando non sa. Non è un bug. È sicurezza.

Cosa devi ricordare

  • L'accumulo di errori è esponenziale, non lineare. Ogni operazione AI multi-step amplifica gli errori precedenti. Una precisione del 98% per passaggio diventa un successo del 13% dopo 100 passaggi.
  • La soglia dell'inutilità viene raggiunta rapidamente. Con una precisione del 98% per passaggio, i sistemi scendono sotto il 50% di affidabilità dopo soli 34 passaggi. In pratica, la soglia è di circa 11 passaggi per un'affidabilità del 90%.
  • Le allucinazioni si accumulano, non si limitano a propagarsi. Gli LLM si fossilizzano sui primi errori e generano ulteriori affermazioni false per giustificarli. L'accumulo di errori accelera oltre il puro decadimento esponenziale.
  • I tassi di fallimento in produzione sono catastrofici. Il 95% dei piloti di AI generativa non arriva in produzione. Il 95% degli agenti AI fallisce in fase di implementazione. Non è ingegneria scadente. È matematica sbagliata.
  • La verifica non risolve il problema. Aggiungere passaggi di verifica introduce più operazioni con le proprie probabilità di errore. Stai combattendo il decadimento esponenziale con altro decadimento esponenziale.
  • I sistemi basati su vincoli non soffrono di decadimento esponenziale. Le operazioni deterministiche e i vincoli cristallizzati fanno sì che il passaggio 100 sia affidabile quanto il passaggio 1. Nessun errore accumulato. Nessuna zona grigia.
  • Le normative europee favoriscono la certezza matematica. I requisiti di spiegabilità e verificabilità dell'AI Act dell'UE si allineano con gli approcci basati su vincoli e confliggono con le scatole nere probabilistiche.
Il contenimento basato su vincoli cambia la modalità di errore: il sistema preserva un percorso di prova tracciabile oppure si ferma a un confine visibile.

Il punto fondamentale

Il problema del 98% è reale, misurabile e sta distruggendo i progetti AI in ogni settore. Quando ogni operazione perde il 2% di verità e gli errori si accumulano attraverso i passaggi di ragionamento, i sistemi sono matematicamente destinati a fallire.

Non si tratta di migliori dati di addestramento o di prompt più intelligenti. Si tratta della matematica fondamentale delle reti neurali a virgola mobile rispetto al ragionamento basato su vincoli.

Gli approcci tradizionali seguono un decadimento esponenziale: (0.98)ⁿ si avvicina a zero man mano che n aumenta. Non c'è modo di aggirarlo. È insito nella matematica.

Gli approcci basati su vincoli funzionano diversamente. Operazioni deterministiche. Vincoli cristallizzati. Il passaggio 500 è affidabile quanto il passaggio 1. La curva di errore è una funzione a gradino, non un decadimento esponenziale.

Il settore si sta lentamente rendendo conto di questa realtà. Le aziende spendono centinaia di milioni in sistemi matematicamente destinati a fallire. Il tasso di fallimento del 95% in produzione non è misterioso. È prevedibile.

Le aziende AI europee che costruiscono su fondamenta basate su vincoli non sono in svantaggio. Stanno risolvendo il problema reale mentre le aziende americane raddoppiano su una matematica imperfetta.

Il futuro dell'AI affidabile non è più potenza di calcolo, modelli più grandi o prompt più ingegnosi. Sono i sistemi basati su vincoli con vincoli cristallizzati. Certezza matematica invece di confidenza statistica. Affidabilità dimostrabile invece di decadimento esponenziale.

Vuoi un'AI che non degeneri in sciocchezze? Il framework basato su vincoli di Dweve Core offre un ragionamento multi-step deterministico. Nessun accumulo esponenziale di errori. Nessuna valanga di allucinazioni. Solo matematica che funziona. Unisciti alla nostra lista d'attesa.