El problema de la dilución de los hechos: por qué una IA con un 98 % de precisión acaba siendo un completo sinsentido
El experimento de química que explica por qué falla tu IA
Imagina que tienes un vaso de precipitados con agua pura. Alguien te dice que elimines exactamente el 2% del agua y lo sustituyas por algo inofensivo. Lo haces una vez y todavía tienes un 98% de agua. Sin problema.
Ahora repite ese proceso 50 veces. ¿Cuánta agua te queda?
La respuesta depende por completo de qué pregunta estés respondiendo. Y esa distinción es exactamente la razón por la que la mayoría de los sistemas de IA actuales se vuelven completamente poco fiables en tareas de razonamiento de varios pasos.
Esto no es una metáfora. Son matemáticas. Y está destruyendo proyectos de IA en todos los sectores.
Las dos formas de pensar sobre el error
Cuando la gente habla de la precisión de la IA, suele pensar en lo que los estadísticos llaman error independiente. Cada operación de IA tiene un 2% de probabilidades de ser incorrecta. La siguiente operación es independiente. También tiene un 2% de probabilidades de ser incorrecta.
Con este modelo, después de 50 operaciones, has cometido 50 errores independientes del 2%. Eso es aproximadamente un error en total. No es para tanto, ¿verdad?
Pero así no funciona realmente la IA. Los sistemas de IA se basan en resultados anteriores. Cada paso depende de lo que ha ocurrido antes. Y eso lo cambia todo.
En química, cuando diluyes una solución repetidamente, aplicas un factor de decaimiento a lo que queda. No restas un 2% de la concentración original cada vez. Reduces la concentración actual en un 2%.
Suenan parecido. Producen resultados radicalmente distintos.
La ilusión lineal
Empecemos con la forma incorrecta de pensar en ello, porque así es como la mayoría de las empresas de IA modelan realmente sus sistemas.
El decaimiento lineal supone que siempre eliminas el 2% de la cantidad original. Empiezas con un 100% de precisión. Paso 1: estás en el 98%. Paso 2: estás en el 96%. Después de 50 pasos, estás exactamente en el 0%.
Sencillo. Predecible. Y completamente erróneo para los sistemas de IA.
Este modelo lineal es lo que lleva a las empresas a creer que su IA es segura. Prueban la precisión de un solo paso, comprueban que es del 98% y asumen que las operaciones de varios pasos se degradarán de forma lineal. Despliegan agentes, cadenas de razonamiento, consultas de varios saltos. Y luego ven cómo sus sistemas fallan de forma catastrófica.
El problema es que los errores de la IA no funcionan como lanzamientos de moneda independientes. Se acumulan.
La realidad exponencial
Esto es lo que ocurre en realidad. Cada operación de IA conserva el 98% de la verdad que quedaba de la operación anterior. Pero, crucialmente, ese 98% se aplica sobre el resto decreciente, no sobre el original.
Las matemáticas son un simple decaimiento exponencial: 0,98 elevado a n pasos.
Déjame mostrarte cómo se ve esto en la práctica:
- Paso 0: 100% de precisión (verdad perfecta)
- Paso 10: 81,7% de precisión
- Paso 25: 60,3% de precisión
- Paso 50: 36,4% de precisión
- Paso 100: 13,3% de precisión
- Paso 228: 1% de precisión
- Paso 342: 0,1% de precisión
Vuelve a leerlo. Después de solo 50 pasos de razonamiento con una precisión del 98% por paso, tu sistema tiene más probabilidades de equivocarse que de acertar. Después de 100 pasos, falla el 86,7% de las veces. Después de 228 pasos, apenas queda un 1% de verdad.
Por eso fallan tus agentes de IA. Por eso el razonamiento de múltiples pasos produce disparates. Esta es la base matemática de la bola de nieve de las alucinaciones.
El umbral de la inutilidad
Esta es una pregunta que nadie en el mundo de la IA quiere responder: ¿en qué momento un sistema se vuelve tan poco fiable que resulta efectivamente inútil?
La respuesta matemática es 34 pasos. Con una precisión del 98% por paso, tras 34 operaciones de razonamiento, el sistema cae por debajo del 50% de precisión. Es más probable que se equivoque a que acierte.
Pero la respuesta práctica llega mucho antes. En los sistemas de producción, no puedes tolerar nada cercano a un 50% de error. Necesitas una fiabilidad del 90% o superior. Ese umbral se alcanza con solo 11 pasos.
Déjame ser explícito sobre lo que esto significa:
- Cadena de razonamiento de 11 pasos: el 90% de tus resultados son incorrectos
- Cadena de razonamiento de 34 pasos: tu sistema es peor que el azar
- Cadena de razonamiento de 50 pasos: tasa de fallo del 63,6%
- Cadena de razonamiento de 100 pasos: tasa de fallo del 86,7%
Ahora piensa en lo que esto significa para la IA agéntica. Un flujo de trabajo típico de un agente podría implicar: comprender la tarea (1), descomponerla en pasos (2), buscar información (3), evaluar fuentes (4), sintetizar hallazgos (5), generar una respuesta (6), verificar la calidad (7), y así sucesivamente. Eso ya son 7 pasos, y ni siquiera hemos llegado a tareas complejas.
Las cadenas de razonamiento de múltiples saltos en la investigación jurídica, el diagnóstico médico o el análisis financiero superan habitualmente los 20 pasos. Con una precisión del 98% por paso, estás viendo un 33% de fallos antes siquiera de considerar la complejidad.
Esto no es teórico. Esta es la razón por la que los agentes de IA fallan en producción.
El desastre de producción del que nadie habla
Las estadísticas son devastadoras, pero casi nunca se mencionan en los materiales de marketing de la IA.
Fallos de IA empresarial: Según una investigación de 2025 del MIT y Fortune, el 95% de los pilotos de IA generativa no logran llegar a producción con un impacto empresarial medible. No es que "les cueste llegar a producción". Fracasan por completo.
Fallos específicos de agentes: Un análisis de LinkedIn entre profesionales de la IA muestra que el 95% de los agentes de IA fallan en producción. No porque los modelos no sean lo bastante inteligentes. Sino porque la acumulación de errores los vuelve poco fiables.
Sistemas multiagente: La investigación muestra que cuando varios agentes colaboran, los errores se acumulan más rápido. Si un agente pasa información defectuosa a otro, el segundo construye sobre esos errores y la degradación se acelera.
El impacto económico: Las empresas están gastando cientos de millones en sistemas de IA que fundamentalmente no pueden funcionar para sus casos de uso previstos. Un único despliegue de agente multipaso puede costar millones de desarrollarlo y, aun así, fracasar por matemáticas básicas.
Este es el problema del 98% en la práctica: una precisión excelente en un solo paso, un fracaso catastrófico en múltiples pasos.
El efecto bola de nieve de las alucinaciones
La investigación de Zhang et al. (2023) identificó lo que denominan la "bola de nieve de las alucinaciones". Así funciona: los LLM se comprometen en exceso con los errores iniciales y luego generan afirmaciones falsas adicionales para justificarlos. El error no solo se propaga. Crece.
Piensa en lo que esto significa en el contexto de la decadencia exponencial del error. Tu primer error en el paso 5 no solo reduce la precisión en un 2%. Crea una base defectuosa para el paso 6, que ahora tiene una probabilidad de error aún mayor porque se construye sobre suposiciones incorrectas.
El modelo de decadencia exponencial pura es en realidad optimista. En la práctica, los errores crecen como una bola de nieve más rápido de lo que predicen las matemáticas, porque cada error hace que los errores posteriores sean más probables.
Por eso vemos casos documentados como:
El desastre de IA de CNET (2023): 41 de los 77 artículos escritos por IA requirieron correcciones. Eso es una tasa de error del 53% en periodismo de producción, donde tasas de error de un solo dígito serían inaceptables.
Fallos en el diagnóstico médico: Un estudio de JAMA Pediatrics encontró que ChatGPT realizó diagnósticos incorrectos en más del 80% de los casos pediátricos. Esto no es una "alucinación" en abstracto. Son errores médicos concretos que podrían dañar a los pacientes.
Alucinaciones de IA legal: La investigación de Stanford HAI muestra que los modelos de IA legal alucinan en 1 de cada 6 consultas de evaluación comparativa. Se ha sancionado a abogados por presentar casos falsos generados por IA ante los tribunales. En múltiples ocasiones. En múltiples países.
Fallos de las descripciones generales de IA de Google: El sistema sugirió poner pegamento en la pizza y comer rocas a diario. Estos no son casos extremos. Son lo que ocurre cuando la acumulación de errores se encuentra con la confianza sin verificación.
La trampa de la verificación
Esta es la parte irónica. Sabemos que los LLM pueden identificar sus propios errores. La investigación muestra que ChatGPT identifica el 67% de sus errores, y GPT-4 identifica el 87%. Los modelos saben cuándo se equivocan.
Pero aun así se comprometen con las alucinaciones. Generan afirmaciones falsas para justificar los errores iniciales. Se comprometen en exceso con los errores a pesar de tener la capacidad de reconocerlos.
Por eso la verificación simple no resuelve el problema. Añadir un paso de "revisa tu trabajo" no ayuda cuando el sistema está incentivado a defender sus resultados anteriores en lugar de corregirlos.
El paso de verificación en sí mismo se convierte en otro paso de la cadena de razonamiento. Otro 2% de error. Otra oportunidad para que la bola de nieve crezca.
Por qué los enfoques actuales no pueden solucionar esto
La respuesta de la industria de la IA a la acumulación de errores ha sido esforzarse más. Más datos de entrenamiento. Mejor ajuste fino. Indicaciones inteligentes. Razonamiento en cadena de pensamiento. Pasos de verificación.
Nada de esto aborda el problema matemático fundamental.
Más entrenamiento no ayuda: Una mejor precisión en un solo paso no cambia la decadencia exponencial. Una precisión del 99% solo mueve el umbral de 34 pasos a 69 pasos. El 99,5% lo mueve a 138 pasos. Mientras tanto, gastas exponencialmente más cómputo para obtener ganancias marginales.
Mejores indicaciones no ayudan: Las estrategias de indicaciones son esencialmente un intento de luchar contra las matemáticas con lenguaje natural. No puedes salir de (0,98)ⁿ con indicaciones.
La verificación agrava el problema: Cada paso de verificación es otra operación con su propia probabilidad de error. Estás añadiendo pasos para luchar contra un problema causado por tener demasiados pasos.
Los métodos de conjunto ayudan pero no resuelven: La investigación muestra que los métodos de autoconsistencia pueden mejorar la precisión hasta en 17,9 puntos porcentuales en problemas matemáticos. Pero esto tiene un coste de 40 veces más cómputo. Y no elimina la decadencia exponencial. Solo desplaza ligeramente la curva.
El problema fundamental no es la calidad del entrenamiento ni la estrategia de indicaciones. Es que las redes neuronales de coma flotante son fundamentalmente probabilísticas. Cada operación introduce incertidumbre. La incertidumbre se acumula. No hay forma de evitar estas matemáticas.
La solución basada en restricciones
Los sistemas de IA basados en restricciones no siguen el modelo de decaimiento exponencial. Esta es la razón.
Operaciones deterministas: Nuestro enfoque utiliza operaciones discretas. XNOR, POPCNT, AND lógico, OR. Estas operaciones son deterministas. Misma entrada, misma salida. Siempre.
Sin errores de redondeo: Los valores binarios son exactos. +1 o -1. Sin aproximación de coma flotante. Sin error de redondeo acumulado.
Satisfacción de restricciones: Nuestros sistemas trabajan con restricciones, no con probabilidades. Una restricción se cumple o no se cumple. No existe un 98% de cumplimiento. Existe cumplida (100%) o incumplida (0%).
Restricciones cristalizadas: En el enfoque de Dweve, una vez que una restricción se descubre y se cristaliza, se aplica de forma determinista. La aplicación número cien de una restricción es tan fiable como la primera. Sin decaimiento. Sin error acumulado.
Por eso los sistemas basados en restricciones pueden manejar el razonamiento de múltiples pasos sin degradación. Cada paso se comprueba contra restricciones cristalizadas. El paso 10 es tan fiable como el paso 1. El paso 100 es tan fiable como el paso 1.
La curva de error no parece un decaimiento exponencial. Parece una función escalonada: 100% de precisión hasta que se alcanza un límite de restricción, luego 0% (fallo detectable). Sin zonas grises. Sin decaimiento gradual hacia el sinsentido.
El ángulo regulatorio
Los reguladores europeos entienden este problema mejor de lo que las empresas tecnológicas estadounidenses quieren admitir.
La Ley de IA de la UE no solo exige precisión. Exige explicabilidad y auditabilidad. Tienes que explicar por qué tu IA tomó una decisión concreta. Tienes que demostrar que funciona correctamente.
¿Cómo demuestras que un sistema funciona correctamente cuando su fiabilidad decae exponencialmente con la profundidad del razonamiento?
No puedes.
Por eso el derecho a la explicación del artículo 22 del RGPD y los requisitos de transparencia de la Ley de IA de la UE favorecen fundamentalmente los enfoques basados en restricciones. Cuando una decisión es el resultado de la satisfacción de restricciones, puedes explicarla. Aquí está la restricción A, la restricción B, la restricción C. Todas satisfechas. La salida se sigue lógicamente.
¿Y cuando una decisión es la salida de 50 operaciones probabilísticas, cada una agravando la incertidumbre de la anterior? Eso no puedes explicarlo. Ni siquiera puedes reproducirlo de forma fiable.
Esto no es una carga de cumplimiento. Son las matemáticas alcanzando a las afirmaciones de marketing.
La implicación empresarial
Esto es lo que significa la acumulación exponencial de errores para la IA en los negocios:
Tareas simples: Las operaciones de un solo paso funcionan bien. Clasificación, respuesta básica a preguntas, recuperación simple. Una precisión del 98% es genuinamente útil aquí.
Complejidad media: Las operaciones de varios pasos pero acotadas son arriesgadas. Probablemente puedas manejar entre 5 y 10 pasos si tienes cuidado. Pero te estás acercando al umbral donde los errores se acumulan más rápido de lo que se crea valor.
Alta complejidad: Las cadenas de razonamiento profundo, los flujos de trabajo de agentes y las consultas de múltiples saltos son matemáticamente inviables con enfoques probabilísticos de coma flotante. El sistema fallará. No es cuestión de si, sino de cuándo.
Esto explica por qué el 95% de los pilotos de IA empresarial fracasan. Las empresas intentan resolver problemas que requieren 20, 50, 100 pasos de razonamiento usando sistemas que se vuelven poco fiables después de 11.
A las matemáticas no les importa tu caso de uso. No les importa tu presupuesto. No les importa tu ambiciosa hoja de ruta. (0.98)ⁿ tiende a cero independientemente de las intenciones.
El camino a seguir
Hemos identificado el problema. La acumulación exponencial de errores hace que las redes neuronales de coma flotante no sean adecuadas para el razonamiento de múltiples pasos. Las matemáticas son claras. Los fallos de producción están documentados. Los costes económicos son medibles.
La solución es igualmente clara: necesitamos sistemas de IA que no sufran decaimiento exponencial.
La IA basada en restricciones proporciona exactamente esto. Operaciones deterministas. Restricciones cristalizadas. Sin error acumulado. Razonamiento de múltiples saltos sin degradación.
Esto no es especulativo. Esto es lo que estamos construyendo en Dweve. Core proporciona el marco algorítmico binario. Loom implementa 456 especialistas de dominio basados en restricciones. Nexus proporciona la capa de orquestación de múltiples agentes. Cada operación es matemáticamente exacta. Cada decisión es trazable hasta restricciones específicas.
El resultado: sistemas de IA que siguen siendo fiables a lo largo de cientos de pasos de razonamiento. No un 98% de precisión en el paso 1 y un 36% en el paso 50. Un 100% de precisión en el paso 1, en el paso 50 y en el paso 500.
Hasta que se alcanza el límite de restricciones, la fiabilidad es absoluta. En el límite, el fallo es detectable. El sistema sabe cuándo no sabe. Eso no es un error. Eso es seguridad.
Lo que necesitas recordar
- La acumulación de errores es exponencial, no lineal. Cada operación de IA de varios pasos agrava los errores anteriores. Una precisión del 98% por paso se convierte en un éxito del 13% después de 100 pasos.
- El umbral de inutilidad se alcanza rápidamente. Con una precisión del 98% por paso, los sistemas caen por debajo del 50% de fiabilidad después de solo 34 pasos. En la práctica, el umbral se sitúa en torno a los 11 pasos para una fiabilidad del 90%.
- Las alucinaciones se acumulan como una bola de nieve, no solo se propagan. Los LLM se comprometen en exceso con los errores iniciales y generan afirmaciones falsas adicionales para justificarlos. La acumulación de errores se acelera más allá de la pura decadencia exponencial.
- Las tasas de fracaso en producción son catastróficas. El 95% de los pilotos de IA generativa no llegan a producción. El 95% de los agentes de IA fracasan en su despliegue. Esto no es una mala ingeniería. Son malas matemáticas.
- La verificación no resuelve el problema. Añadir pasos de verificación añade más operaciones con sus propias probabilidades de error. Estás luchando contra la decadencia exponencial con más decadencia exponencial.
- Los sistemas basados en restricciones no sufren decadencia exponencial. Las operaciones deterministas y las restricciones cristalizadas hacen que el paso 100 sea tan fiable como el paso 1. Sin errores acumulados. Sin zonas grises.
- La normativa europea favorece la certeza matemática. Los requisitos de explicabilidad y auditabilidad de la Ley de IA de la UE se alinean con los enfoques basados en restricciones y entran en conflicto con las cajas negras probabilísticas.
La conclusión
El problema del 98% es real, medible y está destruyendo proyectos de IA en todos los sectores. Cuando cada operación pierde un 2% de verdad y los errores se agravan a lo largo de los pasos de razonamiento, los sistemas están matemáticamente abocados al fracaso.
Esto no va de mejores datos de entrenamiento ni de indicaciones más inteligentes. Esto va de las matemáticas fundamentales de las redes neuronales de coma flotante frente al razonamiento basado en restricciones.
Los enfoques tradicionales siguen una decadencia exponencial: (0.98)ⁿ se acerca a cero a medida que n aumenta. No hay forma de evitarlo. Está integrado en las matemáticas.
Los enfoques basados en restricciones funcionan de otra manera. Operaciones deterministas. Restricciones cristalizadas. El paso 500 es tan fiable como el paso 1. La curva de error es una función escalonada, no una decadencia exponencial.
El sector se está dando cuenta lentamente de esta realidad. Las empresas gastan cientos de millones en sistemas que están matemáticamente abocados al fracaso. La tasa de fracaso del 95% en producción no es un misterio. Es predecible.
Las empresas europeas de IA que construyen sobre bases basadas en restricciones no están en desventaja. Están resolviendo el problema real mientras las empresas estadounidenses redoblan su apuesta por unas matemáticas defectuosas.
El futuro de la IA fiable no es más potencia de cálculo, modelos más grandes ni indicaciones más ingeniosas. Son sistemas basados en restricciones con restricciones cristalizadas. Certeza matemática en lugar de confianza estadística. Fiabilidad demostrable en lugar de decadencia exponencial.
¿Quieres una IA que no se degrade hasta el sinsentido? El marco basado en restricciones de Dweve Core ofrece razonamiento determinista de varios pasos. Sin acumulación exponencial de errores. Sin bolas de nieve de alucinaciones. Solo matemáticas que funcionan. Únete a nuestra lista de espera.