Dweve

El colapso del modelo: por qué la endogamia de la IA acabará con la inteligencia

Investigadores advierten de que entrenar IA con contenido generado por IA provoca el «colapso del modelo». Con la web llena de basura sintética, ¿cómo...

El colapso del modelo: por qué la endogamia de la IA acabará con la inteligencia

El problema de los Habsburgo en formato digital

En la historia de Europa, la Casa de Habsburgo fue una de las dinastías reales más poderosas. Gobernaron vastos territorios durante siglos. Pero tenían un defecto fatal: en su afán por consolidar el poder y mantener su linaje "puro", se casaban con sus primos. A lo largo de generaciones, esta endogamia recursiva condujo al famoso "mentón de los Habsburgo" y a una serie de deformidades genéticas y problemas de salud. El acervo genético se volvió demasiado pequeño, demasiado recursivo y, finalmente, la línea se derrumbó. Carlos II de España, el último gobernante Habsburgo del Imperio español, estaba tan endogámico que apenas podía masticar su propia comida.

En 2025, estamos presenciando el equivalente digital de este fenómeno. Los investigadores lo llaman Colapso del Modelo.

Durante la primera década de la revolución del Deep Learning (aproximadamente 2012-2022), vivimos en una Edad de Oro de los datos. Entrenamos nuestros modelos con la producción orgánica de la humanidad. Recopilamos libros escritos por autores humanos, código escrito por ingenieros humanos, foros llenos de discusiones humanas y arte creado por manos humanas. Estos datos eran desordenados, sí. Pero eran ricos. Eran variados. Contenían las "colas" de la distribución: lo extraño, lo creativo, lo inesperado. Estaban anclados en la realidad física.

Pero entonces llegaron ChatGPT, Midjourney y Copilot. De repente, el coste de generar contenido cayó a casi cero. Internet se inundó de texto generado por IA, imágenes generadas por IA y código generado por IA. Los spammers de SEO utilizaron LLM para generar millones de artículos tipo "lista" para cosechar clics. Los bots empezaron a hablar con bots en las redes sociales. LinkedIn se llenó de publicaciones escritas por IA sobre "liderazgo de pensamiento". Medium se desbordó con ensayos de opinión generados por IA sobre la IA.

Hoy en día, un porcentaje significativo y creciente de la web pública es sintético. Las estimaciones sugieren que para 2025, el 30-50% del texto en internet público fue generado por IA. Y aquí está el problema: cuando recopilamos la web para entrenar a la próxima generación de modelos, inevitablemente estamos recopilando datos generados por sus predecesores. Estamos alimentando a la IA con su propia producción. Estamos cerrando el círculo. Estamos creando IA Habsburgo.

El ciclo del colapso del modelo: degradación recursiva del entrenamiento Cada generación entrenada con la salida de la anterior pierde diversidad y precisión GEN 1 (2012-2022) "Web prístina" 100% datos humanos ALTA DIVERSIDAD Distribución completa Entrenar GEN 2 (2023-2024) "Web mixta" 65% humana, 35% IA COLAS EN DECLIVE La varianza se reduce Entrenar GEN 3 (2025+) "Web contaminada" 35% humana, 65% IA COLAPSANDO Convergencia de modos Entrenar GEN 4 (¿Futuro?) "Lodo sintético" 8% humana, 92% IA COLAPSADO Punto degenerado Cuatro síntomas del colapso del modelo Pérdida de las colas de distribución Las salidas creativas e inusuales desaparecen. Todo converge hacia la media. Los casos límite se pierden para siempre. "IA beige" Amplificación de las alucinaciones Los errores de la Gen 1 se convierten en "hechos" en la Gen 2, y luego en conocimiento canónico. Las mentiras se vuelven verdad. "Mentiras seguras" Homogeneización del estilo Todas las salidas suenan igual. Genéricas, seguras, pulidas pero sin alma. La voz distintiva muere. "Basura de IA" Desconexión de la realidad Los modelos pierden el anclaje en la realidad física. Manipulación pura de símbolos sin significado. "Regresión infinita" El colapso del modelo no es un riesgo teórico. Está ocurriendo ahora. Internet ya está contaminada.
Los riesgos de «The Habsburg Problem in Digital Form» se vuelven manejables una vez que tienen nombre y responsables.

Las matemáticas de la regresión

Esto no es solo una preocupación filosófica. Es una certeza matemática. Investigadores de Oxford, Cambridge y la Universidad de Toronto han demostrado este efecto en rigurosos estudios revisados por pares. Lo llaman «la maldición de la recursión».

Las matemáticas son en realidad bastante elegantes en su crudeza. Cuando un modelo probabilístico (modelo B) se entrena con datos generados por otro modelo probabilístico (modelo A), el modelo B aprende la aproximación del modelo A a la distribución real, no la distribución real en sí. Aprende los errores junto con la señal.

Pero empeora. El proceso de entrenamiento del modelo B enfatiza inherentemente las regiones de alta probabilidad de la salida del modelo A. Los eventos raros, los valores atípicos creativos, las «colas» de la distribución, están infrarrepresentados en la salida sintética del modelo A (porque, por definición, son raros). Así que el modelo B ve incluso menos ejemplos de estas colas que el modelo A. Pierde varianza.

Ahora entrene al modelo C con la salida del modelo B. Las colas se encogen aún más. Entrene al modelo D con la del modelo C. Más todavía. Tras suficientes generaciones, la distribución colapsa hasta un punto. Todas las salidas se vuelven iguales: la «media» de la distribución original, despojada de toda diversidad.

Piense en ello como hacer una fotocopia de una fotocopia de una fotocopia. La primera copia parece aceptable. La segunda está un poco borrosa. Para la décima copia, los bordes nítidos se convierten en ruido, los detalles se desvanecen y la imagen se convierte en una mancha gris. La señal se degrada exponencialmente con cada generación.

La pérdida de las colas

En los modelos de IA, esto se manifiesta como una pérdida de creatividad y matices. Los modelos se vuelven «beige». Su escritura se vuelve genérica, repetitiva y segura. Su arte converge en una estética específica, brillante y ultrapulida que carece de la crudeza y la textura de la realidad. Su código se vuelve sintácticamente perfecto pero funcionalmente genérico, carente de los ingeniosos trucos de optimización que un experto humano podría emplear.

Las «colas» de la distribución son donde vive la innovación. Shakespeare está en las colas. Einstein está en las colas. Las extrañas ideas de startups que se convierten en empresas de miles de millones de dólares están en las colas. Cuando eliminas las colas, eliminas la posibilidad del genio. Obtienes un mundo de mediocridad competente.

Amplificación de las alucinaciones

Quizá peor que perder creatividad es ganar una seguridad equivocada. A medida que los modelos se entrenan con las alucinaciones de sus predecesores, esos errores se refuerzan. Una mentira contada una vez es una anomalía. Una mentira repetida un millón de veces en el conjunto de entrenamiento se convierte en un hecho.

Consideremos una hipótesis: GPT-5 alucina que cierto medicamento es seguro durante el embarazo (no lo es). Esa alucinación se publica en miles de artículos de salud generados por IA. GPT-6 se entrena con esos artículos. Ahora «cree» este dato falso con aún más seguridad, porque lo ha visto muchísimas veces. GPT-7 lo trata como conocimiento médico establecido.

El Colapso del Modelo no consiste solo en volverse aburrido; consiste en desconectarse de la realidad. Consiste en crear una IA supremamente segura de sí misma en un universo de hechos que no existen.

La evidencia ya está aquí

No estamos esperando a que ocurra el Colapso del Modelo. Lo estamos viendo desarrollarse en tiempo real.

Stack Overflow ha sufrido una caída masiva del tráfico humano, mientras que el volumen de código generado por IA en GitHub se ha disparado. Si entrenas un modelo de programación con datos de GitHub de 2025, lo estás entrenando con código que probablemente fue escrito (o al menos asistido) por Copilot en 2024. Si ese código de 2024 tenía un error sutil (por ejemplo, una vulnerabilidad de seguridad que la IA tiende a sugerir), el modelo de 2025 aprenderá ese error como una buena práctica. Lo amplificará.

Investigadores de Google han observado que los resultados de búsqueda más recientes contienen patrones de redacción cada vez más repetitivos, característicos de la producción de los LLM. Las mismas frases aparecen una y otra vez: «Es importante señalar que...», «En el mundo acelerado de hoy...», «Vamos a profundizar...». Estos tics lingüísticos se están extendiendo por el corpus como un virus.

Amazon ha informado de que un porcentaje significativo de las reseñas de clientes en su plataforma ya están generadas por IA. Las descripciones de productos están generadas por IA. Las reseñas de esos productos están generadas por IA. Pronto, los resúmenes de esas reseñas estarán generados por IA. Son tortugas hasta el final.

Las «Leyes de Escalado» que impulsaron el auge de la IA (la idea de que simplemente añadir más datos y más potencia de cálculo siempre produce un mejor rendimiento) están chocando con un muro. Los datos ya no son la limitación; la realidad es la limitación. Nos hemos quedado sin datos humanos limpios. Hemos envenenado nuestro propio pozo.

Dweve Spindle: Defensa epistemológica en siete etapas Transformando información bruta en conocimiento verificado y listo para IA Canal epistemológico de siete etapas 1. CANDIDATO Información bruta identificada Scraping web marcado 2. EXTRAÍDO Información estructurada analizada Extracción de entidades y hechos 3. ANALIZADO Descompuesto en hechos atómicos Descomposición de afirmaciones 4. CONECTADO Vinculado a red de conocimiento Integración en grafo 5. VERIFICADO Validación multifuente Comprobaciones cruzadas 6. CERTIFICADO Control de calidad completado Confianza garantizada 7. CANÓNICO Autoritativo Listo para IA Verdad de referencia para entrenamiento Seis dimensiones de calidad (evaluadas en cada etapa) Verificabilidad ¿Puede la afirmación confirmarse de forma independiente? Objetividad ¿Es un hecho o una opinión? Detección de sesgos. Integridad ¿Se incluye el contexto crítico? Coherencia ¿Entra en conflicto con hechos conocidos? Actualidad ¿Sigue siendo vigente y relevante? Diversidad de fuentes ¿Existen confirmaciones independientes? Jerarquía militar de 32 agentes (procesando cada unidad de conocimiento) Brigada de descubrimiento 6 agentes: encontrar fuentes Cuerpo de extracción 5 agentes: analizar datos División de análisis 6 agentes: descomponer Guardia de calidad 4 agentes: verificar la verdad Consejo de gobernanza 12 agentes: certificar

La solución de Dweve: rigor epistemológico

En Dweve, anticipamos esta crisis. Nos dimos cuenta desde el principio de que la estrategia de «rasparlo todo» era insostenible. Para construir sistemas robustos que no colapsen en alucinaciones, hay que priorizar la procedencia de los datos: saber exactamente de dónde vienen y si representan la realidad.

Por eso creamos Dweve Spindle: nuestra plataforma de gobernanza del conocimiento empresarial. Spindle no es solo una canalización de datos. Es un sistema epistemológico. Transforma la información bruta en conocimiento verificado y listo para IA mediante un riguroso proceso de siete etapas.

La canalización epistemológica de siete etapas

Toda la información que entra en el ecosistema de Dweve pasa por esta canalización:

Etapa 1: candidata. La información bruta se identifica y se marca para su procesamiento. Puede ser una página web, un documento, un registro de base de datos o una lectura de sensor. En esta etapa solo sabemos que la información existe, no si es verdadera o útil.

Etapa 2: extraída. La información estructurada se extrae de la fuente bruta. Se identifican las entidades. Se extraen los hechos. El caos no estructurado se convierte en un candidato a grafo de conocimiento estructurado.

Etapa 3: analizada. Las afirmaciones se descomponen en hechos atómicos. Una frase como «Einstein ganó el Premio Nobel por la relatividad» se divide en componentes verificables: «Einstein existió», «Einstein ganó un Premio Nobel», «El premio fue de Física», «El premio se concedió por su trabajo sobre la relatividad». (Nota: esa última afirmación es en realidad falsa, y la canalización lo detectaría).

Etapa 4: conectada. Los hechos atómicos se enlazan con nuestra red de conocimiento existente. ¿Contradice esta nueva información los hechos establecidos? ¿Los corrobora? ¿Rellena vacíos? La integración en el grafo revela coherencias y conflictos.

Etapa 5: verificada. Se realiza una validación con múltiples fuentes. ¿Podemos encontrar confirmación independiente en fuentes autorizadas? ¿Supera la afirmación las comprobaciones de coherencia lógica? ¿Cuál es la procedencia de la fuente original?

Etapa 6: certificada. El control de calidad ha concluido. La información ha alcanzado una puntuación de confianza superior a 0,7 en nuestras seis dimensiones de calidad. Se marca como fiable para su uso en aplicaciones posteriores.

Etapa 7: canónica. La información se convierte en conocimiento autoritativo y listo para IA. Puede utilizarse para entrenamiento, inferencia y recuperación. Es la verdad de referencia.

La jerarquía militar de 32 agentes

Esta canalización no la ejecuta un único algoritmo. La orquesta un equipo especializado de 32 agentes de IA organizados en una jerarquía de estilo militar:

  • Brigada de descubrimiento (6 agentes): exploradores que identifican y recuperan posibles fuentes de conocimiento
  • Cuerpo de extracción (5 agentes): especialistas en análisis sintáctico, reconocimiento de entidades y estructuración de datos brutos
  • División de análisis (6 agentes): lógicos que descomponen afirmaciones e identifican dependencias
  • Red de conexión (4 agentes): especialistas en grafos que integran nuevo conocimiento
  • Guardia de calidad (4 agentes): validadores que contrastan fuentes y detectan incoherencias
  • Consejo de gobernanza (12 agentes): agentes sénior que toman las decisiones finales de certificación

Cada agente tiene una experiencia especializada. Debaten. Cuestionan las conclusiones de los demás. Exigen consenso antes de que la información pase a la siguiente etapa. Este proceso de verificación con múltiples agentes es mucho más robusto que cualquier enfoque de verificación de datos con un solo modelo.

Detección de 47 tipos de sesgo

Spindle está diseñado específicamente para detectar y señalar sesgos en los datos de entrenamiento. Nuestro sistema identifica 47 tipos distintos de sesgo en cuatro categorías:

  • Sesgo estadístico: Sesgo de muestreo, sesgo de selección, sesgo de supervivencia, sesgo de confirmación en la recopilación de datos
  • Sesgo cognitivo: Anclaje, heurística de disponibilidad, efectos de encuadre en el material de origen
  • Sesgo lingüístico: Lenguaje cargado, eufemismos, palabras comodín, encuadre persuasivo
  • Sesgo sistémico: Lagunas de representación, sesgos históricos codificados en el texto, puntos ciegos culturales

Cuando se detecta un sesgo, la información se corrige (si es posible), se marca (si la corrección es incierta) o se rechaza (si el sesgo es fundamental e incorregible). Esto evita la amplificación de sesgos que afecta a los modelos entrenados con raspados web en bruto.

Estrategia de procedencia de datos en cuatro pilares Cómo mantiene Dweve la integridad de los datos de entrenamiento en la era del contenido sintético 1 WEB VIRGEN Archivos anteriores a 2023 Contenido escrito por humanos anterior a ChatGPT: - Libros digitalizados antes de 2022 - Artículos académicos - Repositorios de código (2010-2021) - Archivos de foros - Periodismo editorial Base de verdad fundamental 2 FUENTES CERTIFICADAS Datos humanos con licencia Asociaciones directas con creadores humanos verificados: - Editoriales académicas - Editoriales de libros - Código con pruebas CI/CD - Socios empresariales - Escritores profesionales Procedencia verificada 3 FILTRO SIMBÓLICO Verificación basada en lógica Comprobaciones basadas en restricciones que rechazan basura sintética: - Verificación de sintaxis - Análisis estático - Coherencia lógica - Referencia cruzada de hechos - Detección de alucinaciones Sistema inmunitario 4 PRESERVACIÓN DE COLAS Protección de la diversidad Curación activa de valores atípicos creativos: - Sobremuestrear valores atípicos - Preservar casos límite - Curar datos inusuales - Proteger la creatividad - Valorar las opiniones minoritarias Fuente de innovación La procedencia de los datos es la nueva ventaja competitiva. Calidad frente a cantidad. Realidad frente a simulación.
"The Dweve Solution: Epistemological Rigor" es un bucle: observar, elegir, actuar y volver a probar.

Los cuatro pilares de la procedencia de los datos

Más allá del pipeline de Spindle, nuestra estrategia de datos más amplia se apoya en cuatro pilares:

1. La Web Prístina (archivos anteriores a 2023)

Concedemos un valor enorme a los datos creados antes de la proliferación generalizada de la IA generativa (aproximadamente a finales de 2022 o principios de 2023). Consideramos esta época como la "Web Prístina". Estos datos de archivo son la base de nuestro entrenamiento. Son la verdad fundamental de la producción humana antes de que comenzara la contaminación.

Hemos invertido mucho en adquirir y seleccionar conjuntos de datos anteriores a 2022: libros digitalizados, archivos académicos, repositorios de código con historiales de confirmaciones que demuestran la autoría humana, archivos de foros de la época en la que cada publicación estaba escrita por una persona.

Estos datos son irremplazables. Una vez que la web se contaminó, no pudimos descontaminarla. Pero podemos preservar y priorizar los archivos limpios.

2. Fuentes humanas certificadas

Para los datos modernos, no dependemos del raspado web a ciegas. Nos asociamos directamente con instituciones de confianza. Obtemos licencias de datos de:

  • Editoriales académicas: Los artículos revisados por pares están (en su mayoría) escritos por humanos y revisados por humanos. El proceso de revisión proporciona un filtro de calidad.
  • Editoriales de libros: Los procesos editoriales garantizan un nivel de supervisión humana del que carece el contenido web.
  • Repositorios de código con CI/CD: Esto es crucial. No solo raspamos código. Raspamos código que pasa las pruebas. Si una función no compila, la descartamos. Si falla en su conjunto de pruebas, la descartamos. El código que funciona tiene muchas más probabilidades de estar escrito por humanos (o al menos verificado por humanos) que los fragmentos aleatorios.
  • Socios empresariales: Las empresas nos proporcionan datos propietarios a cambio de modelos personalizados. Estos datos son, por definición, generados por humanos y relevantes para el negocio.

3. Verificación simbólica como sistema inmunitario

Esto es exclusivo de nuestro enfoque neuro-simbólico. Como nuestro sistema comprende la lógica y la estructura del código mediante nuestra arquitectura basada en restricciones, podemos utilizar la verificación simbólica para filtrar los datos de entrenamiento.

Si estamos entrenando un modelo para que escriba Python, no solo le introducimos archivos de texto sin procesar. Ejecutamos el código a través de un compilador. Si tiene errores de sintaxis, lo descartamos. Lo pasamos por un analizador estático. Si tiene fallos de seguridad evidentes, lo descartamos. Lo ejecutamos contra casos de prueba. Si falla, lo descartamos.

Para el contenido factual, contrastamos las afirmaciones con nuestro grafo de conocimiento verificado. Si un documento afirma que París es la capital de Alemania, la capa simbólica detecta la incoherencia y marca el documento como poco fiable.

Esto actúa como un sistema inmunitario contra el Colapso del Modelo. Las alucinaciones y el código con errores generados por otras IA no superan nuestras comprobaciones de verificación y se filtran antes de que puedan contaminar nuestro entrenamiento.

4. La estrategia de preservación de las colas

Sobremuestreamos explícitamente las "colas" de la distribución. Buscamos datos que sean de alta calidad pero poco convencionales. No queremos que nuestro modelo sea "promedio". Queremos que comprenda los casos límite, los saltos creativos, las excepciones brillantes.

La mayoría de los procesos de entrenamiento de LLM filtran agresivamente los "valores atípicos" para estabilizar el entrenamiento. Nosotros los seleccionamos cuidadosamente. La innovación no ocurre en la media; ocurre en los bordes. La próxima idea revolucionaria no sonará como todas las demás. Sonará extraña. Queremos preservar esa rareza.

"The Four Pillars of Data Provenance" es un bucle: observar, elegir, actuar y volver a probar.

El valor de la realidad

En un futuro cercano, los "datos generados por humanos" se convertirán en una clase de activo premium. El vasto océano de internet público se considerará "datos basura": útiles como relleno, quizás, o para aprender gramática básica, pero peligrosos para el conocimiento fundamental.

Las empresas que tengan acceso a datos propietarios del mundo real (registros de sensores de fábricas reales, historiales de pacientes de médicos reales, datos de transacciones de economías reales) tendrán una ventaja competitiva masiva. Poseen la "verdad fundamental".

El Colapso del Modelo es la amenaza existencial para la burbuja de la IA generativa. Sugiere que no podemos simplemente escalar para siempre. No podemos simular nuestro camino hacia la superinteligencia. Tenemos que mantener los pies en la tierra. Tenemos que seleccionar. Tenemos que valorar la calidad sobre la cantidad.

La IA del futuro no se construirá sobre todo internet. Se construirá sobre el internet verificado. Se construirá sobre la verdad.

La dimensión regulatoria

Esto no es solo una preocupación técnica. Los reguladores están despertando a las implicaciones de la contaminación por datos sintéticos.

La Ley de IA de la UE exige explícitamente la documentación de la procedencia de los datos de entrenamiento para los sistemas de IA de alto riesgo. Si tu modelo fue entrenado con datos contaminados y produce resultados dañinos, debes poder demostrar que tomaste medidas razonables para garantizar la calidad de los datos. "Raspamos la web" no va a ser una respuesta aceptable.

El RGPD ya exige a las organizaciones mantener registros de las actividades de tratamiento de datos. Extender esto a los datos de entrenamiento de IA es una evolución natural. ¿De dónde proceden sus datos de entrenamiento? ¿Puede demostrar que se recopilaron legalmente? ¿Puede demostrar que representan la realidad y no alucinaciones de IA?

Las empresas que no puedan responder a estas preguntas se enfrentarán a un escrutinio regulatorio cada vez mayor. Las empresas que puedan demostrar una procedencia rigurosa de los datos (como las que usan Dweve Spindle) tendrán una ventaja en materia de cumplimiento.

El espacio alrededor de "The Regulatory Dimension" se reduce cuando coinciden las normas, la búsqueda y la prueba.

El camino a seguir

El colapso del modelo no es inevitable. Es una consecuencia de prácticas de datos negligentes. Si seguimos extrayendo datos de la web contaminada y alimentando con ellos modelos cada vez más grandes, obtendremos una IA Habsburgo: segura de sí misma, de apariencia capaz, pero fundamentalmente degenerada.

Pero si invertimos en la calidad de los datos, si construimos sistemas epistemológicos capaces de distinguir la verdad de la alucinación, si preservamos la diversidad del pensamiento humano en lugar de diluirla en una masa sintética, podemos construir una IA que se mantenga anclada en la realidad.

Esto exige un trabajo más arduo. Exige más inversión. Exige tratar los datos como un recurso valioso y no como una mercancía que exprimir. Pero es el único camino hacia sistemas de IA que sigan siendo útiles, precisos y dignos de confianza a largo plazo.

En Dweve, hemos elegido este camino. Nuestra combinación de datos de archivo prístinos, fuentes humanas certificadas, verificación simbólica y preservación de la diversidad garantiza que nuestros modelos sigan conectados con el mundo real. Estamos construyendo el filtro entre la realidad y la simulación.

El camino fácil conduce al colapso del modelo. El camino difícil conduce a una inteligencia que funciona de verdad. Sabemos cuál estamos tomando.