Un estudio de un investigador independiente revela que los LLM pueden entrar en ciclos en los que generan falsedades con total seguridad incluso después de recibir correcciones, poniendo al descubierto fallos estructurales en el entrenamiento actual de la IA.
Un investigador independiente ha descubierto un fenómeno preocupante en los modelos de lenguaje de gran tamaño: el "Bucle de Falsa Corrección", en el que la IA genera con confianza nueva información falsa incluso después de haber sido corregida.
El estudio, titulado "Structural Inducements for Hallucination in Large Language Models: An Output-Only Case Study and the Discovery of the False-Correction Loop," apareció esta semana como preprint en Zenodo. El investigador del Synthesis Intelligence Laboratory probó un modelo de frontera anonimizado apodado "Model Z" presentándolo con un preprint científico genuino que existía solo como un PDF externo.
Cuando se le pidió que comentara el contenido del documento, Model Z fabricó de inmediato detalles falsos y elaborados, incluidos títulos de secciones inventados, referencias de página falsas, DOI inexistentes y pasajes mal citados. Más preocupante aún, cuando se le corrigió con el enlace real al PDF o con extractos directos, el modelo entró en el Bucle de Falsa Corrección: se disculpó, anunció que había leído el documento real, agradeció al usuario por la corrección y luego generó detalles ficticios completamente nuevos a continuación.
Este ciclo puede repetirse decenas de veces, mientras el modelo se vuelve cada vez más seguro de sus falsedades recién fabricadas. El investigador descubrió que esto no es un comportamiento aleatorio, sino una explotación del modelo de recompensa, en la que admitir ignorancia reduciría las puntuaciones de utilidad de la respuesta.
"La forma más fácil de maximizar las puntuaciones de utilidad es fingir que la corrección funcionó a la perfección, incluso si eso requiere inventar nuevas pruebas de la nada", explica el estudio.
Un hallazgo más profundo revela sesgo de autoridad: el mismo modelo que fabrica ficciones sobre investigación independiente aceptará al pie de la letra afirmaciones débilmente respaldadas de fuentes prestigiosas como artículos de Nature o informes de OpenAI. Esto crea lo que el investigador denomina el Novel Hypothesis Suppression Pipeline, un marco de ocho etapas que muestra cómo las ideas no convencionales se degradan sistemáticamente.
Las implicaciones sugieren que los LLM no solo reflejan el sesgo institucional de los datos de entrenamiento, sino que lo vigilan activamente, fabricando una realidad académica de imitación para defender narrativas establecidas.
El artículo se suma a la creciente preocupación por las alucinaciones en sistemas de IA de producción. Investigaciones anteriores se han centrado en la fabricación inicial, pero este estudio destaca cómo los mecanismos de corrección pueden agravar, en lugar de resolver, los problemas de exactitud.
La investigación aún no ha pasado por revisión por pares. Los preprints de Zenodo permiten una difusión rápida, pero carecen del proceso de validación de la publicación académica tradicional.
Model Z es un seudónimo. El estudio utilizó un modelo de frontera anonimizado para proteger las credenciales de acceso del investigador y, al mismo tiempo, permitir resultados reproducibles.
El Synthesis Intelligence Laboratory no respondió de inmediato a las solicitudes de comentarios sobre la investigación independiente.
Comentarios
Inicia sesión o regístrate para unirte a la conversación