Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
Este artículo presenta un marco de trabajo que utiliza ataques adversarios semánticamente equivalentes para demostrar que los modelos de lenguaje de gran tamaño (LLM) de vanguardia siguen siendo altamente vulnerables a las alucinaciones intrínsecas, donde las perturbaciones de consulta que preservan el significado degradan significativamente su capacidad para utilizar fielmente la evidencia recuperada.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás hablando con un robot bibliotecario superinteligente que ha leído casi todos los libros del universo. Le haces una pregunta y, para estar extra seguro, le entregas una página específica de un libro para que la use como clave de respuesta. Esta configuración se llama Generación Aumentada por Recuperación, o RAG. Es como darle al robot una hoja de referencia para que no tenga que adivinar desde su propia memoria. La esperanza es que el robot se ciña estrictamente a la hoja de referencia, ignorando su propio conocimiento interno si este no coincide con la de la hoja. Pero aquí está el truatorio: a veces, incluso con la hoja de referencia en la mano, el robot se confunde, olvida lo que está leyendo o empieza a inventar cosas de todos modos. Esto se llama una "alucinación intrínseca". No es que el robot esté mintiendo a propósito; es que su cerebro es simplemente demasiado inquieto para mantenerse fiel a la evidencia que tiene justo delante.
Ahora, imagina que eres un detective tratando de averiguar qué tan inquieto es realmente este robot. Podrías hacerle la misma pregunta de cien maneras diferentes, pero si cambias el significado de la pregunta, el robot podría simplemente confundirse por el nuevo tema. Para probar verdaderamente su enfoque, necesitas hacer exactamente la misma pregunta, pero susurrándola en una docena de acentos, dialectos o estructuras de oraciones diferentes. Si el robot te da una respuesta diferente (y errónea) solo porque dijiste "¿Qué hora es?" en lugar de "¿Podría decirme la hora actual?", entonces el robot tiene un problema serio de consistencia. Este artículo trata sobre la construcción de una máquina que susurra esas variaciones complicadas que preservan el significado para ver si el robot bibliotecario se quiebra bajo la presión.
Los investigadores detrás de este estudio decidieron poner a prueba estos sistemas de IA utilizando un nuevo y astuto marco de trabajo. No se limitaron a pedirles a los modelos que rompieran sus reglas de seguridad (que es una forma común de probar la IA); en su lugar, les pidieron que rompieran su propia honestidad. Utilizaron un equipo de "atacantes" digitales —algunos usando matemáticas para retocar palabras, otros usando algoritmos genéticos para evolucionar nuevas oraciones, y otros usando otras IA para reescribir preguntas— para encontrar el refraseo perfecto, que preservara el significado, que hiciera que el modelo alucinara. El objetivo era ver si podían engañar al modelo para que ignorara el contexto proporcionado e inventara una historia, a pesar de que la pregunta significaba exactamente lo mismo que la original.
Los resultados fueron un golpe inesperado. El equipo descubrió que incluso los modelos más avanzados y de última generación son sorprendentemente frágiles. Cuando utilizaron estos ataques semánticamente equivalentes, la capacidad de los modelos para ceñirse a los hechos cayó drástmente. En algunos casos, la fidelidad del modelo a la evidencia proporcionada se degradó hasta en un 50% para modelos específicos como GPT-5-mini en ciertos conjuntos de datos. Por ejemplo, en el conjunto de datos FaithEval, la fidelidad de GPT-5-mini cayó de 0.72 a 0.22 —una disminución del 41.7%— fallando repentinamente al responder correctamente cuando la pregunta se formulaba de manera ligeramente distinta, aunque el significado no había cambiado en absoluto.
El artículo sugiere que simplemente hacer los modelos más grandes o más inteligentes no es suficiente para solucionar esto. Los investigadores probaron desde modelos pequeños de código abierto hasta gigantes masivos de código cerrado, y todos tropezaron al enfrentarse a estos trucos que preservan el significado. Los ataques fueron tan efectivos que pudieron inducir a los modelos a decir cosas como "Incapaz de responder" o a inventar detalles que no estaban en el texto, todo ello mientras la pregunta seguía siendo lógicamente idéntica a la original.
Curiosamente, el tipo de ataque importaba. Algunos métodos que simplemente intercambiaban palabras por sinónimos (como cambiar "grande" por "extenso") a menudo hacían que las preguntas sonaran extrañas y antinaturales, lo que los modelos podían detectar fácilmente. Pero los métodos que utilizaban otras IA para reescribir toda la oración de forma natural —manteniendo el flujo y el significado perfectos— eran los verdaderos problemáticos. Estos ataques de apariencia natural fueron los que causaron la mayor caída en el rendimiento, demostrando que los modelos son frágiles no solo ante el garabato extraño, sino ante la variedad natural del lenguaje humano.
El estudio también analizó cómo fallaban los modelos. A veces simplemente se negaban a responder, pero a menudo se equivocaban en los hechos, leían mal el contexto o cometían malos saltos lógicos. Esto nos dice que el problema no es solo que los modelos sean tercos; es que su capacidad para fundamentar sus respuestas en el texto proporcionado es fundamentalmente inestable. Los investigadores concluyen que necesitamos construir nuevas arquitecturas y métodos de entrenamiento que obliguen a los modelos a mantenerse anclados en la evidencia, sin importar cómo se formule la pregunta. Hasta entonces, incluso los bibliotecarios de IA más inteligentes podrían estar a solo una frase ligeramente distinta de inventarse una historia completamente nueva.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.