← Últimos artículos
💬 NLP

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

Este artículo demuestra que las perturbaciones léxicas degradan severamente el razonamiento de los LLM al fragmentar la tokenización y desviar la atención en las capas transformer, un efecto acoplado que hace que las estrategias de reparación en tiempo de inferencia sean ineficaces porque no logran restaurar simultáneamente tanto el contenido corrompido como la asignación de atención.

Autores originales: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

Publicado 2026-08-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los motores detrás de una nueva generación de inteligencia artificial, capaces de leer instrucciones complejas, resolver problemas matemáticos y mantener conversaciones que se sienten notablemente humanas. Estos sistemas funcionan descomponiendo el texto en piezas pequeñas llamadas tokens, que actúan como bloques de construcción para que el modelo comprenda el significado. Cuando un humano lee una oración con un error tipográfico, el cerebro ignora sin esfuerzo el error y capta el mensaje pretendido. Durante años, los investigadores asumieron que estos poderosos modelos computacionales compartían esta misma resiliencia, creyendo que errores ortográficos menores o un fraseo torpe no descarrilarían significativamente su capacidad de razonamiento. La cuestión de qué tan frágiles son realmente estos sistemas cuando se enfrentan a errores cotidianos y realistas ha permanecido en gran medida sin respuesta, dejando un vacío entre su impresionante rendimiento con datos limpios y su fiabilidad en el mundo real desordenado.

Un estudio reciente se propuso llenar este vacío probando cómo cuatro modelos de lenguaje extensos diferentes manejan tres tipos específicos de corrupción de texto. Los investigadores tomaron tareas de razonamiento estándar, como responder preguntas sobre ciencias físicas o resolver problemas matemáticos de varios pasos, e introdujeron errores realistas. Simularon errores de mecanografía rápida donde se presiona una tecla adyacente a la intención, intercambiaron letras vecinas dentro de una palabra y añadieron muletillas conversacionales como "este" o "sabes" para alargar las oraciones. El objetivo era ver si los modelos aún podían encontrar la respuesta correcta cuando el texto se veía ligeramente roto, y comprender exactamente por qué podrían fallar.

Los resultados revelaron una división aguda y sorprendente en cómo reaccionaron los modelos. Cuando los investigadores añadieron muletillas conversacionales, los modelos funcionaron casi exactamente como lo hacían con el texto limpio, incluso aunque las oraciones se volvieron más largas. Sin embargo, cuando introdujeron errores a nivel de caracteres como errores tipográficos o intercambio de letras, la precisión de los modelos cayó en picada. Esta caída fue más severa en tareas que requerían un razonamiento matemático de varios pasos, donde un solo error tipográfico podía causar que el modelo perdiera el rumbo por completo. El estudio mostró que el fallo no fue causado por la longitud adicional del texto, sino por la forma específica en que la computadora descompone las palabras en piezas. Cuando una palabra está mal escrita, el diccionario interno de la computadora no puede reconocerla como una unidad única. En su lugar, la divide en fragmentos extraños y desconocidos.

Los investigadores rastrearon la causa de este fallo a un fenómeno que llaman desviación de la atención. En un modelo que funciona correctamente, el sistema concentra su energía computacional en las partes más importantes de una oración, como los números en un problema matemático o los hechos clave en una historia. Cuando una palabra se fragmenta en piezas extrañas, estos fragmentos actúan como un imán, atrayendo el enfoque del modelo lejos de la evidencia importante hacia las partes rotas del texto. El modelo termina mirando fijamente al error tipográfico en lugar de a la solución. Esta distracción es más dañina en las etapas intermedias y finales del procesamiento del modelo, donde intenta combinar la información para formar una respuesta. El estudio confirmó que es la fragmentación de la palabra, y no la longitud de la oración, lo que impulsa esta pérdida de enfoque.

Para entender por qué esto es tan difícil de solucionar, los investigadores realizaron una serie de experimentos donde intentaron reparar el problema de forma aislada. Intentaron restaurar el enfoque del modelo hacia las partes correctas de la oración mientras dejaban los errores tipográficos en su lugar, e intentaron arreglar los errores tipográficos mientras dejaban el enfoque del modelo confundido. Ningún enfoque funcionó bien por sí solo. De hecho, arreglar el enfoque mientras el texto permanecía roto en realidad hizo que el modelo funcionara peor, porque ahora estaba mirando intensamente la información incorrecta. El estudio encontró que el daño al texto y la distracción del modelo están profundamente vinculados; no pueden separarse. El modelo depende de la forma específica de las palabras para comprender la entrada, y cuando esa forma se rompe, la atención del modelo se ve arrastrada con ella.

Este acoplamiento explica por qué las estrategias comunes para mejorar el rendimiento, como pedirle al modelo que piense paso a paso o usar un corrector ortográfico antes de la tarea principal, a menudo fallan en recuperar la precisión perdida. Estos métodos suelen intentar arreglar solo un lado del problema, ya sea el texto o el enfoque, mientras que el otro permanece roto. Los investigadores también descubrieron que la severidad del fallo depende de qué tipo de información esté corrompida. Si un error tipográfico afecta a un número en un problema matemático, el modelo es casi seguro que fallará, porque ese número no puede ser adivinado a partir del contexto circundante. Si un error tipográfico afecta a una palabra común, el modelo podría recuperarse. Esto sugiere que los errores más críticos son aquellos que destruyen piezas de información únicas e irreemplazables.

En última instancia, el estudio concluye que la vulnerabilidad de estos modelos reside en cómo representan el texto al mismísimo comienzo de su procesamiento. Una vez que una palabra se rompe en fragmentos desconocidos, el daño es efectivamente irreversible sin acceso al texto original y correcto. Los investigadores descubrieron que incluso un modelo de reparación potente no podía arreglar los errores de manera confiable porque el texto corrompido a menudo no contenía pistas sobre cuál debería haber sido la palabra original. Esto significa que construir una inteligencia artificial verdaderamente robusta requiere proteger el texto antes de que entre al modelo, en lugar de intentar arreglarlo después. Los hallazgos sugieren que las mejoras futuras deben centrarse en hacer que la comprensión inicial del texto del sistema sea más flexible, de modo que pueda reconocer el significado incluso cuando la forma superficial esté ligeramente dañada, en lugar de depender de una ortografía perfecta para funcionar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →