← Últimos artículos
💬 NLP

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

Este artículo identifica y caracteriza dos modos de falla de razonamiento a nivel de token distintos en los modelos de lenguaje —el fallo comprometido, marcado por el bloqueo temprano de la ruta, y la incertidumbre persistente, caracterizada por la duda acumulativa— demostrando que estas firmas son reproducibles a través de diversas configuraciones y pueden guiar la optimización de estrategias de detección de fallos como la autoconsistencia.

Autores originales: Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

Publicado 2026-06-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo a un detective resolver un misterio. A veces, el detective comete un error al principio, se obsesiona con el sospechoso equivocado y luego pasa el resto de la película argumentando con confianza por qué ese sospechoso es culpable, aunque sea inocente. Otras veces, el detective está genuinamente confundido todo el tiempo, revisando pistas, sin estar seguro de la respuesta hasta el último segundo.

Este artículo trata de averiguar qué tipo de error está cometiendo un Modelo de Lenguaje Grande (LLM) simplemente observando cómo "piensa" (su cadena de pensamiento) mientras escribe su respuesta. Los investigadores descubrieron que los modelos no fallan de una sola manera, sino que fallan en dos patrones distintos, y reconocer el patrón cambia la forma en que deberíamos intentar detectar el error.

Aquí hay un desglose de sus hallazgos utilizando analogías sencillas:

1. Los dos tipos de errores

Los investigadores descubrieron que cuando un modelo obtiene una respuesta incorrecta, generalmente sucede de una de estas dos formas:

Tipo A: El "Compromiso Temprano" (El detective obstinado)

  • Qué sucede: El modelo elige un camino equivocado muy pronto en su razonamiento. Una vez que elige ese camino, se queda "atrapado". Deja de explorar otras posibilidades y simplemente sigue escribiendo más frases para respaldar esa idea errónea.
  • La firma: Si observas la "incertidumbre" del modelo (qué tan inseguro se siente) mientras escribe, verás un pico al principio y luego esta disminuye. El modelo se vuelve demasiado confiado demasiado rápido.
  • La lección: No necesitas esperar a que termine toda la historia para saber que está mal. De hecho, leer el final de la historia podría confundirte porque el modelo está tan seguro de su respuesta incorrecta que parece una buena respuesta. El mejor momento para detectar este error es justo después de que el modelo comete su primer gran error.

Tipo B: "Incertidumbre Persistente" (El detective confundido)

  • Qué sucede: El modelo nunca termina de decidirse por un bando. Deambula a través del razonamiento, sin estar seguro de la respuesta durante todo el tiempo. Sigue cambiando de opinión o vacilando hasta la última palabra.
  • La firma: La incertidumbre del modelo se mantiene alta o aumenta lentamente desde el principio hasta el final. Nunca se fija en un solo camino.
  • La lección: Debes leer toda la historia para saber si falló. Si te detienes a la mitad, podrías pensar que solo está siendo cuidadoso. El error solo se vuelve claro cuando ves todo el rastro desordenado de pensamiento.

2. Cómo descubrieron esto (El "medidor de incertidumbre")

Los investigadores no necesitaron mirar dentro del cerebro del modelo (lo cual es imposible para muchos modelos de IA populares). En su lugar, observaron las probabilidades logarítmicas —una forma técnica de decir "qué tan seguro estaba el modelo de cada palabra que escribió"—.

Trataron el razonamiento del modelo como una película. Observaron el "medidor de incertidumbre" subir y bajar a medida que el modelo escribía palabra por palabra.

  • Para el Tipo A, el medidor mostró un pico claro al principio y luego se estabilizó.
  • Para el Tipo B, el medidor siguió subiendo o se mantuvo alto hasta el final.

Probaron esto en 23 combinaciones diferentes de modelos de IA y tareas (como matemáticas, programación y ciencia). En 20 de los 23 casos, su teoría se sostuvo perfectamente. Pudieron distinguir entre un error "obstinado" y un error "confundido" simplemente mirando estos patrones.

3. Por qué esto es importante: La estrategia de la "segunda opinión"

El artículo también analizó un truco común llamado Autoconsistencia (Self-Consistency). Esto es cuando le haces la misma pregunta a la IA 10 veces y tomas la respuesta que aparece con más frecuencia.

  • Para el modelo "Obstinado" (Tipo A): Hacer la misma pregunta 10 veces es inútil. Si el modelo es obstinado, te dará la misma respuesta incorrecta 10 veces seguidas. El "voto de la mayoría" solo confirmará la respuesta errónea. En este caso, observar la incertidumbre de una sola respuesta es en realidad mejor que preguntarle varias veces.
  • Para el modelo "Confundido" (Tipo B): Hacer la pregunta 10 veces es muy útil. Dado que el modelo no está seguro, te dará respuestas diferentes cada vez. El hecho de que no pueda estar de acuerdo consigo mismo es una señal de alerta enorme.

La conclusión

El artículo sostiene que no debemos usar un enfoque de "talla única" para detectar los errores de la IA.

  • Si la IA se fija en una idea errónea temprano, podemos detectarlo rápidamente observando sus niveles de confianza iniciales, y no deberíamos molestarnos en pedirle una segunda opinión (porque repetirá el error).
  • Si la IA está genuinamente confundida, debemos dejar que termine su proceso de pensamiento y luego pedirle múltiples opiniones para ver si puede ponerse de acuerdo consigo misma.

Al comprender cómo está fallando la IA, podemos elegir la herramienta adecuada para detectar el error, ahorrando tiempo y mejorando la fiabilidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →