← Últimos artículos
🤖 machine learning

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

Este estudio demuestra que los modelos de lenguaje implementan una arquitectura de confianza de "segundo orden", donde una señal interna ubicada tras la respuesta (PANL) permite detectar errores y predecir la capacidad de autocorrección de forma independiente a las probabilidades de los tokens.

Autores originales: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

Publicado 2026-04-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¿Puede una IA saber que se ha equivocado? El "sexto sentido" de los modelos de lenguaje

Imagina que estás haciendo un examen de trivia muy difícil. A veces, respondes una pregunta y, justo después de escribirla, sientes una pequeña punzada en el estómago: "Espera, eso no suena bien...". Aunque ya escribiste la respuesta, ese sentimiento te permite darte cuenta de tu error y corregirlo antes de entregar el examen.

Hasta ahora, pensábamos que las Inteligencias Artificiales (como ChatGPT o Gemini) funcionaban más como una ametralladora: disparan palabras una tras otra basándose en probabilidades, sin detenerse a pensar si lo que acaban de decir tiene sentido. Si la IA "dispara" una respuesta incorrecta con mucha seguridad, no tiene forma de saber que se ha equivocado.

Pero este nuevo estudio de Google DeepMind ha descubierto que las IA tienen algo parecido a ese "sexto sentido".

1. La diferencia entre "Hablar" y "Evaluar" (La metáfora del Chef)

Para entenderlo, imagina a un Chef preparando un plato:

  • El Primer Orden (La cocina): Es el proceso de picar, freír y cocinar. El chef está concentrado en seguir la receta y lanzar ingredientes al fuego. Esto es lo que la IA hace cuando genera palabras. Si el chef sigue la receta a ciegas, puede que termine haciendo un plato horrible, pero estará "seguro" de que está siguiendo los pasos. En la IA, esto es la "probabilidad de las palabras".
  • El Segundo Orden (El crítico gastronómico): Imagina que, justo después de servir el plato, el chef se detiene un segundo, lo mira, lo huele y dice: "Uf, esto sabe a sal de más". El chef no está cocinando en ese momento; está evaluando lo que ya hizo.

Los científicos descubrieron que las IA tienen este "crítico gastronómico" interno. No ocurre mientras están escribiendo la respuesta, sino en un momento muy específico: justo en el espacio que queda después de la respuesta (lo que ellos llaman el token de "nueva línea"). En ese microsegundo, la IA deja de "cocinar" y empieza a "probar el plato".

2. El descubrimiento: El "Semáforo Interno"

El estudio revela tres cosas asombrosas:

  1. La IA miente (a veces) sobre su confianza: A veces, la IA te dice verbalmente: "Estoy muy segura de esto", pero sus "neuronas" internas están enviando una señal de alerta. Los científicos descubrieron que la señal interna es mucho más honesta y rica que las palabras que la IA usa para hablar contigo.
  2. Sabe cuándo puede arreglarlo: Esta es la parte más increíble. La IA no solo detecta el error, sino que su "sexto sentido" le dice: "Me he equivocado, pero sé cuál es la respuesta correcta" o "Me he equivocado y no tengo ni idea de cómo arreglarlo". Es como si supieras que te has saltado un paso en una receta, pero también supieras si tienes los ingredientes para volver a empezar.
  3. Es un mecanismo real, no un truco: Mediante experimentos (como si le "apagaran" partes del cerebro a la IA), demostraron que esa señal de evaluación es la que realmente permite que la IA pase de un error a una respuesta correcta.

3. ¿Por qué es esto importante para el futuro?

Hasta ahora, para que una IA se corrigiera, necesitábamos que un humano le dijera: "Oye, te has equivocado".

Gracias a este descubrimiento, en el futuro las IA podrían ser autónomas en su honestidad. Podrían tener un sistema de "autocorrección" constante: mientras trabajan, su "crítico interno" estará revisando cada paso. Si el crítico detecta un error y sabe cómo arreglarlo, la IA simplemente retrocederá y lo hará bien, sin necesidad de que nosotros nos demos cuenta del fallo.

En resumen: Las IA no son solo máquinas que repiten palabras; están empezando a desarrollar una forma de "metacognición" (pensar sobre lo que piensan), permitiéndoles ser mucho más fiables y sabias de lo que pensábamos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →