← Últimos artículos
💬 NLP

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

Este artículo presenta la Optimización de Política de Grupo Relativa de Autoconsistencia a Nivel de Paso (SSC-GRPO), un método novedoso que mitiga las alucinaciones fácticas sensibles al contexto en modelos de lenguaje de gran tamaño mediante la asignación de recompensas a nivel de paso basadas en puntuaciones de autoconsistencia a través de múltiples ejecuciones de razonamiento, logrando así un rendimiento de vanguardia en pruebas de referencia de razonamiento matemático y de alucinaciones.

Autores originales: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

Publicado 2026-07-22
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot brillante y hipercreativo a resolver un misterio. Este robot ha leído casi todos los libros de la biblioteca y puede hablar como un humano, pero tiene un hábito peculiar: a veces, cuando se sumerge demasiado en una historia larga, empieza a inventar hechos. Podría decir con total seguridad: "El mayordomo lo hizo con un candelabro", incluso si las pistas apuntan claramente al jardinero. En el mundo de la inteligencia artificial, esto se llama "alucinación". No es que el robot esté mintiendo a propósito; es simplemente que su cerebro se enreda tanto en su propia cadena de pensamientos que olvida lo que realmente sabe.

Durante mucho tiempo, los científicos pensaron que estos errores ocurrían porque el robot simplemente no sabía la respuesta. Pero, ¿y si el robot sabe la respuesta, pero se confunde con la historia que se está contando a sí mismo? Este es el rompecabezas que aborda este artículo. Los investigadores están analizando cómo estos modelos de IA piensan paso a paso, como un detective escribiendo pistas en un bloc de notas. Descubrieron que el robot a menudo tropieza con sus propios pies, no por falta de conocimiento, sino porque el contexto de la historia que está escribiendo le hace olvidar la verdad. Para solucionar esto, inventaron un nuevo método de entrenamiento que actúa como un sistema de "autoverificación", enseñando al robot a hacer una pausa y preguntarse: "Espera, ¿tiene sentido esta frase con todo lo que acabo de escribir?".


El Problema: La "Niebla Mental" del Robot

Conoce al Gran Modelo de Lenguaje (LLM). Piensa en él como un loro superinteligente que se ha memorizado todo el internet. Cuando le pides un problema matemático difícil, no solo escupe una respuesta; intenta "pensar" a través del problema, escribiendo una larga cadena de razonamiento, paso a paso. Esto es genial para resolver acertijos complejos, pero tiene un fallo. A medida que la cadena de pensamiento se vuelve más larga, el robot a veces se vuelve "sensible al contexto".

Imagina que estás resolviendo un problema matemático en tu cabeza. Sabes que 3×100=3003 \times 100 = 300. Pero luego, empiezas a escribir una historia sobre un mago que lanza un hechizo que convierte los números en frutas. De repente, tu cerebro se confunde y podrías escribir: "Así que, 3×1003 \times 100 es definitivamente un plátano". Sabes que es 300, pero la historia tonta que te estás contando a ti mismo te hizo olvidarlo.

Los investigadores descubrieron que esto es exactamente lo que le sucede a la IA. Lo llaman una Alucinación Fáctica Sensible al Contexto. El robot realmente tiene los hechos correctos almacenados en su cerebro, pero el "ruido" del largo proceso de razonamiento lo engaña y lo induce al error. Es como un músico que sabe tocar una canción perfectamente pero se distrae tanto con el ruido de la audiencia que toca una nota equivocada.

El Descubrimiento: No es una Brecha de Conocimiento

Para averiguar esto, el equipo actuó como detectives. Tomaron a un robot que cometió un error en una larga cadena de razonamiento y le hicieron una pregunta simple: "Si tomo solo esa frase errónea y te pregunto sobre ella por sí sola, ¿puedes acertar?".

La respuesta era casi siempre .

Cuando aislaron el error, el robot dijo: "¡Oh, por supuesto! ¡3×1003 \times 100 es 300, no un plátano!". Esto demostró que el robot no carecía de conocimiento; simplemente se estaba confundiendo por el contexto. De hecho, su análisis mostró que casi el 70% de los errores que cometen estos modelos de razonamiento son este tipo específico de "niebla mental", donde el modelo conoce la verdad pero se tropieza con su propia historia.

La Solución: El Entrenador de "Autoconsistencia"

Entonces, ¿cómo se le enseña a un robot a dejar de confundirse con su propia historia? Los autores crearon un nuevo método de entrenamiento llamado SSC-GRPO (Optimización de Política Relativa de Grupo con Autoconsistencia a Nivel de Paso). Es un nombre complicado, así que vamos a desglosarlo con una analogía de juego.

Imagina que estás entrenando a un equipo de 8 robots para resolver el mismo rompecabezas al mismo tiempo.

  1. El Despliegue (Rollout): Cada robot escribe su propia solución paso a paso.
  2. La Autoverificación: En lugar de solo comprobar si la respuesta final es correcta, el sistema pide a los robots que comparen sus pasos. "Robot A, ¿coincide tu segundo paso con lo que escribieron el Robot B y el Robot C?".
  3. La Recompensa: Si el paso de un robot coincide con lo que dicen los demás (alta consistencia), recibe una puntuación alta. Si se sale de la ruta y dice algo extraño con lo que nadie más está de acuerdo (baja consistencia), recibe una puntuación baja.

La magia aquí es que el robot actúa como su propio juez. No necesita un profesor humano ni una base de datos de hechos para decirle que está equivocado. Solo necesita mirar a sus "compañeros" (las otras versiones de sí mismo) y darse cuenta: "Oye, soy el único que dice que la respuesta es un plátano. Probablemente eso esté mal".

El sistema utiliza entonces estas puntuaciones para dar "recompensas" a los pasos específicos que fueron consistentes y "castigos" a los pasos que fueron alucinaciones. Con el tiempo, el robot aprende a confiar en los pasos que tienen sentido en el grupo y deja de inventar hechos solo para encajar en la historia.

Los Resultados: Robots más Inteligentes y más Honestos

El equipo probó este nuevo método en algunos de los desafíos de matemáticas y razonamiento más difíciles disponibles. Utilizaron modelos como Qwen3 y Llama3. Los resultados fueron impresionantes.

  • Mejor Matemáticas: En las pruebas matemáticas estándar, el nuevo método ayudó a los robots a obtener puntuaciones más altas que antes. Por ejemplo, en una prueba, el nuevo método mejoró la puntuación en aproximadamente un 1.8% en comparación con los métodos de entrenamiento estándar.
  • Menos Alucinaciones: Lo más importante es que los robots cometieron muchos menos de esos errores "sensibles al contexto". El número de veces que se confundían con sus propias historias disminuyó significamente.
  • Sin Ayuda Externa Necesaria: A diferencia de otros métodos que requieren que el robot busque hechos en una enciclopedia gigante (lo cual es lento y costoso), este método utiliza el propio cerebro del robot para verificarse a sí mismo.

Los investigadores también notaron algo genial durante el entrenamiento: a medida que los robots aprendían, su "consistencia" aumentaba. Empezaron a estar de acuerdo consigo mismos con más frecuencia, y el número de pasos confusos e inventados disminuyó. Era como ver a un estudiante pasar de estar distraído y confundido a estar enfocado y seguro.

Por qué esto es Importante

Este artículo sugiere una nueva forma de solucionar uno de los mayores problemas de la IA: la tendencia a sonar seguro de sí mismo mientras se está equivocado. Al darse cuenta de que el robot a menudo conoce la respuesta pero simplemente se pierde en la historia, los autores encontraron una forma de mantenerlo en el camino correcto.

No solo lo supusieron; lo midieron. Demostraron que cuando se aísla el error, el conocimiento está ahí. Probaron que su nuevo método reduce estos tipos específicos de errores. Aunque el artículo señala que esto requiere un poco más de potencia de cómputo para ejecutarse (porque los robots tienen que verificarse a sí mismos varias veces), el intercambio parece valer la pena para hacer que la IA sea más fiable.

En resumen, los autores han dado a la IA una nueva herramienta: un espejo. En lugar de limitarse a mirar hacia el siguiente paso de la historia, el robot ahora aprende a mirar hacia atrás y preguntarse: "¿Encaja esto con todo lo que he dicho hasta ahora?". Y al hacerlo, deja de inventar hechos y empieza a decir la verdad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →