← Últimos artículos
🤖 machine learning

From Drift to Coherence: Stabilizing Beliefs in LLMs

Este artículo demuestra que, si bien los modelos de lenguaje de gran tamaño exhiben inicialmente una deriva de creencias que viola la propiedad de martingala durante el remuestreo autorregresivo de respuestas, eventualmente se autoestabilizan en distribuciones predictivas coherentes, un fenómeno aprovechado para proponer estrategias de prompting y ajuste fino que reducen la deriva y mejoran la coherencia sin sacrificar la precisión.

Autores originales: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

Publicado 2026-06-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un robot muy inteligente y culto (un Modelo de Lenguaje Extenso o LLM) al que le haces una pregunta. Normalmente, esperas que te dé una respuesta y se mantenga fiel a su razonamiento. Pero este artículo descubre algo extraño: si le pides al robot que responda a la misma pregunta repetidamente en una secuencia, su confianza tambalea.

Aquí está la historia de cómo los autores arreglaron ese tambaleo, explicada de forma sencilla.

El Problema: El "Cerebro Tambaleante" del Robot

Piensa en el cerebro del robot como una persona que intenta adivinar el clima.

  1. El Ideal: Si el robot fuera un pensador bayesiano perfecto (un término elegante para un adivinador probabilístico perfecto), su confianza debería ser estable. Si piensa que hay un 70% de probabilidad de lluvia, ese 70% no debería cambiar solo porque lo pensó una segunda vez.
  2. La Realidad: Los autores descubrieron que cuando le pedían al robot generar una secuencia de respuestas a la misma pregunta, su confianza interna derivaba.
    • Analogía: Imagina que le preguntas a un amigo: "¿Va a llover?". Él dice: "Estoy un 70% seguro". Luego, sin mirar afuera de nuevo, le preguntas otra vez inmediatamente. Él podría decir de repente: "En realidad, solo estoy un 50% seguro". Luego le preguntas de nuevo y dice: "¡Espera, tal vez un 80%!".
    • Este "tambaleo" significa que las creencias del robot son inestables a corto plazo. Es como una brújula que gira salvajemente antes de finalmente apuntar al Norte.

El Descubrimiento: Eventualmente se Estabiliza

Los investigadores notaron algo interesante: si seguías pidiéndole al robot que respondiera a la misma pregunta muchas veces (como 20 o 30 veces seguidas), el tambaleo eventualmente se detenía. La confianza del robot se estabilizaba y se asentaba en un número constante.

  • La Metáfora: Es como agitar un frasco de canicas mezcladas. Al principio, los colores se agitan caóticamente. Pero si dejas el frasco quieto, las canicas se asientan y finalmente puedes ver la proporción real de colores. El robot necesita un "periodo de asentamiento" (llamado fase de burn-in) para encontrar su verdadera creencia.

La Solución: Dos Trucos para Detener el Tambaleo

El problema es que esperar a que el robot se asiente toma mucho tiempo y consume mucha potencia de cómputo. Los autores idearon dos formas de hacer que el robot sea estable de inmediato.

1. El Truco del "Calentamiento" (Siembra de Respuestas)

En lugar de pedirle al robot que comience en frío, los autores le dan una lista de "calentamiento" de respuestas primero.

  • Cómo funciona: Le piden al robot que genere unas pocas respuestas aleatorias a la pregunta una sola vez, y luego le reinyectan esas respuestas al robot como parte del prompt antes de pedirle que comience la secuencia real.
  • La Analogía: Es como un músico afinando su instrumento antes de un concierto. En lugar de empezar la canción con una nota estridente y desafinada, toca algunas notas rápidas para ajustar el tono. El robot utiliza estas respuestas "semilla" para saltar directamente a la zona estable, saltándose el tambaleo caótico del principio.

2. El Truco del "Entrenamiento" (Pérdida de Autoconsistencia)

Los autores también enseñaron al robot a ser estable cambiando la forma en que aprende.

  • Cómo funciona: Crearon una lección matemática especial (una "función de pérdida") donde le mostraban al robot sus propias respuestas futuras. Le dijeron al robot: "Tu respuesta ahora mismo debe coincidir con lo que dirás en 5 pasos".
  • La Analogía: Imagina a un estudiante que suele ponerse nervioso y cambia de opinión durante un examen. El profesor le da una regla: "Lo que escribas en la pregunta #1, debes ser capaz de defenderlo cuando llegues a la pregunta #10". Al practicar esta regla, el estudiante aprende a ser consistente desde el primer segundo, para que no necesite "tambalearse" para encontrar su confianza más tarde.

Los Resultados

Cuando probaron estos trucos en preguntas de opción múltiple estándar (como cuestionarios de sentido común o ciencia):

  • Menos Tambaleo: La confianza del robot dejó de derivar y se mantuvo constante.
  • Mejor Capacidad de Adivinación: El robot se volvió mejor en saber qué tan seguro estaba de sus respuestas (calibración).
  • Misma Precisión: Crucialmente, hacer al robot más estable no lo hizo más tonto. Seguía obteniendo las respuestas correctas con la misma frecuencia que antes, pero ahora era más confiable sobre cuándo estaba en lo cierto.

La Conclusión

El artículo muestra que, aunque los modelos de IA suelen comenzar con un sistema de creencias "tambaleante" al generar secuencias, naturalmente quieren ser consistentes. Al usar un poco de datos de "calentamiento" o al entrenarlos para que coincidan con sus versiones futuras, podemos hacerlos estables y confiables de inmediato, sin necesidad de esperar a que se asienten por su cuenta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →