← Últimos artículos
💬 NLP

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

El artículo presenta LARFT, un marco de ajuste fino por refuerzo que cierra la brecha entre la cognición y la acción en modelos de lenguaje grandes mediante el aprendizaje de la autoconciencia de la longitud, logrando así un seguimiento preciso de instrucciones de longitud con un rendimiento general casi inalterado.

Autores originales: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

Publicado 2026-03-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un amigo muy inteligente, un "genio de las palabras" (que es como un Modelo de Lenguaje Grande o LLM), al que le pides escribir un cuento.

El problema es que este genio es un poco desordenado. Si le dices: "Escribe un cuento de exactamente 200 palabras", él a veces escribe 50 palabras (muy corto) y otras veces 2,000 (un libro entero). No es que no sea inteligente; es que no tiene una buena idea de "cuánto" es 200 palabras mientras escribe. Para él, las palabras son solo sonidos que salen de su boca, no tiene un "contador" interno.

Los científicos de este paper (llamado LARFT) decidieron arreglar esto. Aquí te explico cómo lo hicieron con una analogía sencilla:

El Problema: La Brecha entre "Saber" y "Hacer"

Imagina que le pides a un chef que cocine una sopa que pesa exactamente 500 gramos.

  • El método antiguo: Le decías "¡Hazlo de 500 gramos!" y el chef intentaba adivinar. Si se pasaba, le decías "¡No, más corto!" y volvía a intentar. Era un proceso de prueba y error muy lento y frustrante.
  • El problema real: El chef no tenía una balanza en su cabeza. No sabía cuánto pesaba lo que estaba cocinando mientras lo hacía.

La Solución: LARFT (El Chef con Conciencia)

Los autores crearon un nuevo método de entrenamiento llamado LARFT. Imagina que es un entrenamiento especial para el chef que tiene dos partes mágicas:

1. El Entrenamiento con Recompensas (El "Gimnasio")

Primero, entrenan al chef para que intente cumplir la regla. Si escribe 200 palabras cuando le pidieron 200, ¡recibe una estrella dorada (recompensa)! Si se pasa o se queda corto, no recibe la estrella. Esto le enseña a intentar cumplir la regla, pero a veces sigue fallando porque no tiene un buen "sentido" del tamaño.

2. La "Conciencia Retrospectiva" (El Truco Genial)

Aquí está la parte más creativa. Cuando el chef falla (por ejemplo, escribe 300 palabras en lugar de 200), en lugar de simplemente decirle "inténtalo de nuevo", el sistema le hace una pregunta diferente sobre lo que ya escribió:

"Oye chef, mira lo que acabas de escribir. ¿Cuántas palabras crees que hay aquí?"

El chef tiene que responder: "Creo que son 300".
Al hacer esto, el chef aprende a contar lo que ya hizo. Transforma un "error" en una lección de matemáticas.

  • La analogía: Es como si un niño dibuja un círculo muy grande cuando le pediste uno pequeño. En lugar de borrarlo, le preguntas: "¿Cuánto mide este círculo?". Al responder, el niño empieza a entender la relación entre su mano y el tamaño del dibujo.

¿Qué logra esto?

Al combinar estas dos cosas (intentar cumplir la regla + aprender a contar lo que ya escribió), el modelo desarrolla una conciencia interna.

  • Antes: El modelo escribía y luego se daba cuenta (si acaso) de que se había pasado.
  • Ahora: El modelo tiene un "contador" en su cerebro. Mientras escribe, sabe: "Ya llevo 150 palabras, me faltan 50, así que debo parar pronto".

Los Resultados: Un Superhéroe de las Palabras

Los científicos probaron esto con varios modelos de inteligencia artificial (como Qwen y Llama). Los resultados fueron increíbles:

  1. Precisión: Ahora pueden escribir exactamente lo que pides (ni más, ni menos) con una precisión que antes era imposible.
  2. Sin sacrificar inteligencia: Lo mejor de todo es que, al entrenarlos para ser precisos con el tamaño, no perdieron su inteligencia general. Siguen siendo genios en matemáticas, lógica y creatividad. No se volvieron "tontos" por aprender a contar palabras.

En resumen

LARFT es como darle a un artista un lápiz con un contador integrado. Antes, el artista tenía que adivinar cuánto dibujar. Ahora, mientras dibuja, el lápiz le dice: "Ya llevas 100 metros, te quedan 50". Esto cierra la brecha entre lo que el artista sabe (la regla) y lo que hace (el dibujo), permitiéndole crear exactamente lo que necesitas, sin ensayos y errores interminables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →