← Últimos artículos
🤖 machine learning

Amortizing intractable inference in large language models

Este artículo propone el uso de GFlowNets para amortizar la inferencia intratable en modelos de lenguaje de gran tamaño, permitiéndoles muestrear de distribuciones posteriores complejas para tareas como la generación con restricciones y el razonamiento de cadena de pensamiento como una alternativa eficiente en datos al entrenamiento tradicional de máxima verosimilitud o de maximización de recompensa.

Autores originales: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

Publicado 2026-09-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son vastas bibliotecas de conocimiento humano, comprimidas en redes digitales que predicen la siguiente palabra en una oración basándose en lo que hubo antes. Están entrenados para ser excelentes continuando una historia o respondiendo una pregunta cuando se les da un punto de partida, un proceso que fluye naturalmente de izquierda a derecha. Sin embargo, muchas de las tareas más interesantes que queremos que estos modelos realicen requieren pensar en reversa o completar el medio de una historia. Imagine que se le entrega el principio y el final de un relato y se le pide que invente el medio, o que se le pida explicar el razonamiento detrás de una respuesta específica. En estos escenarios, el modelo no puede simplemente adivinar la siguiente palabra; debe buscar a través de un paisaje masivo y complejo de posibilidades para encontrar el camino específico que conecte el inicio con el final. Este es un problema matemático difícil porque el número de posibles caminos es tan enorme que comprobarlos uno por uno es imposible, y los métodos estándar para navegar ese paisaje a menudo se quedan estancados en solo una o dos rutas comunes, perdiendo la rica variedad de soluciones válidas que existen.

Investigadores del Instituto de IA Mila – Quebec y la Universidad de Oxford han desarrollado una nueva forma de enseñar a estos modelos cómo navegar ese complejo paisaje. En lugar de entrenar al modelo para simplemente maximizar una puntuación para la "mejor" respuesta, lo que a menudo conduce a un pensamiento repetitivo y estrecho, utilizaron un método llamado inferencia amortizada. Este enfoque trata el problema como una búsqueda de un conjunto diverso de caminos correctos en lugar de uno solo perfecto. Para lograr esto, emplearon una técnica conocida como red de flujo generativo, que actúa como una guía que aprende a muestrear de todo el rango de soluciones posibles, asegurando que el modelo explore diferentes cadenas de razonamiento válidas en lugar de colapsar en un único patrón sobreutilizado.

El equipo demostró esto ajustando modelos de lenguaje extensos para resolver problemas que requieren un razonamiento de múltiples pasos, como cálculos aritméticos o clasificar si la reseña de una película expresa una opinión o un hecho. En un experimento, pidieron al modelo que completara la oración intermedia faltante de una historia corta, dado el principio y el final. Los métodos estándar producían a menudo oraciones que eran gramaticalmente correctas pero que no encajaban con el flujo narrativo. El nuevo método, sin embargo, generó con éxito oraciones intermedias que vinculaban el inicio y el fin de manera coherente, mostrando una capacidad mucho mayor para comprender el contexto completo. En otra prueba que involucraba problemas matemáticos simples, el modelo fue equipado con una herramienta de calculadora y se le pidió que desglosara el cálculo en pasos. Mientras que otros métodos de entrenamiento causaban que el modelo repitiera números o fallara al usar la herramienta correctamente, el nuevo enfoque enseñó al modelo a planificar sus pasos cuidadosamente, lo que condujo a una mejora dramática en la precisión, especialmente en problemas que nunca había visto antes.

Los resultados sugieren que este método es particularmente poderoso cuando los datos escasean. En una prueba con solo diez ejemplos de reseñas de películas para aprender, el nuevo método logró una precisión significativamente mayor que las técnicas de entrenamiento estándar, y continuó superándolas incluso con cincuenta ejemplos. Los investigadores encontraron que al fomentar que el modelo muestree una amplia variedad de caminos de razonamiento y luego combine sus conclusiones, el sistema se volvía más robusto y confiable. Esta es una distinción crucial porque significa que el modelo no solo está memorizando una única forma de resolver un problema, sino que está aprendiendo la estructura subyacente de cómo razonar a través de él. El estudio indica que, al cambiar el objetivo de encontrar la respuesta única más probable a explorar la plena diversidad de respuestas correctas, podemos hacer que estas poderosas herramientas sean más flexibles y mejores para tareas de razonamiento complejo.

El trabajo también destaca una limitación en cómo se entrenan los modelos actuales. Cuando se presiona a los modelos para maximizar una recompensa, tienden a encontrar atajos, como repetir la misma frase o ignorar la lógica real de un problema, solo para obtener una puntuación alta. Los investigadores demostraron que su método evita esta trampa al igualar la distribución completa de las soluciones posibles, asegurando que el modelo no colapse en un único y defectuoso modo de pensamiento. Este enfoque permite que el modelo generalice mejor ante nuevas situaciones, como resolver problemas aritméticos con más números de los que fue entrenado, donde otros métodos fallaron. Los hallazgos ofrecen un camino prometedor para hacer que la inteligencia artificial sea más capaz de un razonamiento genuino, yendo más allá del simple reconocimiento de patrones hacia una comprensión más matizada de cómo construir argumentos y resolver problemas paso a paso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →