From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond
Este artículo desafía la distinción binaria entre los modelos de lenguaje de gran tamaño y los modelos de mundo al argumentar que los LLM son un caso especial degenerado de los modelos de mundo, proponiendo un espectro continuo de arquitecturas desde la predicción de tokens hasta la simulación en el espacio latente, al tiempo que destaca los importantes desafíos de investigación para escalar a entornos con etiquetas de acción y adaptar las arquitecturas de transformadores para la predicción de estados continuos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El gran malentendido: ¿Dos mundos diferentes?
Imagina que la comunidad de la IA está discutiendo sobre dos tipos diferentes de viajeros.
- Grupo A (LLMs): Dice: "Solo somos predictores de palabras. Miramos la última palabra que escribiste y adivinamos la siguiente. No sabemos nada sobre el mundo real; solo sabemos cómo encajan las palabras entre sí".
- Grupo B (Modelos de Mundo): Dice: "Somos simuladores de la realidad. Construimos un mapa mental de cómo funciona el mundo para poder planificar con antelación, como un jugador de ajedrez que piensa tres movimientos por delante".
El artículo sostiene que estos dos grupos en realidad están mirando lo mismo desde ángulos diferentes. El autor, Paul Dubois, dice: "No estás mirando a dos especies diferentes; estás mirando a un cachorro y a un lobo adulto. El cachorro es solo una versión muy restringida del lobo".
Reclamación n.º 1: El "cachorro" es en realidad un "lobo" en una habitación diminuta
El artículo afirma que los Grandes Modelos de Lenguaje (LLMs) son en realidad Modelos de Mundo, pero están atrapados en una habitación muy pequeña y aburrida.
- La Habitación (Estado): En un Modelo de Mundo normal, la "habitación" es todo el universo (coches, clima, personas, física). En un LLM, la "habitación" es solo una cadena de palabras.
- La Acción: En un Modelo de Mundo normal, puedes hacer muchas cosas (conducir, saltar, hablar). En un LLM, lo único que puedes hacer es añadir una palabra.
- El Truco: Aunque al LLM solo se le permite añadir palabras, este construye secretamente un mapa del mundo dentro de su cerebro (sus capas ocultas).
- La Analogía: Imagina a una persona a la que solo se le permite hablar con palabras sueltas. Si le pides que juegue una partida de ajedrez usando solo palabras como "Peón", "Rey", "Jaque", no puede mover las piezas físicamente. Pero dentro de su cabeza, está visualizando el tablero de ajedrez completo perfectamente. Las palabras son solo la interfaz, pero el modelo de mundo vive dentro de su mente.
El artículo demuestra esto mostrando que los modelos entrenados solo con texto pueden "ver" cosas como la disposición de un tablero de ajedrez o el paso del tiempo, a pesar de que nunca se les enseñaron esos conceptos directamente.
Reclamación n.º 2: Es una rampa suave, no un precipicio
Muchos expertos (como Yann LeCun) dicen que debemos abandonar por completo los modelos de predicción de palabras y cambiar a un sistema completamente nuevo llamado JEPA (un sistema que predice estados futuros en un espacio "latente" u oculto).
El artículo dice: "No saltes al vacío. Solo sube por una rampa".
El autor describe un espectro continuo (un deslizamiento suave) que conecta al simple predictor de palabras con el complejo simulador de la realidad. No tienes que tirar el modelo viejo; solo tienes que relajar las reglas una por una.
Aquí está el camino por la rampa:
- El Punto de Partida (LLM Estándar): Predice una palabra a la vez.
- Pros: Tenemos datos infinitos (todo internet) y una herramienta perfecta (la arquitectura Transformer) para esto.
- Paso 1: Predicción de Múltiples Tokens: Predice unas pocas palabras a la vez.
- Cambio: Dejamos de forzar al modelo a adivinar una letra a la vez. Se vuelve un poco más inteligente en su razonamiento, pero seguimos usando texto de internet y las mismas herramientas.
- Paso 2: Resumen del Futuro: Predice un resumen comprimido del futuro.
- Cambio: En lugar de adivinar la siguiente palabra, adivina la "esencia" del siguiente párrafo. Sigue usando texto de internet.
- Paso 3: Predicción del Siguiente Latente: Predice el siguiente "pensamiento" (un estado oculto) en lugar de una palabra.
- Cambio: El modelo deja de producir palabras y empieza a producir conceptos internos. Esto es más difícil de entrenar, pero aún podemos usar texto de internet.
- La Cima de la Rampa (JEPA): Predice el siguiente estado del mundo real basado en una acción.
- La Gran Caída: Aquí, lo fácil desaparece.
- Problema de Datos: Ya no podemos usar internet. Necesitamos datos de robots, coches autónomos o videojuegos donde sepamos exactamente qué acción causó qué resultado. Estos datos son escasos y difíciles de conseguir.
- Problema de Arquitectura: La herramienta "Transformer" que usamos para las palabras podría no funcionar bien para la realidad continua. Podríamos necesitar una herramienta completamente nueva.
- La Gran Caída: Aquí, lo fácil desaparece.
Los Dos Grandes Cuellos de Botella
El artículo identifica dos razones principales por las que estamos estancados en la base de la rampa (la etapa del LLM) y no hemos llegado a la cima (la etapa de JEPA):
- El Precipicio de los Datos:
- En la base: Tenemos billones de palabras en internet para aprender. Es gratis y fácil.
- En la cima: Necesitamos millones de interacciones específicas y etiquetadas (como un robot chocando contra una pared). Esto es caro y difícil de recolectar.
- La Pregunta de la Arquitectura:
- En la base: El Transformer es una máquina construida específicamente para palabras. Es como una llave inglesa que encaja perfectamente en un tornillo cuadrado.
- En la cima: Necesitamos predecir la realidad continua (como el movimiento de un fluido). La llave inglesa podría no encajar. Podríamos necesitar una herramienta nueva, pero aún no sabemos cómo es.
Conclusión: No quemes el puente
El artículo conclula que no necesitamos desechar nuestros modelos de IA actuales.
- LeCun tiene razón en que los simples predictores de palabras no pueden realizar planes físicos complejos por sí solos.
- Pero se equivoca al decir que tenemos que empezar de cero.
En su lugar, debemos ver los modelos actuales como el primer paso de un largo viaje. Podemos actualizarlos lentamente, paso a paso, pasando de predecir palabras a predecir conceptos y, finalmente, a predecir la realidad. El destino está claro, pero el camino es un ascenso gradual, no un salto repentino.
En resumen: Los LLM no son modelos de mundo "falsos"; son simplemente modelos de mundo con las manos atadas a la espalda. Si desatamos esas manos poco a poco, llegaremos a la IA poderosa que deseamos, sin necesidad de inventar un universo completamente nuevo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.