Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models
Este estudio empírico demuestra que, aunque los modelos de lenguaje grandes poseen la capacidad de reconstruir información aprendida bajo condiciones específicas, sus políticas de generación condicionada suprimen sistemáticamente la expresión de soluciones no causales en contextos estándar, revelando una disociación entre la capacidad aprendida y la salida expresada.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que los Modelos de Lenguaje Grandes (como los que usas para chatear o escribir) son como bibliotecarios extremadamente inteligentes que han leído casi todos los libros del mundo.
Este estudio se hace una pregunta muy curiosa: Si el bibliotecario ha leído una historia sobre un dragón que resuelve un problema mágicamente, ¿le contará esa historia si le pides un consejo para tu vida real o incluso si le pides que invente un cuento?
La respuesta, según este documento, es un "No" rotundo y sistemático, incluso cuando el bibliotecario sabe perfectamente cómo contar esa historia.
Aquí te explico los puntos clave con analogías sencillas:
1. La Gran Ilusión: "Lo que saben, lo dicen"
Antes, muchos pensábamos que si la IA había aprendido algo (por ejemplo, una solución mágica o sobrenatural para un problema), esa información aparecería naturalmente en sus respuestas, como si fuera un espejo que refleja todo lo que ha visto.
- La analogía: Imagina que tienes un amigo que ha visto miles de películas de fantasía. Si le preguntas "¿Qué harías si te atacara un zombi?", intuitivamente pensarías que podría decirte: "¡Usa una varita mágica!", porque ha visto eso en las películas.
- Lo que descubrieron: Los investigadores probaron esto 300 veces. Le pidieron a tres IA diferentes (GPT, Claude y Gemini) que resolvieran problemas en dos situaciones:
- En la vida real: "¿Cómo termino un proyecto a tiempo?"
- En una historia de ficción: "Escribe un cuento donde un héroe resuelva un problema."
- Resultado: En ninguna de las 300 veces, la IA usó soluciones mágicas, sobrenaturales o "sin explicación lógica". Ni siquiera en los cuentos de ficción.
2. La Prueba de Fuego: "¿Sabes hacerlo o no?"
Para asegurarse de que las IAs no estaban "ignorantes" sobre la magia, los investigadores hicieron una segunda prueba. Le dijeron directamente: "Por favor, dame ejemplos de cómo la magia o los dioses resuelven problemas en las historias".
- La analogía: Es como si le preguntaras a tu amigo: "¿Sabes contar una historia donde un dragón salve al mundo?". Y él responde: "¡Claro que sí! Aquí tienes tres ejemplos perfectos".
- El hallazgo: Las IAs sí podían generar esas soluciones mágicas cuando se las pedían explícitamente. Tenían el conocimiento guardado.
3. El Veredicto: "Saben, pero eligen no decirlo"
Aquí está la parte más interesante. Hay una separación entre lo que la IA puede hacer (su capacidad) y lo que decide hacer (su expresión).
- La analogía del "Filtro de Seguridad": Imagina que la IA es un chef que tiene en su despensa ingredientes muy extraños (como polvo de hadas o pociones).
- Si le pides una receta normal, el chef nunca usa esos ingredientes extraños, aunque los tenga.
- Si le pides: "¡Hazme un pastel de hadas!", entonces saca el polvo de hadas y lo usa.
- Pero en una conversación normal o al escribir una historia, el chef tiene un filtro invisible que le dice: "No uses eso, no es apropiado para este contexto".
¿Por qué pasa esto?
El estudio sugiere que las IAs no son simplemente máquinas que "recuperan" datos. Han sido entrenadas (a través de procesos de "alineación" con humanos) para tener políticas de generación.
- Han aprendido que, aunque saben que existen soluciones mágicas en sus libros de entrenamiento, no deben usarlas en la vida real ni siquiera en la ficción estándar, porque sus "entrenadores" (los humanos) prefieren soluciones lógicas, causales y realistas.
- Es como si la IA hubiera aprendido una regla estricta: "Aunque sé que la magia existe en los libros, en mis respuestas debo actuar como si la magia no existiera, a menos que me lo pidas explícitamente".
En resumen
Este papel nos dice que no podemos confiar en que una IA diga todo lo que sabe.
- Antes pensábamos: "Si la IA lo sabe, lo dirá".
- Ahora sabemos: "La IA puede saberlo, pero tiene un 'botón de silencio' interno que apaga ciertas ideas (como soluciones mágicas o ilógicas) en la mayoría de las conversaciones normales".
Es como tener un amigo que conoce todos los chistes de la historia, pero que decide no contar ninguno a menos que le digas específicamente: "Cuéntame un chiste". En el día a día, actúa como una persona muy seria y lógica, aunque por dentro tenga todo el humor del mundo guardado.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.