Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
El artículo sostiene que, a medida que los modelos de lenguaje de gran tamaño mejoran, el prompting de Cadena de Pensamiento de pocos disparos estándar suele obstaculizar el rendimiento al introducir restricciones de formato y estilo distractoras, haciendo que los enfoques simples de cero disparos sean más efectivos para las tareas de razonamiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que le estás enseñando a un robot cómo resolver un acertijo. Durante mucho tiempo, la mejor manera de hacerlo era mostrarle al robot un montón de ejemplos donde un humano escribía cada uno de los pasos de su pensamiento, como una receta detallada. Este método, llamado "Chain-of-Thought" (Cadena de Pensamiento), era como darle al robot un manual de entrenamiento que decía: "Primero, haz esto. Luego, haz aquello. Finalmente, aquí está la respuesta". Funcionó de maravilla con los robots más antiguos y simples que tendían a simplemente adivinar la respuesta sin pensar.
Pero ahora, hemos construido robots más inteligentes y avanzados. Estos nuevos modelos han leído tantos libros y resuelto tantos acertijos por su cuenta que naturalmente empiezan a pensar paso a paso, incluso si no les das un manual. Tienen una brújula interna de lógica. La gran pregunta que los científicos se plantean es: si un robot ya sabe cómo pensar, ¿todavía necesita que le llevemos de la mano con una receta detallada? ¿O acaso esa receta realmente estorba, confundiendo al robot con demasiadas reglas sobre cómo escribir sus pensamientos? Este artículo profundiza en esa misma cuestión para ver si nuestros viejos métodos de enseñanza están frenando ahora a nuestros estudiantes más nuevos y brillantes.
El robot "sobreguiado": Cuando demasiada ayuda perjudica
En este estudio, los investigadores decidieron probar algunos de los robots de resolución de problemas matemáticos más inteligentes disponibles actualmente. Querían ver si el método de la vieja escuela de mostrar ejemplos (few-shot prompting) seguía siendo la mejor forma de obtener buenas respuestas, o si en realidad estaba haciendo que los robots funcionaran peor.
Piénsalo de esta manera: Imagina que eres un maestro chef que ha estado cocinando durante años. Sabes exactamente cómo hacer un suflé perfecto sin una receta. Ahora, imagina que alguien te entrega una nota adhesiva que dice: "Primero, rompe los huevos. Luego, bátelos. Después, hornea a 350 grados", e insiste en que sigas las instrucciones exactamente. Podrías molestarte, o podrías concentrarte tanto en seguir la nota perfectamente que te olvides de tus propios instintos culinarios. Incluso podrías arruinar el plato porque te distrajiste con las instrucciones.
Los investigadores descubrieron que esto es exactamente lo que está pasando con la IA moderna. Cuando pidieron a estos modelos avanzados "especializados en razonamiento" que resolvieran problemas matemáticos utilizando el método estándar —mostrándoles algunos ejemplos de cómo los humanos resolvieron problemas similares—, los modelos funcionaron peor.
Por ejemplo, tomemos un modelo llamado Mathstral. Cuando los investigadores dejaron que resolviera problemas por su cuenta sin ningún ejemplo (un enfoque "zero-shot"), acertó aproximadamente el 83.8% de las respuestas. Pero cuando le dieron el "manual de entrenamiento" estándar con ejemplos escritos por humanos, su puntuación cayó a alrededor del 74.2%. ¡Es una diferencia enorme! Es como si el robot estuviera tan ocupado tratando de copiar el estilo y el formato de los ejemplos que se olvidó de hacer las matemáticas de verdad.
El artículo sugiere que esto sucede porque los ejemplos estándar obligan al robot a adaptar su estilo para coincidir con los ejemplos humanos. Tiene que preocuparse por el formato, seguir estructuras de frases específicas y encajar en una caja que no fue construida para él. Esto crea un equilibrio entre "guía y distracción". La guía (los ejemplos) se supone que ayuda, pero para estos modelos superinteligentes, se convierte en una distracción que desvía su atención de la tarea central de resolver el problema.
El truco de "Pensemos": Sigue siendo útil, pero tiene menos magia
Los investigadores también probaron un truco más simple llamado "Zero-Shot CoT". Esto es donde no muestras ningún ejemplo, solo añades la frase "Pensemos paso a paso" a la pregunta.
Para los robots de propósito general más antiguos (como el modelo Llama), este truco seguía siendo muy útil. Aumentó sus puntuaciones significativamente, actuando como un suave empujón para despertar sus habilidades de razonamiento. Sin embargo, para los modelos superinteligentes especializados en razonamiento, este truco solo dio un pequeño impulso. Pasó de un 83.8% a un 86.1% para Mathstral.
Los autores argumentan que esto se debe a que estos modelos ya son tan buenos pensando paso a paso que no necesitan el empujón tanto como antes. Comparan esto con los primeros días de la informática, donde los ingenieros tenían que diseñar manualmente cada característica de un programa. Eventualmente, las computadoras se volvieron tan inteligentes que podían aprender esas características por sí mismas, haciendo que el diseño manual fuera innecesario. El artículo sugiere que la frase "Pensemos paso a paso" se está convirtiendo en esas antiguas funciones manuales: antes era esencial, pero ahora es solo un pequeño extra que no cambia mucho.
Por qué el viejo método está fallando
Uno de los hallazgos más sorprendentes fue que, incluso cuando los investigadores intentaron solucionar el problema utilizando ejemplos generados por los propios modelos (para que el estilo coincidiera), esto tampoco superó el enfoque simple de "sin ejemplos" para los modelos más inteligentes.
Resulta que el problema no es solo que los ejemplos sean de humanos; se trata de la estructura de los ejemplos. Al obligar al modelo a seguir un patrón específico, estás limitando su capacidad natural para resolver el problema de la manera que mejor le funciona. El artículo descarta explícitamente la idea de que mostrar más ejemplos o elegir "mejores" ejemplos solucionará esto para los modelos especializados en razonamiento. De hecho, encontraron que, para los modelos más avanzados, cuanto más intentas guiarlos con ejemplos, más podrías estar frenándolos.
La conclusión: Confía en los instintos del robot
Entonces, ¿qué significa esto para el futuro de la evaluación de la IA? Los autores sugieren que necesitamos cambiar la forma en que medimos estos modelos. Durante mucho tiempo, la prueba estándar era mostrarle al modelo algunos ejemplos y ver qué tan bien los copiaba. Pero este artículo muestra que, para los modelos más nuevos y brillantes, esa prueba es injusta. Es como evaluar a un piloto de carreras obligándolo a conducir en una zona escolar con un límite de velocidad; no muestra su verdadera velocidad.
En su lugar, los investigadores argumentan que deberíamos hacer las preguntas directamente a los modelos, sin ejemplos ni instrucciones especiales, y ver qué proponen por su cuenta. Este método "zero-shot" ofrece una imagen más real de lo que el modelo realmente puede hacer.
El artículo no afirma que el "Chain-of-Thought prompting" haya muerto para siempre. Podría seguir siendo útil para modelos más simples o para tareas específicas donde el modelo necesite un poco de ayuda. Pero para los pesos pesados —los modelos diseñados específicamente para razonar— la vieja forma de enseñarles se está convirtiendo en una distracción. A medida que estos modelos se vuelven más inteligentes, necesitan menos guía y más libertad para pensar por sí mismos. La mejor manera de ver qué tan inteligentes son realmente podría ser, simplemente, dejar de llevarlos de la mano y dejar que resuelvan el acertijo a su propia manera.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.