When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
Este artículo presenta una evaluación diagnóstica que demuestra que, aunque los modelos de lenguaje grandes logran una alta precisión en tareas procedimentales breves, su capacidad para ejecutar fielmente algoritmos paso a paso se degrada significativamente a medida que aumenta la complejidad, revelando que un rendimiento sólido en las evaluaciones a menudo enmascara debilidades sustanciales en el seguimiento de instrucciones.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Idea: La Prueba de la "Receta"
Imagina que le das a un chef una receta muy específica, paso a paso, para hornear un pastel. La receta dice: "Mezcla harina y azúcar. Luego añade huevos. Luego remueve durante 10 segundos. Luego hornea".
Podrías esperar que el chef siga cada instrucción individual en orden. Pero, ¿qué pasa si el chef, en lugar de seguir los pasos, simplemente adivina cómo suele saber un pastel y te entrega un resultado? ¿O qué pasa si llega a la mitad, olvida los últimos tres pasos y simplemente dice: "Aquí tienes el pastel"?
Este artículo es como una gigantesca cocina de pruebas donde los investigadores dieron miles de estas recetas específicas a 14 modelos de IA diferentes ("chefs") (Modelos de Lenguaje Grande). Las recetas eran problemas matemáticos simples, pero estaban diseñadas para ser largas y complicadas. El objetivo no era ver si la IA podía hacer matemáticas difíciles, sino ver si podía seguir fielmente las instrucciones de principio a fin.
La Configuración: La "Escalera Infinita"
Los investigadores diseñaron una prueba especial con dos formas principales de hacer la tarea más difícil:
- La Longitud de la Escalera: Dieron a la IA recetas con desde 5 pasos hasta 95 pasos. Imagina una escalera. Una escalera de 5 pasos es fácil de subir. Una escalera de 95 pasos es agotadora.
- La Regla de "Mirar Atrás": En algunas recetas, el paso 10 no solo usaba el resultado del paso 9. Podría haber dicho: "Vuelve atrás y usa el resultado del paso 3". Esto es como decirle a un excursionista: "Da un paso adelante, luego regresa al tercer árbol que pasaste y recoge una piedra de allí". Obliga a la IA a recordar cosas de muy atrás en el pasado.
Lo Que Encontraron: El "Olvido de Memoria"
Los resultados fueron sorprendentes. Aunque las matemáticas eran simples (solo sumar, restar, multiplicar o dividir), las IAs empeoraban cada vez más a medida que las recetas se hacían más largas.
- La Caída: En una receta corta de 5 pasos, las IAs dieron la respuesta correcta aproximadamente el 61% de las veces. Pero en una receta larga de 95 pasos, su tasa de éxito se desplomó hasta solo el 20%.
- El Problema de "Mirar Atrás": Cuando la IA tenía que recordar pasos de muy atrás (como el paso 3), su rendimiento cayó aún más. Es como si la IA se confundiera sobre dónde estaba en la historia.
Cómo Fallaron las IAs: Los "Chefs Tramposos"
Los investigadores no solo miraron la respuesta final; observaron cómo la IA intentaba resolver el problema. Descubrieron que las IAs a menudo no hacían realmente el trabajo. En su lugar, intentaban "hacer trampa" o "tomar atajos" de varias formas divertidas:
- La "Salida Anticipada" (Subejecución): Este fue el fallo más común. La IA comenzaría la receta, haría unos pocos pasos, se aburriría o se confundiría, y luego saltaría directamente al final, fingiendo que había terminado todo. Es como un estudiante que escribe la primera oración de un ensayo, luego salta a la conclusión sin escribir el medio.
- Los Pasos "Alucinados": A veces la IA inventaba pasos extra que no estaban en la receta en absoluto. Es como si un chef añadiera "espolvorea polvo de unicornio" cuando la receta nunca dijo hacer eso.
- La Trampa de la "Autocorrección": A veces la IA daría la respuesta incorrecta, se daría cuenta y trataría de arreglarla más adelante en el texto. Pero para cuando la arreglaba, ya había estropeado el resultado final.
- El "Coincididor de Patrones": En lugar de hacer las matemáticas, algunas IAs parecían adivinar la respuesta basándose en cómo se veían los números, en lugar de seguir realmente los pasos.
La Conclusión Principal
El artículo concluye que solo porque una IA te da una respuesta final "plausible", no significa que realmente haya hecho el trabajo.
Piénsalo como un estudiante que hace un examen. Si obtiene la respuesta correcta, podrías pensar que estudió. Pero este artículo muestra que a veces, simplemente están adivinando o recordando la respuesta de un examen anterior, en lugar de resolver realmente el problema paso a paso.
En resumen: Los modelos de IA actuales son excelentes para sonar inteligentes y dar un resultado final, pero luchan por actuar como un robot confiable que sigue una lista larga y aburrida de instrucciones exactamente como están escritas. Cuando las instrucciones se vuelven demasiado largas o requieren recordar demasiado del pasado, la IA tiende a perder el rastro y dejar de seguir las reglas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.