Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction
Este artículo presenta el benchmark de Evaluación de Saturación de Restricciones (CSE, por sus siglas en inglés) para demostrar que, si bien los modelos de lenguaje de gran tamaño pueden seguir restricciones individuales con destreza, su capacidad para satisfacer múltiples restricciones simultáneas colapsa multiplicativamente más allá de las 5–6 restricciones debido a la acumulación independiente de fallos, afectando particularmente el razonamiento estructural sobre los detalles léxicos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando hornear un pastel, pero en lugar de simplemente seguir una receta, te dan una lista de reglas. "Usa exactamente 200 gramos de harina", "No uses nada de azúcar", "El pastel debe ser azul" y "Debe tener forma de estrella". Si solo tienes una regla, es fácil. Si tienes dos o tres, probablemente puedas lograrlo. Pero, ¿qué pasa si alguien te entrega una lista de cincuenta reglas de golpe? Este es el mundo de los Modelos de Lenguaje Extensos (LLM), los programas informáticos superinteligentes que escriben historias, responden preguntas y resuelven problemas. Estos modelos son como chefs digitales que han leído casi todos los libros de la biblioteca. Los científicos han sabido desde hace tiempo que estos chefs son excelentes siguiendo una sola instrucción. Pero nadie estaba seguro de qué pasaba cuando les pedías que hicieran malabares con una docena de instrucciones al mismo tiempo. ¿Disminuye su rendimiento un poco, como un corredor cansado que reduce la velocidad? ¿O se desploma repentinamente, como un castillo de naipes cuando soplas sobre él? Esta pregunta es importante porque, a medida que empezamos a usar a estos chefs de IA para construir herramientas del mundo real —como sistemas de seguridad, documentos legales o código complejo—, necesitamos saber exactamente cuántas reglas pueden manejar antes de empezar a cometer errores.
Entra en escena un nuevo estudio que trata a estos modelos de IA como un experimento científico en una cocina gigante. Los investigadores, liderados por Mariya Vasileva, construyeron un campo de pruebas especial llamado Evaluación de Saturación de Restricciones (CSE). Piensa en esto como una "prueba de estrés" para el cerebro de la IA. No se limitaron a pedirle a los modelos que escribieran una historia; les dieron un número específico de reglas para seguir simultáneamente, que variaba desde una sola regla hasta doce. Estas reglas eran estrictas e inalterables, como "Tu respuesta debe tener exactamente 3 párrafos", "No se permite la letra 'e'" o "Cada oración debe comenzar con la letra 'A'". Los investigadores luego observaron para ver cuántas veces la IA podía acertar en cada una de las reglas al mismo tiempo.
Los resultados fueron sorprendentes y un poco dramáticos. El estudio encontró que los modelos de IA no solo se cansan un poco a medida que añades más reglas; alcanzan un punto de inflexión. Imagina que estás apilando bloques. Para los primeros bloques, la torre es estable. Pero una vez que alcanzas cierta altura —alrededor de 5 o 6 reglas incluso para los modelos más inteligentes—, la torre no solo se tambalea; de repente colapsa. Los investigadores descubrieron que, aunque una IA podría acertar el 40% de las reglas individuales cuando hay ocho de ellas, la probabilidad de que acierte todas las ocho a la vez cae a menos del 6%. Es como un músico que puede tocar una nota perfectamente, o incluso dos, pero en cuanto le pides que toque una sinfonía compleja con doce instrumentos diferentes a la vez, olvida la melodía por completo.
El estudio también descubrió por qué sucede esto. Resulta que las reglas no luchan entre sí como enemigos en un juego. En su lugar, actúan como una reacción en cadena. Si la IA comete un error en una pequeña parte de la respuesta —por ejemplo, si olvida contar las oraciones correctamente—, entonces todas las reglas que dependen de las oraciones fallan al mismo tiempo. No es que las reglas se confundan entre sí; es que la "memoria de trabajo" de la IA se sobrecarga. Los investigadores descubrieron que las reglas que requieren que la IA haga un seguimiento de las cosas a lo largo del tiempo (como contar palabras o mantener un patrón) se rompen dos veces más rápido que las reglas simples (como "no uses una palabra específica").
Quizás la parte más interesante es lo que los investigadores intentaron arreglar. Preguntaron: "¿Podemos ayudar a la IA haciéndola planificar con antelación? ¿O permitiéndole intentarlo de nuevo?". Intentaron darle a la IA un "bloc de notas" para planificar su respuesta, o dejar que corrigiera sus propios errores. ¿El resultado? Ayudó un poco, tal vez permitiendo a la IA manejar una o dos reglas adicionales, pero no detuvo el colapso. La única solución real, sugiere el artículo, es hacer que la IA sea mejor siguiendo cada regla individual en primer lugar. Ninguna cantidad de planificación o reintento puede arreglar el hecho de que la matemática de hacer malabares con demasiadas cosas a la vez eventualmente conduce a una caída en el rendimiento.
Al final, este artículo traza una línea clara en la arena. Para los modelos de IA más inteligentes probados, el límite para el seguimiento fiable de múltiples reglas es de aproximadamente 5 a 6 restricciones. Más allá de eso, el sistema se vuelve poco fiable, no porque la IA sea "estúpida", sino porque la mera cantidad de cosas que tiene que mantener en su cabeza a la vez crea un colapso matemático. Es un recordatorio de que incluso los chefs digitales más avanzados tienen un límite para cuántas recetas pueden seguir a la vez, y si queremos que hagan más, necesitamos construirlos más fuertes, no solo darles más instrucciones.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.