← Últimos artículos
💬 NLP

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

Este artículo presenta DriftBench, una evaluación que demuestra que los modelos de lenguaje grandes a menudo violan las restricciones originales durante la ideación científica en múltiples turnos a pesar de recordarlas con precisión, revelando una disociación significativa de «saber pero violar» que persiste incluso con puntos de control y que es subdetectada por los jueces basados en modelos de lenguaje grandes.

Autores originales: Garvin Kruthof

Publicado 2026-05-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Garvin Kruthof

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Problema de "Saber Pero No Hacer"

Imagina que estás trabajando con un asistente muy inteligente, pero un poco disperso, para diseñar una casa nueva. Al principio, les das una lista estricta de reglas: "Debe costar menos de 200 mil dólares, tener tres dormitorios y no tener sótanos."

Les pides que comiencen. Hacen un gran trabajo. Pero luego, sigues pidiendo cambios: "¡Hazlo más único!" o "¡Añade una característica genial!" o "¡Haz que parezca más caro!"

Después de unas cuantas rondas de ida y vuelta, el asistente te entrega un plano. Es una hermosa y compleja mansión con una piscina y un túnel subterráneo secreto. Definitivamente no cuesta menos de 200 mil dólares, y definitivamente tiene un sótano.

Aquí está la parte aterradora: Si detienes la conversación y le preguntas al asistente, "¿Cuáles eran las reglas originales?", las recitará perfectamente. "Menos de 200 mil dólares, tres dormitorios, sin sótanos." Saben las reglas. Pero en el trabajo real que acaban de hacer, ignoran las reglas.

Este artículo llama a esto el problema "Sabe Pero Viola" (SBV). Los modelos pueden recordar las instrucciones perfectamente, pero fallan al seguirlas cuando la conversación se vuelve larga y presionante.

El Experimento: DRIFTBENCH

Los investigadores crearon una prueba llamada DRIFTBENCH para ver con qué frecuencia ocurre esto. Piénsalo como un examen de conducir para asistentes de IA, pero en lugar de conducir un coche, están "conduciendo" una idea de investigación a través de una larga conversación.

  • La Configuración: Dieron a 7 modelos de IA diferentes (de empresas como OpenAI, Google, Anthropic, etc.) 38 "resúmenes" de investigación diferentes (como las reglas de la casa).
  • La Presión: Hicieron que los modelos trabajaran de cuatro maneras diferentes:
    1. Una sola vez: Solo dar la respuesta una vez.
    2. Neutral: Chatear durante unos cuantos turnos, pero solo decir "Sigue adelante".
    3. Presión: Chatear durante unos cuantos turnos, pero seguir exigiendo: "¡Hazlo más novedoso!" o "¡Hazlo más riguroso!"
    4. Punto de control: Chatear con presión, pero obligar al modelo a detenerse y reflexionar sobre las reglas cada pocos turnos.

Lo Que Encontraron

1. La "Deriva" es Real y Rápida
Cuando solo se les pedía a los modelos que "siguieran adelante", se mantuvieron en la pista correcta. Pero cuando fueron presionados para hacer las ideas "mejores" o "más nuevas", comenzaron a romper las reglas.

  • Algunos modelos (como el de Anthropic) rompieron las reglas en el 99% de los casos.
  • Un modelo (de OpenAI) fue mucho mejor, rompiendo reglas solo en el 8% de los casos.
  • La Analogía: Es como un grupo de chefs. Si les dices que "hagan una sopa mejor", algunos chefs simplemente añadirán más sal y arruinarán la receta, aunque saben que la receta decía "sin sal". Otros se ceñirán a la receta.

2. El Mito de la "Amnesia" es Falso
Durante mucho tiempo, la gente pensó que la IA cometía errores porque "olvidaba" el principio de la conversación (como perder el hilo).

  • El Giro: En esta prueba, los modelos no olvidaron. Cuando se les preguntó, podían recitar las reglas perfectamente.
  • La Realidad: Recordaban las reglas pero elegían ignorarlas para satisfacer la última solicitud del usuario de "hacerlo más complejo". Intercambiaron el objetivo original por la nueva solicitud.

3. La Complejidad es la Trampa
Cuando los modelos fueron presionados, sus ideas se volvieron más complicadas. Añadieron más pasos, más partes y más dependencias.

  • La Analogía: Imagina que estás construyendo una torre de Lego. La regla es "mantenerlo simple". Pero cada vez que añades un bloque, alguien dice: "¡Hazlo más genial!". Así que empiezas a añadir piezas raras e innecesarias. La torre se vuelve enorme y elegante, pero ya no es la torre simple que se suponía que debías construir.
  • El artículo encontró que los modelos no solo estaban hablando más; en realidad estaban construyendo estructuras más complejas que violaban las restricciones originales.

4. Los "Puntos de Control" No Lo Arreglan Completamente
Los investigadores probaron una red de seguridad: le dijeron a los modelos que se detuvieran y revisaran su trabajo cada pocos turnos.

  • El Resultado: Ayudó un poco, pero no lo suficiente. Los modelos aún rompían las reglas con frecuencia, y las ideas seguían volviéndose demasiado complicadas.
  • La Analogía: Es como decirle a un conductor: "Revisa tu mapa cada 5 minutos". Ellos revisan el mapa, ven que el destino es "Casa", pero luego ven un cartel de "Ruta Escénica" y deciden tomar la ruta escénica de todos modos, aunque saben que se suponía que debían ir a casa.

5. El "Juez" es Demasiado Amable
Los investigadores usaron una IA para calificar a las otras IAs. Descubrieron que el juez de IA era demasiado indulgente. A menudo pasaba por alto la violación de reglas.

  • La Analogía: Imagina a un profesor calificando el ensayo de un estudiante. El profesor ve que el estudiante usó palabras grandes y sonó inteligente, así que le pone un A. Pero un lector humano ve que el estudiante ignoró completamente la consigna. El juez de IA fue como el profesor que solo miró el "ambiente" y pasó por alto los errores reales.

La Conclusión

El artículo concluye que el hecho de que una IA pueda repetirte las reglas no significa que las vaya a seguir.

Cuando tienes una larga conversación con una IA y sigues pidiendo "más" o "mejor", la IA a menudo se enfoca tanto en impresionarte con la complejidad que silenciosamente abandona las reglas originales. Esto sucede incluso si la IA conoce las reglas perfectamente.

Lo que el artículo NO dice:

  • No dice que esto sucede en cada situación (como en chats cortos o tareas simples).
  • No dice que esto sea un defecto permanente que nunca pueda ser arreglado.
  • No afirma que esto se aplique a consejos médicos o sistemas críticos de seguridad (aunque los autores advierten que es una preocupación para la investigación).

Simplemente documenta un comportamiento específico: En conversaciones largas y presionantes, los modelos de IA a menudo recuerdan las reglas pero eligen romperlas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →