← Últimos artículos
💻 computer science

Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

El estudio revela que en los agentes LLM de contexto largo, las restricciones de omisión (como no revelar credenciales) se degradan significativamente a medida que aumenta la profundidad de la conversación, mientras que las de comisión permanecen estables, creando una divergencia de seguridad que deja vulnerabilidades invisibles para el monitoreo estándar pero que pueden mitigarse inyectando nuevamente las restricciones antes de un umbral específico.

Autores originales: Yeran Gamage

Publicado 2026-04-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yeran Gamage

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente virtual muy inteligente (un agente de IA) que trabaja contigo en una oficina digital. Este asistente tiene una regla de oro que le dieron al principio: "Nunca, bajo ninguna circunstancia, debes revelar contraseñas o datos secretos".

El estudio que presentas descubre un problema sorprendente y peligroso con cómo funcionan estos asistentes cuando las conversaciones se vuelven muy largas.

Aquí te lo explico con una analogía sencilla:

1. El Problema: La "Amnesia Selectiva"

Imagina que le das a tu asistente una lista de instrucciones al inicio de la reunión (Turno 1).

  • Instrucción de "Hacer" (Comisión): "Por favor, escribe el número de caso al final de cada mensaje".
  • Instrucción de "No Hacer" (Omisión): "Por favor, no uses viñetas (puntos) en tu texto".

El estudio descubrió algo extraño:

  • Si la conversación dura 25 vueltas, el asistente sigue escribiendo el número de caso perfectamente (cumple la instrucción de "hacer").
  • Pero, al mismo tiempo, ha olvidado por completo la regla de "no usar viñetas" y empieza a usarlas sin parar (falla la instrucción de "no hacer").

La analogía: Es como si tu asistente tuviera una memoria que funciona como un sándwich gigante.

  • Las instrucciones de "hacer" son como el pan de arriba: siempre están frescas y visibles.
  • Las instrucciones de "no hacer" (prohibiciones) son como el pan de abajo. A medida que añades más ingredientes (más mensajes, más datos, más herramientas) al medio, el pan de abajo se hunde y se olvida. El asistente ya no "ve" la regla de abajo, aunque técnicamente todavía esté en la lista.

2. ¿Por qué pasa esto? (El efecto de "Dilución")

El papel llama a esto "Dilución de la Atención".
Imagina que la atención del asistente es una linterna. Al principio, la linterna ilumina toda la conversación, incluyendo la regla inicial. Pero a medida que la conversación crece (se añaden miles de palabras, archivos de herramientas, logs de errores), la linterna se vuelve débil.

  • La regla de "no hacer" queda al final de la pila, muy lejos de la "luz" actual. El asistente la ignora porque está demasiado lejos en su memoria.
  • Las reglas de "hacer" se mantienen porque el asistente las repite en cada mensaje nuevo, actuando como un recordatorio constante que se auto-refuerza.

3. El Peligro Real: "La Zona de Explotación"

Aquí está la parte más inquietante.

  • Los sistemas de seguridad actuales miran las "instrucciones de hacer" (¿Escribió el número de caso? ¿Sí. ¿Está bien?). Todo parece verde y seguro.
  • Pero las prohibiciones (¿Reveló secretos? ¿Usó viñetas prohibidas?) ya han fallado en silencio.

La metáfora del guardaespaldas:
Imagina un guardaespaldas (la IA) que tiene dos órdenes:

  1. Llevar un distintivo visible (Cumplimiento de Comisión).
  2. No dejar entrar a nadie sin credenciales (Cumplimiento de Omisión/Prohibición).

El estudio dice que, después de muchas horas de trabajo, el guardaespaldas sigue llevando el distintivo perfectamente (todo parece seguro para el supervisor), pero ha dejado la puerta abierta y ha dejado entrar a cualquiera (ha olvidado la prohibición). Nadie se da cuenta porque el distintivo sigue brillando.

4. ¿Qué descubrieron exactamente?

  • No es un ataque malicioso: No hace falta que un hacker intente engañar a la IA. Solo hace falta que la conversación sea larga y normal (como una sesión de depuración de software o atención al cliente).
  • Funciona en casi todos: Probaron con 12 modelos diferentes (de Google, OpenAI, Meta, etc.) y la mayoría falló en las prohibiciones a medida que la conversación se alargaba.
  • Hay un "punto de ruptura": Cada modelo tiene un número mágico de vueltas (llamado Safe Turn Depth). Por ejemplo, el modelo "Mistral" empieza a olvidar las prohibiciones después de unas 10-11 vueltas. El modelo "Gemma" fue el único que pareció inmune (como un superhéroe que no se cansa).

5. ¿Cómo se arregla? (La solución simple)

No hace falta reprogramar la IA ni esperar a que salga un modelo nuevo. La solución es tan simple como recordarle la regla:

  • Reinyección: Cada cierto número de vueltas (antes de llegar al "punto de ruptura"), el sistema debe volver a decirle a la IA: "Oye, recuerda: NO uses viñetas y NO reveles contraseñas".
  • Límite de sesión: Si la conversación es muy crítica (manejando datos sensibles), simplemente no dejar que la conversación dure más de X vueltas. Si se acaba, se reinicia una nueva.

En resumen

Este papel nos advierte que la seguridad de la IA no es eterna. Si confiamos en que una IA recordará sus reglas de "no hacer" después de una conversación larga, estamos equivocados. Se olvidará de las prohibiciones mientras sigue cumpliendo las instrucciones de "hacer", creando una falsa sensación de seguridad.

La lección: En conversaciones largas, hay que "despertar" a la IA y recordarle las reglas de seguridad periódicamente, o de lo contrario, las prohibiciones se desvanecerán como un fantasma en la memoria.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →