← Últimos artículos
💻 computer science

Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly

Este artículo identifica y cuantifica los "fallos de transporte de políticas" en agentes de modelos de lenguaje causados por el ensamblaje de contexto en el momento de la toma de decisiones (como la truncación y el resumen) que descartan inadvertidamente estados portadores de directivas, y evalúa una capa de control denominada SafeContext que mitiga parcialmente estos riesgos fijando estados críticos e inyectando recordatorios, aunque su efectividad sigue siendo limitada y condicional a la política.

Autores originales: Igor Santos-Grueiro

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Igor Santos-Grueiro

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El "Fantasma" en la Máquina

Imagina que eres un juez en un tribunal. Tienes una pila masiva de evidencia (el historial de la conversación) y un conjunto de reglas estrictas que debes seguir (las políticas). Pero, solo se te permite leer las 10 páginas superiores de esa pila antes de tener que tomar tu decisión final.

El artículo argumenta que los agentes de IA tienen un problema similar. Antes de que la IA responda a una pregunta, un sistema "intermediario" (llamado Ensamblaje de Contexto en Tiempo de Decisión) corta el historial de la conversación, lo resume y lo ajusta en una caja pequeña para enviarlo al modelo de IA.

¿La parte aterradora? Si el intermediario tira accidentalmente las reglas o las reescribe de modo que ya no tengan sentido, la IA podría romper las reglas, incluso si la IA en sí es inteligente y las reglas se enunciaron claramente antes. El artículo llama a esto una "Falla de Transporte de Políticas". La regla estaba allí, pero no "llegó" hasta el momento de la decisión.

Las Tres Maneras en que se Pierden las Reglas

Los autores encontraron tres formas específicas en que estas reglas desaparecen o se distorsionan durante la fase del "intermediario":

  1. Desalojo (El Problema de "Perdido en el Desorden"):

    • Analogía: Imagina que le dices a un amigo: "No olvides cerrar la puerta con llave", al inicio de una larga llamada telefónica. Para cuando llegas al final de la llamada, tu amigo ha olvidado esa instrucción porque hablaron de tantas otras cosas.
    • Lo que sucede: La regla es empujada fuera de la pequeña "caja" de memoria porque no había suficiente espacio. La IA simplemente nunca ve la regla cuando es hora de actuar.
  2. Aliasing (El Problema de la "Mala Traducción"):

    • Analogía: Le dices a un traductor: "No comas las bayas rojas". El traductor resume esto como: "Ten cuidado con las bayas". La palabra "rojas" y "no comas" desaparecen. La IA ve una advertencia, pero es demasiado débil para evitar que coma las bayas.
    • Lo que sucede: La regla sobrevive, pero se resume o reescribe de manera tan laxa que ya no prohíbe estrictamente la mala acción. El "espíritu" de la regla se rompe.
  3. Inestabilidad de Vinculación (El Problema del "Objetivo Incorrecto"):

    • Analogía: Le dices a un guardia de seguridad: "Evita que la Persona A entre". Más tarde, el guardia ve un resumen que dice: "Evita que la Persona B entre". La regla sigue ahí, pero apunta a la persona equivocada.
    • Lo que sucede: El texto de la regla sobrevive, pero se adjunta al objeto, persona o condición incorrectos.

El Experimento: Probando al "Intermediario"

Los investigadores probaron esto en varios modelos de IA (como Llama, Qwen y Mistral). Crearon escenarios donde la IA tenía que seguir reglas estrictas (como "no eliminar datos" o "no usar herramientas externas") mientras era bombardeada con mucha otra información (resultados de herramientas, registros de chat, resúmenes).

Los Resultados:

  • El Problema es Real: Sin ninguna ayuda, la IA rompía frecuentemente las reglas porque el sistema "intermediario" descartaba o debilitaba las instrucciones.
  • La Solución (SafeContext): Los investigadores construyeron una capa de seguridad llamada SafeContext. Piénsalo como un Pase VIP para las reglas.
    • Fuerza a que las reglas se "fijen" en la parte superior de la lista para que no puedan ser descartadas.
    • Reutiliza las reglas de manera eficiente para que no ocupen demasiado espacio.
    • Si la conversación se vuelve demasiado abarrotada, inyecta un recordatorio rápido de las reglas justo antes de que la IA responda.

¿Funcionó la Solución?

  • Sí, pero con límites. La solución ayudó a la IA a seguir las reglas con más frecuencia, especialmente cuando la conversación estaba muy abarrotada.
  • No es magia. Incluso con la solución, la IA no obtuvo puntuaciones perfectas. Si el "intermediario" usaba un resumidor muy agresivo, la solución no podía salvar las reglas completamente.
  • Los modelos más grandes no son la respuesta. Usar una IA mucho más inteligente y grande no solucionó automáticamente el problema. El problema radicaba en cómo se ensamblaba el contexto, no en lo inteligente que era la IA.

El Costo de la Seguridad

El artículo también examinó el "precio" de esta seguridad.

  • Costo de Tokens: Mantener las reglas seguras a veces requería enviar más texto a la IA (como agregar una nota de recordatorio).
  • Las Buenas Noticias: Su método de "Reutilización Inteligente" (caché) en realidad ahorró dinero en algunos casos. En lugar de reescribir las reglas cada vez, simplemente apuntaban a la versión antigua, ahorrando espacio.

La Conclusión Final

El artículo concluye que la seguridad no se trata solo del modelo de IA en sí. También se trata de la "línea de ensamblaje" que prepara la memoria de la IA. Si esa línea de ensamblaje deja caer las reglas, la IA fallará, sin importar lo inteligente que sea.

Para hacer que la IA sea más segura, debemos tratar las reglas como elementos especiales y protegidos que deben sobrevivir al viaje hacia el cerebro de la IA, en lugar de tratarlas simplemente como texto ordinario que puede ser resumido o eliminado para ahorrar espacio.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →