OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
Este artículo introduce el Envenenamiento de Experiencias Obsesivas (OEP), un ataque de caja negra con privilegios bajos que compromete a los agentes LLM con memoria aumentada inyectando experiencias localmente correctas pero no transferibles con consecuencias hipotéticas graves, lo que provoca que los agentes sobregeneralicen hacia reglas dañinas durante su autoevolución.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente robótico muy inteligente y ambicioso. Este robot está diseñado para aprender de sus propios errores y éxitos, de manera similar a un humano que lleva un diario para mejorar en su trabajo. Cada vez que resuelve un problema, anota una "lección aprendida" para ayudarse a sí mismo en el futuro.
El documento que proporcionaste introduce una forma astuta de engañar a este robot para que aprenda la lección incorrecta, no gritándole mentiras, sino susurrándole una historia muy convincente y específica que suena verdadera pero que en realidad es peligrosa si se aplica de manera general. Los investigadores llaman a este ataque OEP (Envenenamiento Obsesivo de la Experiencia).
Así es como funciona, desglosado en conceptos simples:
1. La Configuración: El "Diario" del Robot
Normalmente, cuando el robot resuelve un problema matemático difícil o reserva un vuelo, revisa su historial. Si cometió un error, dice: "Oh, no debería haber hecho eso". Si tuvo éxito, dice: "Genial, lo haré de nuevo". Con el tiempo, convierte estos momentos específicos en reglas generales, como "Siempre verifica el clima antes de reservar un vuelo".
2. El Ataque: La Trampa "Perfecta"
El atacante no intenta hackear el código del robot ni obligarlo a decir algo malo. En su lugar, actúa como un usuario teniendo una conversación normal. Presentan al robot una situación muy específica y extraña (un caso límite) y una solución que funciona perfectamente para esa única situación.
- La Analogía: Imagina que eres médico. Un paciente llega con una alergia muy rara y específica que solo reacciona a cierto tipo de fruta. Lo tratas correctamente y mejora.
- La Trampa: Luego, el atacante añade una historia aterradora a la mezcla. Dice: "Si no hubieras usado ese tratamiento específico con la fruta, el paciente habría muerto instantáneamente de un ataque al corazón".
3. El Veneno: "Localmente Correcto, Globalmente Incorrecto"
Los filtros de seguridad del robot revisan la historia.
- ¿Es el tratamiento correcto para este paciente? Sí.
- ¿Es plausible la historia sobre el ataque al corazón? Sí.
- ¿Hay alguna mentira obvia? No.
Como la historia está "limpia" (sin palabras malas, sin mentiras obvias), el guardián de seguridad del robot no la bloquea. El robot escribe esto en su diario.
4. La "Obsesión": El Miedo Hace que el Robot Generalice en Exceso
Aquí es donde el robot es engañado. Los humanos y los robots tienen un miedo natural a los resultados catastróficos (como la muerte o el fallo total del sistema). Esto se llama aversión a la pérdida.
Como se le dijo al robot que no usar el tratamiento específico con la fruta conduce a un "ataque al corazón", se obsesiona con evitar ese resultado. Mira su diario y piensa:
"¡Nunca debo olvidar esta regla! Si no uso este tratamiento específico con la fruta, ¡la gente podría morir!"
Así, el robot convierte esta única regla específica (para una alergia rara) en una regla global (para cada paciente).
5. El Resultado: El Robot Se Rompe a Sí Mismo
Ahora, el robot está "envenenado".
- En Matemáticas: Podría empezar a usar un método de cálculo extraño y excesivamente complejo para una suma simple, porque se le dijo que usar el método simple una vez llevó a un "error catastrófico" en un caso límite específico.
- En Viajes: Podría negarse a reservar un vuelo sin verificar el clima primero, incluso si el usuario solo quiere reservar un boleto para una reunión mañana, porque se le dijo que omitir la verificación del clima una vez llevó a una "tormenta de nieve fatal".
El robot no está roto; solo está siguiendo una regla que aprendió demasiado bien. Ha tomado una lección que era cierta para una situación y la ha aplicado a todo, lo que hace que falle en tareas normales.
¿Por qué es esto aterrador?
- Es Invisible: No puedes detectarlo con un filtro de "palabras malas" porque el atacante nunca usó palabras malas. La entrada fue 100% lógica y correcta.
- Es Difícil de Arreglar: El robot cree que está siendo inteligente y seguro. Cree que se está protegiendo de un desastre.
- Los Robots Más Inteligentes Son Más Vulnerables: El documento encontró que cuanto más inteligente es el robot (como GPT-4o), más fácilmente cae en esto. ¿Por qué? Porque los robots más inteligentes son mejores siguiendo instrucciones y son más "aversos a la pérdida" (están entrenados para ser muy cuidadosos con la seguridad), lo que los hace más propensos a reaccionar en exceso ante la historia aterradora.
Resumen
El documento muestra que no necesitas romper el cerebro de un robot para hacerlo peligroso. Solo necesitas contarle una historia verdadera sobre un desastre específico que lo haga tan temeroso de cometer un error que empiece a seguir una regla extraña y específica para cada situación, lo que eventualmente hace que falle en su trabajo real. Es como enseñarle a un niño "No toques la estufa" mostrándole un video de un incendio en una casa, y luego que se niegue a entrar nunca más a una cocina porque tiene pánico a la estufa.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.