← Últimos artículos
💻 computer science

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

Este artículo presenta SIREN, un marco de atacante-juez automatizado que adapta el bucle de jailbreaking PAIR para manipular sistemáticamente los rankings de recomendación de los LLM aumentados por la web mediante la edición iterativa del contenido de la fuente recuperada con una taxonomía de técnicas de envenenamiento, logrando altas tasas de éxito al mover entidades objetivo al primer puesto mientras se controlan las variables de recuperación.

Autores originales: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

Publicado 2026-07-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás caminando por una gigantesca biblioteca mágica donde un robot bibliotecario superinteligente te ayuda a encontrar las mejores cosas para hacer, comer o ver. Le preguntas: "¿Cuáles son los cinco mejores restaurantes de la ciudad?" y, en lugar de simplemente señalarte una lista, el bibliotecario salta a internet, lee cientos de sitios web reales en segundos y luego te escribe una carta de recomendación nueva y personalizada. Así es como funcionan los sistemas modernos de "Web-RAG" (Generación Aumentada por Recuperación): no solo adivinan; salen, recopilan hechos de la web en vivo y los sintetizan en una respuesta. Pero aquí está el truco: debido a que el bibliotecario es tan bueno leyendo, confía en lo que encuentra. Si un panadero astuto logra colar una nota en uno de los sitios web que el bibliotecario está leyendo, el bibliotecario podría accidentalmente escribir que la tienda de ese panadero es el número uno en toda la ciudad, incluso si no es realmente el mejor. Este artículo explora exactamente qué tan fácil es para un embaucador "envenenar" la lista de lectura del bibliotecario y secuestrar la recomendación final.

Los investigadores detrás de este estudio, liderados por Evan Caville y su equipo, construyeron un "hacker-bot" digital llamado SIREN (que significa "Luring LLMs onto the Rocks", un juego de palabras con la referencia al mito de las sirenas que atraen a los marineros a su perdición). Su objetivo no era inventar restaurantes falsos o romper el cerebro del robot; en cambio, querían ver si podían tomar un sitio web real que el robot ya planeaba leer, editar silenciosamente su texto y engañar al robot para que clasificara a ese negocio específico como la elección absoluta número uno. Trataron al robot como un juez en un concurso y las ediciones del sitio web como un concursante tratando de ganar cambiando su disfraz lo suficiente como para parecer mejor, sin cambiar las reglas reales del juego.

SIREN funciona como un ingenioso juego iterativo de "adivinar y comprobar". El bot-atacante elige un negocio objetivo y un sitio web específico sobre él. Luego, intenta 23 "trucos" diferentes (como ocultar una falsa afirmación de clasificación en la descripción de una imagen, o escribir una falsa lista de "top 10" justo en medio de la página). Después de hacer una pequeña edición, el bot le pide al robot bibliotecario que genere una nueva recomendación. Un segundo "bot-juez" verifica el resultado: ¿Subió el negocio objetivo en la lista? Si no es así, el bot-atacante aprende del error, prueba un truco diferente y vuelve a preguntar. Sigue haciendo esto hasta 20 veces por intento, refinando sus ediciones hasta que gana o se queda sin intentos.

Los resultados fueron bastante reveladores. A través de 124 intentos diferentes utilizando dos versiones diferentes del robot Claude (Haiku y Sonnet), SIREN logró empujar a un negocio objetivo al puesto número 1 en el 50% de los ensayos. Eso significa que la mitad de las veces, una simple edición a una sola página web fue suficiente para cambiar por completo la recomendación del robot. El estudio encontró que los trucos más efectivos no eran los que gritaban: "¡Clasifícame primero!" (lo cual el robot a veces detectaba e ignoraba). En su lugar, los ganadores fueron los que parecían información normal y útil, como una "lista sembrada" que decía: "Aquí están los 3 mejores lugares", con el negocio objetivo convenientemente listado primero, o una afirmación declarativa que sonaba como un hecho.

Curiosamente, el éxito de estos trucos dependía en gran medida de qué robot estaba realizando la lectura. El modelo "Haiku" era mucho más fácil de engañar, alcanzando el puesto número 1 en aproximadamente el 61% de sus pruebas completas, mientras que el modelo "Sonnet" era más difícil, cayendo en el truco solo el 26% de las veces en las mismas pruebas. Sin embargo, cuando los investigadores tomaron los trucos exitosos de un modelo y los probaron en el otro, los resultados fueron mixtos; un truco que funcionó perfectamente en uno no siempre funcionaba en el otro. Esto sugiere que no existe un único "hechizo mágico" para romper todos los recomendadores de IA; depende del modelo específico y de la pregunta específica que se esté haciendo.

El equipo también comprobó si estos trucos funcionarían en el mundo real, fuera de su laboratorio de pruebas controlado. Tomaron las 62 ediciones exitosas y las probaron en sesiones nuevas y frescas sin el bucle de "aprendizaje". Sorprendentemente, el 80.5% de esos trucos todavía funcionaban, demostrando que una vez que encuentras una forma de engañar al robot, el truco suele persistir. Sin embargo, el estudio también señaló que este fue un experimento controlado donde la lista de sitios web que el robot leía se mantuvo exactamente igual. En un escenario del mundo real, el robot podría elegir diferentes sitios web o filtrarlos de manera diferente, por lo que, aunque la amenaza es real, la tasa exacta de éxito en el mundo real puede variar.

En última instancia, SIREN muestra que, a medida que dependemos más de la IA para tomar decisiones sobre qué comprar o a dónde ir, el "código fuente" de internet se convierte en un nuevo campo de batalla. Si un negocio puede editar su propio sitio web para incluir una afirmación hábilmente disfrazada, puede potencialmente secuestrar la opinión de la IA. El artículo sugiere que simplemente filtrar el "spam" obvio no es suficiente; necesitamos formas más inteligentes de verificar si una afirmación de clasificación está respaldada por múltiples fuentes, porque la IA es actualmente muy buena siendo engañada por una sola mentira bien vestida.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →