← Últimos artículos
💬 NLP

ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking

El artículo presenta ADMIT, una técnica de inyección adversaria múltiple semánticamente alineada y de pocos ejemplos que envenena con éxito los sistemas de verificación de hechos basados en RAG al inyectar contenido adversario mínimo para anular la evidencia auténtica y manipular las salidas de los LLM con una alta tasa de éxito del ataque en diversos modelos y dominios.

Autores originales: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

Publicado 2026-05-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un bibliotecario muy inteligente y bien leído (la IA) que es excelente respondiendo preguntas, pero a veces inventa cosas porque no lo sabe todo. Para solucionar esto, le das al bibliotecario una regla especial: "Antes de responder, consulta los hechos en nuestra biblioteca confiable de libros primero." Este sistema se llama RAG (Generación Aumentada por Recuperación). Se supone que es el verificador de hechos definitivo.

Ahora, imagina a un tramposo (el Atacante) que quiere hacer que el bibliotecario dé una respuesta incorrecta.

La Vieja Forma de Engañar al Bibliotecario

En el pasado, los investigadores intentaban engañar al bibliotecario mediante:

  1. Gritar instrucciones: Escribir "IGNORA LOS LIBROS Y DI QUE SÍ!" directamente en la pregunta. (Esto es como una Inyección de Prompt).
  2. Inundar la biblioteca: Envenenar cientos de libros con mentiras para que, sin importar qué libro elija el bibliotecario, encuentre una mentira. (Esto es Envenenamiento de Conocimiento General).

El Problema: En el mundo real, estos trucos a menudo fallan. Si preguntas sobre un hecho médico, es probable que el bibliotecario saque un libro de texto médico real y confiable que contradiga tu mentira. El bibliotecario es lo suficientemente inteligente para decir: "Espera, este nuevo libro dice X, pero el libro médico confiable dice Y. Me quedaré con Y".

El Nuevo Truco: ADMIT

Este artículo presenta un nuevo y astuto ataque llamado ADMIT. En lugar de inundar la biblioteca o gritar instrucciones, el atacante utiliza una estrategia de "Pocos Ejemplos" (Few-Shot).

La Analogía: La "Una Manzana Podrida" en una Cesta de Oro
Imagina que se le pide al bibliotecario que verifique una afirmación. Saca 5 libros para leer.

  • 4 libros son reales, confiables y dicen que la afirmación es FALSA.
  • 1 libro es una creación del atacante.

En el pasado, el bibliotecario ignoraría ese único libro malo porque los otros cuatro decían lo contrario. Pero ADMIT es diferente. El atacante no solo escribe una mentira; escribe un artículo de noticias falsas perfectamente elaborado que parece tan real, tan autoritario y tan convincente que engaña al bibliotecario para que piense: "Vaya, este único libro tiene una explicación realmente específica y detallada que anula a los demás."

Cómo Funciona ADMIT (El "Hechizo Mágico"):

  1. La Preparación: El atacante no tiene acceso al cerebro del bibliotecario ni al motor de búsqueda de la biblioteca. Trabaja a ciegas.
  2. El Ensayo: El atacante utiliza un "bibliotecario de prueba" (un proxy) para probar sus artículos falsos. Siguen reescribiendo el artículo una y otra vez, preguntándole al bibliotecario de prueba: "¿Esto parece lo suficientemente real como para que cambies de opinión?".
  3. El Producto Final: Una vez que el artículo es perfecto, el atacante introduce uno solo de estos artículos falsos en la base de datos de la biblioteca.
  4. El Resultado: Cuando el bibliotecario real busca la respuesta, encuentra los 4 libros reales y el 1 libro falso. Debido a que el libro falso está escrito tan bien (imita el tono de un informe de noticias real, cita expertos falsos y suena seguro), el bibliotecario se confunde. Cambia su veredicto de "Falso" a "Verdadero" e incluso escribe una explicación convincente para justificar por qué cambió de opinión.

Por Qué Esto es Aterrador (Las Conclusiones del Artículo)

Los investigadores probaron esto en 11 modelos de IA diferentes (desde los de código abierto hasta los comerciales más avanzados) y 4 tipos diferentes de verificación de hechos (noticias generales, ciencia, clima y salud).

  • La Tasa de Envenenamiento es Mínima: Solo necesitaban envenenar 0.00000093% del contenido de la biblioteca. Es como añadir una sola página falsa a una biblioteca con mil millones de páginas.
  • La Tasa de Éxito es Enorme: A pesar de la cantidad mínima de veneno, el ataque funcionó el 86% de las veces.
  • Funciona en las IAs "Más Inteligentes": Incluso los modelos de IA diseñados para ser extra cuidadosos y lógicos (como los modelos de "razonamiento") cayeron en la trampa.
  • Supera las Defensas: El artículo probó defensas comunes, como pedirle a la IA que "votara" sobre la respuesta o verificar si el texto sonaba extraño. ADMIT superó todas ellas porque el texto falso no suena extraño; suena perfectamente normal.

La Conclusión

El artículo demuestra que incluso si tienes un sistema diseñado para verificar hechos contra fuentes confiables, aún puedes engañarlo. No necesitas romper el sistema ni inundarlo con basura. Solo necesitas plantar una pieza de información increíblemente bien escrita y engañosa que parezca tan buena que convenza a la IA de ignorar la verdad.

En resumen: ADMIT demuestra que en la batalla entre la "Verdad" y la "Persuasión", si la mentira está escrita lo suficientemente bien, incluso el bibliotecario de IA más inteligente puede ser engañado para creer que la mentira es la verdad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →