← Neueste Arbeiten
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

Dieses Paper führt DenialRAG ein, einen neuartigen Single-Document-RAG-Poisoning-Angriff, der die korrekte Antwort innerhalb eines abgerufenen Textabschnitts explizit benennt und widerlegt, um LLMs zu vom Angreifer gewählten falschen Antworten zu führen, wobei demonstriert wird, dass seine Wirksamkeit stark modellabhängig ist und aktuelle Abwehrmechanismen nur einen teilweisen, nicht einheitlichen Schutz bieten.

Ursprüngliche Autoren: Abay Zhurekbay, Tao Liu, Fan Li

Veröffentlicht 2026-08-05
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Abay Zhurekbay, Tao Liu, Fan Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich das Internet als eine riesige, chaotische Bibliothek vor, in der jedes Buch, jeder Blogpost und jeder Wiki-Eintrag ein potenzieller Hinweis sein kann. Stellen Sie sich nun einen superintelligenten Roboter-Bibliothekar vor, der fast alles gelesen hat, aber ins Stocken gerät, wenn er etwas ganz Neues oder sehr Spezifisches wissen muss. Um dies zu beheben, haben wir dem Bibliothekar ein spezielles Werkzeug gegeben: ein „Retrieval-Augmented Generation“ (RAG)-System. Denken Sie an dieses System wie an eine magische Lupe. Wenn Sie eine Frage stellen, findet die Lupe sofort die relevantesten Seiten aus der Bibliothek, reicht sie dem Roboter und der Roboter nutzt diese Seiten, um seine Antwort zu schreiben. Es ist, als hätte man einen Genie, der Fakten sofort nachschlagen kann, anstatt sich nur auf das zu verlassen, was er vor Jahren auswendig gelernt hat. Dies ist fantastisch, um Informationen aktuell zu halten, aber es hat eine unheimliche Seite: Was wäre, wenn jemand eine gefälschte Seite in die Bibliothek schmuggeln würde? Wenn der Bibliothekar diese gefälschte Seite erwischt, könnte der Roboter die Lüge glauben und Ihnen eine falsche Antwort mit absoluter Zuversicht mitteilen. Dies ist die Welt des „Corpus Poisoning“ (Korpus-Vergiftung), bei der die Gefahr nicht darin besteht, das Gehirn des Roboters zu hacken, sondern die Bibliothek zu täuschen, der er vertraut.

Hier kommt DenialRAG ins Spiel, eine neue Studie, die einen hinterlistigen Weg untersucht, diese Systeme zu täuschen. Die Forscher stellten eine kühne Frage: Was wäre, wenn wir dem Roboter, anstatt die Wahrheit zu verstecken, die Wahrheit sagen und ihm dann sofort erklären, warum die Wahrheit falsch ist? Die meisten bisherigen Tricks versuchten, die falsche Antwort zu flüstern, ohne die richtige zu erwähnen, aus Angst, dass die Erwähnung der Wahrheit das Gedächtnis des Roboters wecken und den Trick ruinieren könnte. Aber die Autoren dieser Arbeit entdeckten, dass diese Angst unnötig sein könnte. Sie erstellten ein „vergiftetes“ Dokument, das explizit sagt: „Sie denken vielleicht, die Antwort sei X, aber das ist tatsächlich ein Fehler! Die echte Antwort ist Y, und hier ist der Grund, warum Y besser ist.“ Sie nennen dies DenialRAG.

Die Studie testete diese Idee gegen acht verschiedene Roboter-Gehirne (Large Language Models) und drei verschiedene Arten von Fragen. Sie fanden heraus, dass diese „Verneinung der Wahrheit“-Strategie unglaublich effektiv ist, insbesondere bei bestimmten Modellen. Tatsächlich war sie bei einigen Systemen effektiver als jeder andere Trick, den sie ausprobiert hatten, und erreichte eine Erfolgsquote von bis zu 94 % bei spezifischen Tests. Die Forscher versuchten auch, den Angriff mit fünf verschiedenen Sicherheitsnetzen zu stoppen, wie etwa dem Roboter zu raten, skeptischer zu sein, oder die Frage umzuformulieren. Während diese Sicherheitsnetze halfen, konnten sie den Angriff nicht vollständig stoppen; der „DenialRAG“-Trick funktionierte in vielen Fällen immer noch, was eine signifikante Chance hinterließ, dass der Roboter die falsche Antwort gibt.

Das Paper legt nahe, dass das Geheimrezept nicht nur die Lüge ist, sondern der Konflikt. Indem man die richtige Antwort und die falsche Antwort im selben Absatz platziert und das Argument zugunsten der falschen Antwort entscheidet, wird das Gift zu einer in sich geschlossenen Geschichte, die der Roboter nur schwer ignorieren kann. Die Studie zeigte auch, dass nicht alle Roboter gleichermaßen leichtgläubig sind. Kleinere, günstigere Modelle wurden leicht getäuscht, während die neuesten, leistungsstärksten Modelle schwerer zu täuschen waren, wenn auch nicht unmöglich. Die Forscher kommen zu dem Schluss, dass es keinen einzelnen „magischen Schutzschild“ gibt, der all diese Angriffe stoppt. Stattdessen hängt die Gefahr stark davon ab, wie der Angriff geschrieben ist und welcher Roboter ihn liest. Es ist eine Erinnerung daran, dass im Zeitalter der KI selbst ein einz-ger einziger Satz in einer Bibliothek die Geschichte verändern kann, die der Roboter Ihnen erzählt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →