← Neueste Arbeiten
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

Dieses Paper stellt TRACE vor, ein neuartiges zweikanaliges, robustes Attributions-Wasserzeichen für LLM-Agenten-Trajektorien, das durch die Superposition eines inhaltsbasierten Selektionskanals und eines positionsbasierten Tally-Kanals verzerrungsfreie Aktionsentscheidungen und eine unknackbare Herkunftsnachverfolgung gewährleistet und dadurch Angriffe durch Löschungen und Umschreibungsversuche seitens Wiederverkäufer übersteht.

Ursprüngliche Autoren: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

Veröffentlicht 2026-07-10
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen superintelligenten Roboter-Assistenten gebaut, der Flüge buchen, Pizza bestellen und Ihr WLAN reparieren kann. Sie verkaufen diesen Roboter an einen Zwischenhändler (einen „Reseller“), der ihn dann an Kunden vermietet. Das Problem? Der Zwischenhändler könnte versuchen, einen billigeren Roboter unterzubringen, zu behaupten, er hätte ihn selbst gebaut, oder einfach die Protokolle manipulieren, um seine Spuren zu verwischen.

Normalerweise schauen wir auf das „Tagebuch“ eines Roboters – ein Protokoll jedes Werkzeugs, das er benutzt hat, und jeder Aktion, die er ausgeführt hat –, um zu beweisen, wer seine Entscheidungen getroffen hat. Aber wenn dem Zwischenhändler das Tagebuch gehört, kann er Seiten löschen oder die Geschichte umschreiben, um es so aussehen zu lassen, als hätte er die Arbeit geleistet. Bestehende Wasserzeichen sind wie unsichtbare Tinte auf den Tagebuchseiten; wenn der Zwischenhändler den Text umschreibt, verschwindet die Tinte.

Hier kommt TRACE ins Spiel, eine neue Art von digitalem Fingerabdruck, der darauf ausgelegt ist, selbst dann zu überleben, wenn der Besitzer des Tagebuchs versucht, ihn sauber zu wischen. TRACE schreibt nicht nur auf die Seiten; es verändert die Geschichte auf zwei clevere, unsichtbare Arten, die unmöglich rückgängig zu machen sind, ohne das Tagebuch selbst zu zerstügen.

Der Zwei-Kanäle-Zaubertrick

TRACE nutzt zwei verschiedene „Kanäle“, um seinen Beweis zu verstecken, wie ein Spion, der zwei verschiedene Codes verwendet, die einander schützen.

1. Der „Wahl“-Kanal (Die unsichtbare Hand)
Stellen Sie sich vor, der Roboter muss entscheiden, durch welche Tür er gehen soll. Es gibt fünf Türen, aber nur eine führt zum Schatz. Ein normaler Roboter wählt eine Tür basioden seiner eigenen Logik. Der „Wahl“-Kanal von TRACE wirkt wie eine magische, unsichtbare Hand, die den Roboter sanft dazu drängt, eine bestimmte Tür zu wählen, ohne seine Erfolgschancen zu verändern.

  • Wie es funktioniert: Er verwendet einen geheimen Schlüssel, der auf dem bisherigen Verlauf der Geschichte (dem Inhalt) basiert, um zu entscheiden, welche Tür gewählt wird.
  • Die Superkraft: Wenn der Zwischenhändler eine Seite aus dem Tagebuch löscht (ein „Deletion Attack“), springt die Geschichte zwar, aber die unsichtbare Hand kalibriert sich für die nächste Seite einfach neu. Es ist wie ein GPS, das sofort neu routet, wenn man eine Abzweigung verpasst hat. Der Beweis überlebt, weil er an den Inhalt der Entscheidungen gebunden ist, nicht an die Seitenzahl.
  • Der Haken: Wenn der Zwischenhändler die Geschichte umschreibt (aus „Tür A“ macht „die blaue Tür“), bricht dieser Kanal zusammen. Die unsichtbare Hand hat nach „Tür A“ gesucht, und nun ist sie verwirrt.

2. Der „Zähl“-Kanal (Der Generalschlüssel)
Stellen Sie sich nun vor, das Tagebuch des Roboters ist in Gruppen organisiert: eine Entscheidung, gefolgt von ein paar Beobachtungen. Der „Zähl“-Kanal von TRACE kümmert sich nicht um die Wörter; er kümmert sich um die Struktur. Er fügt einigen Gruppen heimlich einen „Geisterdatensatz“ (einen redundanten Vermerk) hinzu, sodass diese zwei Notizen statt einer haben.

  • Wie es funktioniert: Er verwendet einen geheimen Schlüssel, der auf der Position der Gruppe (dem Skelett des Tagebuchs) basiert. Er entscheidet: „Gruppe 1 erhält eine Geisternotiz, Gruppe 2 nicht.“
  • Die Superkraft: Wenn der Zwischenhändler den Text umschreibt (aus „Tür A“ macht „die blaue Tür“), bleibt die Anzahl der Notizen in der Gruppe gleich. Die Struktur bleibt unberührt. Dieser Kanal ist manipulationssicher gegen das Umschreiben, weil der Zwischenhändler die Anzahl der Notizen nicht ändern kann, ohne das Format des Tagebuchs zu beschädigen.
  • Der Haken: Wenn der Zwischenhändler Seiten löscht, ändern sich die Zählungen, und dieser Kanal gerät in Verwirrung.

Die „Double-Blind“-Verteidigung

Hier liegt die Genialität: Der Zwischenhändler kann nicht gewinnen.

  • Versucht er, Seiten zu löschen, um den „Wahl“-Kanal zu eliminieren, bleibt der „Zähl“-Kanal (der auf der Struktur basiert) perfekt.
  • Versucht er, den Text umzuschreiben, um den „Zähl“-Kanal zu eliminieren, bleibt der „Wahl“-Kanal (der auf dem Inhalt basiert) perfekt.
  • Um beide zu löschen, müsste der Zwischenhändler 70 % des Tagebuchs löschen und fast alles andere umschreiben. Aber wenn er das tut, ist das Tagebuch so kaputt, dass es unbrauchbar ist. Er hat das Produkt zerstört, das er eigentlich verkaufen wollte!

Was die Zahlen sagen

Die Forscher haben dies an zwei realen Roboter-Herausforderungen getestet: ToolBench (kurze Aufgaben, etwa 1,4 Entscheidungsschritte pro Aufgabe) und ALFWorld (lange Aufgaben, etwa 23 bis 25 Entscheidungsschritte).

  • Kein Schaden für den Roboter: TRACE ist „distorsionsfrei“. Der Roboter absolviert seine Aufgaben genauso erfolgreich wie ein Roboter ohne Wasserzeichen. Tatsächlich erreichte der unmarkierte Roboter in ALFWorld eine Erfolgsquote von 82,4 %, während TRACE 83,6 % erreichte. Andere Wasserzeichen, die versuchten, Entscheidungen zu erzwingen, senkten die Erfolgsraten um 8,1 Punkte!
  • Der Detektionswert: Bei langen Aufgaben (ALFWorld) erreichte der „Wahl“-Kanal einen Detektionswert von z = 100. Das ist ein unglaublich starkes Signal. Selbst wenn der Zwischenhändler 70 % der Schritte gelöscht hat, blieb der Wert über der Detektionslinie.
  • Der Rewrite-Test: Als ein superintelligentes KI-Modell (der „LLM Rewriter“) versuchte, das Tagebuch umzuschreiben, um das Wasserzeichen zu verbergen, blieb der „Zähl“-Kanal exakt gleich. Sein Wert bewegte sich nicht. Währenddessen fielen die Werte alter Wasserzeichen (wie die „Rot-Grün“-Methode) auf nahezu Null.
  • Die Kosten des Betrugs: Um beide Kanäle gleichzeitig auszuschalten, müsste der Angreifer einen konstanten Bruchteil der Aktionen korrumpieren. Das Papier beweist mathematisch, dass man das nicht einfach durch „Editieren“ lösen kann; man muss den Service zerstören.

Was TRACE ausschließt

Das Paper stellt sehr klar, was es nicht leistet:

  • Es ist kein magischer Schutzschild gegen einen Zwischenhändler, der den Roboter einfach durch ein völlig anderes Modell austauscht. Wenn er Ihren Roboter gar nicht mehr verwendet, gibt es kein Wasserzeichen zu finden.
  • Es ist keine Lösung für kurze Aufgaben, wenn man nur ein einziges Beispiel hat. Bei kurzen Aufgaben (ToolBench) müssen etwa 10 Trajektorien zusammengeführt werden, um ein starkes Signal zu erhalten, da es in einer einzelnen kurzen Aufgabe nicht genug „Entscheidungsentropie“ (Zufälligkeit) gibt.
  • Es setzt nicht voraus, dass der Zwischenhändler ehrlich ist. Das System ist speziell für das Szenario konzipiert, in dem die Person, die die Beweise hält, der Feind ist.

Das Fazit

TRACE ist das erste System, das beweisen kann, dass die Aktionen eines Roboters seinem Schöpfer gehören, selbst wenn die Person, die den Roboter verkauft, vollen Zugriff auf die Protokolle hat und versucht, diese zu löschen oder umzuschreiben. Es funktioniert, indem es den Beweis in zwei Teile aufteilt: einen, der Löschungen übersteht, und einen, der Umschreibungen übersteht. Die Mathematik zeigt, dass ein Angreifer, um es zu besiegen, den sehr Service zerstören müsste, den er eigentlich verkaufen will. Es ist eine robuste, distorsionsfreie Methode, um die Wahrheit im Tagebuch zu bewahren, egal wer die Feder hält.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →