← Neueste Arbeiten
💻 computer science

OTRO: Oblivious Tokenization Path with Square-Root ORAM

OTRO ist ein effizientes, oblifates Tokenisierungssystem, das für das vertrauliche LLM-Serving entwickelt wurde und Seitenkanal-Lecks aus Speicherzugriffsmustern durch die Nutzung eines Pools von Quadratwurzel-ORAM-Instanzen mit Epoch-basierter Rotation und Chunked-KV-Cache-bewusstem Overlap mildert, wodurch ein nahezu null latenzbedingter Overhead bei signifikanter Reduzierung der beobachtbaren Leckage erreicht wird.

Ursprüngliche Autoren: Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

Veröffentlicht 2026-06-17
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie senden einen geheimen Brief an einen Freund durch ein hochsicheres, gläsernes Postamt. Das Postamt wird von einer „Trusted Execution Environment“ (TEE) betrieben, die wie ein supergesicherter Tresor ist, in dem Ihr Brief in einem Sicherheitsbehälter eingeschlossen ist, den niemand – nicht einmal der Postamtsleiter – öffnen kann. Sie können die Worte darin nicht lesen.

Das Problem: Der „Token“-Übersetzer
Bevor Ihr Brief verarbeitet werden kann, muss er in einen Code übersetzt werden, den der Computer versteht. Dies geschieht durch ein Werkzeug namens Tokenizer. Betrachten Sie den Tokenizer als einen Übersetzer, der jedes Wort in Ihrem Brief in einem riesigen, festen Wörterbuch nachschlägt, um dessen geheime Codenummer zu finden.

Hier ist der Haken: Obwohl die Worte im Tresor eingeschlossen sind, ist das Muster der Fingerbewegungen des Übersetzers sichtbar.

  • Wenn Sie „The cat“ schreiben, schlägt der Übersetzer „The“ nach, dann „cat“.
  • Wenn Sie „The dog“ schreiben, schlägt er „The“ nach, dann „dog“.

Ein hinterlistiger Spion (wie ein böswilliger Cloud-Server-Administrator) kann durch das Beobachten der Fingerbewegungen des Übersetzers genau sehen, welche Seiten des Wörterbuchs berührt werden. Durch das Beobachten der Reihenfolge und Häufigkeit dieser „Nachschläge“ kann der Spion Ihren ursprünglichen Brief rekonstruieren, obwohl er die Worte selbst nie gesehen hat. Dies wird als Side-Channel-Angriff bezeichnet.

Die alte Lösung: Der „PathORAM“-Shuffle
Um den Spion zu stoppen, versuchten Forscher zuvor eine Methode namens PathORAM einzusetzen. Stellen Sie sich dies als eine magische Bibliothek vor, in der der Bibliothekar nicht einfach nur ein Buch holt, sondern jedes Mal, wenn Sie nach einem Buch fragen, jedes einzelne Buch in der gesamten Bibliothek an einen neuen, zufälligen Ort verschiebt. Dies macht es unmöglich zu sagen, welches Buch Sie eigentlich wollten.

  • Das Ergebnis: Es funktioniert perfekt in Bezug auf die Sicherheit, ist aber unglaublich langsam. Es ist, als würde man nach einem Buch fragen und dann warten müssen, während der Bibliothekar das gesamte Gebäude umräumt. In der Arbeit führte dies dazu, dass das System 13-mal langsamer war, was eine enorme Verzögerung verursachte, bevor die KI überhaupt anfangen konnte, mit Ihnen zu kommunizieren.

Die neue Lösung: OTRO (Das „Rotierende Bibliothekssystem“)
Die Autoren dieser Arbeit, OTRO, erkannten, dass sich das Wörterbuch, das der Übersetzer verwendet, niemals ändert. Die Wörter sind immer dieselben; nur die Reihenfolge, in der der Spion sie beobachtet, ändert sich.

Sie haben ein klügeres System unter Verwendung von drei cleveren Tricks entwickelt:

  1. Der Pool identischer Bibliotheken: Anstatt einer einzigen Bibliothek, die ständig durchgemischt wird, erstellt OTRO einen Pool identischer Bibliotheken. Stellen Sie sich vor, Sie hätten 50 Kopien desselben Wörterbuchs.
  2. Das „Shift“-System: Wenn der Übersetzer Wörter nachschlagen muss, verwendet er Bibliothek #1. Sobald Bibliothek #1 eine bestimmte Anzahl an Nachschlägen (sagen wir 1.000) durchgeführt hat, wechselt der Übersetzer geräuschlos zu Bibliothek #2.
    • Die Magie: Während der Übersetzer mit Bibliothek #2 beschäftigt ist, organisiert ein Hintergrund-Mitarbeiter Bibliothek #1 heimlich und langsam im Schatten neu. Da der Mitarbeiter diese Umorganisation durchführt, während der Übersetzer mit der nächsten Bibliothek beschäftigt ist, verlangsamt die Umorganisation den Übersetzer nie.
  3. Das Aufteilen des Briefes: Für sehr lange Briefe unterteilt OTRO den Brief in kleine Stücke. Er übersetzt das erste Stück, während die GPU (das Gehirn der KI) bereits damit beginnt, darüber nachzudenken. Dies ermöglicht es, dass die „Umorganisationsarbeit“ im Hintergrund stattfindet, ohne den Hauptprozess jemals zu stoppen.

Die Ergebnisse

  • Geschwindigkeit: Da die schwere „Umorganisationsarbeit“ im Hintergrund stattfindet, ist das System fast so schnell wie die ursprüngliche, unsichere Version. Die Arbeit zeigt, dass es das System nur um etwa 4,5 % verlangsamt, was kaum merkbar ist.
  • Sicherheit: Der Spion kann nicht mehr sehen, welche spezifischen Wörter nachgeschlagen wurden. Alles, was er sehen kann, ist, dass „ein Nachschlag stattfand“. Das Einzige, was der Spion noch erraten kann, ist, wie lang Ihr Brief war (da längere Briefe mehr Nachschläge erfordern), aber er kann nicht erraten, was in dem Brief stand.
  • Speicher: Es verbraucht etwas mehr Speicher (weniger als ein halbes Gigabyte pro Benutzer), was ein kleiner Preis dafür ist, Ihre Geheimnisse sicher zu halten.

Zusammenfassend
OTRO ist wie das Einstellen eines Teams von Übersetzern, die im Schichtwechsel arbeiten. Während ein Übersetzer arbeitet, räumt ein anderer im Hintergrund heimlich die Bücher um. Auf diese Weise kann der Spion, der die Tür beobachtet, nicht erkennen, welches Buch genommen wurde, aber die Arbeit wird fast augenblicklich erledigt. Es verwandelt ein Sicherheitsproblem, das das System früher 13-mal langsamer machte, in eine Lösung, die nahezu instantan ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →