← Neueste Arbeiten
🤖 AI

Dual-Cache Latent Space Communication between Heterogeneous Language Models

Das Papier stellt XKV vor, ein neuartiges Kommunikationsprotokoll, das es heterogenen, eingefrorenen Sprachmodellen ermöglicht, Informationen über einen gelernten Übersetzer ihrer KV-Caches auszutauschen, wodurch bisherige Einschränkungen in Bezug auf Geometrie und Schichtausrichtung überwunden werden, um eine überlegene Genauigkeit und signifikant schnellere Inferenz im Vergleich zu sowohl textbasierten als auch früheren Methoden der Kommunikation im latenten Raum zu erreichen.

Ursprüngliche Autoren: Jiyao Liu, Qi Zhang, Yaoyi Jia, Ziwen Kan, Song Wang

Veröffentlicht 2026-08-24
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiyao Liu, Qi Zhang, Yaoyi Jia, Ziwen Kan, Song Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Landschaft der künstlichen Intelligenz agieren große Sprachmodelle zunehmend nicht als einsame Denker, sondern als Mitglieder eines Teams. Stellen Sie sich eine Gruppe von Forschern vor, die an einem komplexen Rätsel arbeiten, wobei jeder Mensch nur einen anderen Satz von Dokumenten gelesen hat. Um den Fall zu lösen, müssen sie teilen, was sie wissen. In der digitalen Welt sind diese „Forscher“ Software-Agenten, und die Dokumente, die sie halten, sind Beweisstücke, die in ihrem internen Speicher verborgen sind. Damit diese Agenten zusammenarbeiten können, benötigen sie eine Möglichkeit, Informationen von einem zum anderen zu übergeben. Bis vor kurzem war die Standardmethode, dass ein Agent eine Zusammenfassung in natürlicher Sprache schreibt und sie an den nächsten sendet. Während dies für Menschen leicht zu lesen ist, ist es für Maschinen ineffizient. Der sendende Agent muss die Nachricht langsam Wort für Wort konstruieren, und der empfangende Agent muss diese Wörter dann lesen und sein eigenes internes Verständnis von Grund auf neu aufbauen. Dieser Prozess ist wie ein Staffellauf, bei dem die Läufer stoppen müssen, um eine Notiz zu schreiben, sie zu übergeben, und dann Zeit damit verbringen müssen, sie zu lesen, bevor sie wieder laufen können.

Forscher haben nach einem schnelleren Weg zur Kommunikation gesucht, der das Schreiben und Lesen von Wörtern gänzlich überspringt. Anstatt Text auszutauschen, versuchten sie, die rohen, internen „Gedanken“ einer Maschine direkt an eine andere zu übergeben. Dies ist vergleichbar damit, einem Läufer eine bereits geschriebene Notiz zu überreichen, die er sofort aufnehmen kann, ohne sie lesen zu müssen. Die frühen Versuche dieses direkten Transfers stießen jedoch an eine Grenze. Sie funktionierten nur gut, wenn die beiden Maschinen identische Zwillinge waren, oder sie zwangen den Absender dazu, sein gesamtes Wissen in eine einzige, generische Zusammenfassung zu komprimieren, die ignorierte, was der Empfänger bereits wusste. Das bedeutete, dass der Empfänger oft eine Nachricht erhielt, die entweder zu vage oder irrelevant für seine spezifischen Bedürfnisse war. Die Herausforderung bestand darin, einen Kommunikationskanal zu schaffen, der schnell ist, zwischen verschiedenen Arten von Maschinen funktioniert und es dem Empfänger ermöglicht, genau die Informationen abzufragen, die er benötigt, anstatt eine Einheitslösung in Form einer Zusammenfassung zu akzeptieren.

Ein Forschungsteam hat nun ein neues System namens XKV vorgestellt, das diese Probleme löst. Ihr Ansatz behandelt die Kommunikation zwischen zwei verschiedenen Sprachmodellen als gemeinsame Anstrengung statt als einfache Übergabe. In ihrem System bleiben die beiden Modelle – eines, das ein Teil des Puzzles hält, und das andere, das den Rest hält – in ihrem ursprünglichen Zustand eingefroren, was bedeutet, dass ihre Kernintelligenz nicht verändert wird. Stattdessen sitzt ein leichtgewichtiger Übersetzer zwischen ihnen. Dieser Übersetzer betrachtet den internen Speicher beider Modelle gleichzeitig. Er fasst nicht nur zusammen, was das erste Modell weiß; er findet heraus, was dem zweiten Modell fehlt, indem er die beiden Datensätze der Erinnerungen miteinander vergleicht. Er erstellt daraufhin einen kompakten, gemeinsamen Speicherbank, der die Beweise des Senders mit dem aktuellen Zustand des Empfängers verschmilzt.

Die Innovation liegt darin, wie dieser gemeinsame Speicher genutzt wird. In früheren Systemen wurde jeder Teil des empfangenden Modells gezwungen, derselben einzelnen Zusammenfassung zuzuhören, wie in einem Klassenzimmer, in dem jeder Schüler unabhängig von seinem Vorwissen denselben Vortrag hört. Das neue XKV-System ermöglicht es jeder einzelnen Position im Speicher des Empfängers, eine spezifische Frage an diese gemeinsame Speicherbank zu richten. Es ist, als ob jeder Schüler in der Klasse die Hand heben könnte, um nach der spezifischen Tatsache zu fragen, die ihm fehlt, und der Lehrer würde genau diese bereitstellen. Das System liefert dann ein präzises, maßgeschneidertes Update für jeden Teil des Speichers des Empfängers, wodurch die Lücken gefüllt werden, ohne dessen restliches Wissen zu stören. Dieser Prozess geschieht in einem Bruchteil der Zeit, die es dauert, eine Textnachricht zu schreiben und zu lesen, und er funktioniert selbst dann, wenn die beiden Modelle auf völlig unterschiedlichen Architekturen basieren, verschiedene Vokabularien verwenden oder eine unterschiedliche Anzahl interner Schichten besitzen.

Die Forscher testeten dieses System in einer Vielzahl von Szenarien und stellten verschiedene Familien von Sprachmodellen jeweils anderen gegenüber bei fünf verschiedenen Denkaufgaben. Diese Aufgaben beinhalteten das Beantworten von Fragen, die das Kombinieren von Beweisen erforderten, die zwischen den beiden Agenten aufgeteilt waren, wie etwa das Verknüpfen von Fakten aus verschiedenen Absätzen, um ein mehrstufiges Problem zu lösen. Die Ergebnisse zeigten, dass das neue System sowohl die traditionelle textbasierte Methode als auch den bisher besten Versuch eines direkten Speicher-Transfers konsistent übertraf. Im Durchschnitt verbesserte das neue System die Genauigkeit der Antworten signifikant, wobei einige spezifische Tests einen Sprung von über vier Prozentpunkten bei den Exact-Match-Scores im Vergleich zur bisher besten Methode zeigten. Neben der höheren Intelligenz war es auch drastisch schneller. Die Translator-Komponente des neuen Systems lief mehr als zehnmal schneller als die bisher führende Methode und war fast siebenmal schneller als der Standard-Textansatz.

Die Studie hob auch hervor, dass diese Geschwindigkeit nicht zu Lasten der Komplexität ging. Der neue Translator benötigte 7 Prozent weniger trainierbare Parameter als die bisher führende Methode, was ihn viel effizienter in der Erstellung und im Betrieb machte. Entscheidend ist, dass das System seine hohe Leistung beibehielt, selbst wenn die beiden kommunizierenden Modelle völlig unterschiedlich voneinander waren, wie etwa ein Modell einer Firma, das mit einem Modell einer anderen Firma spricht, oder ein kleineres Modell, das mit einem größeren spricht. Diese Flexibilität deutet darauf hin, dass das System in realen Szenarien eingesetzt werden kann, in denen diverse KI-Werkzeuge zusammenarbeiten müssen, ohne neu trainiert oder in eine einheitliche Form gezwungen zu werden. Die Forscher fanden heraus, dass das System am besten funktionierte, wenn es einen gemeinsamen Speicher aus beiden Seiten aufbauen konnte, anstatt sich auf eine Zusammenfassung von nur einer Seite zu verlassen. Dies bestätigte, dass die effektivste Kommunikation stattfindet, wenn Sender und Empfänger gemeinsam betrachtet werden, was es dem Empfänger ermöglicht, genau das abzurufen, was er benötigt, aus einem gemeinsamen Pool an Informationen.

Die Auswirkungen dieser Arbeit reichen über die bloße Beschleunigung von KI hinaus. Indem sie die Notwendigkeit beseitigt, dass Modelle in menschlicher Sprache miteinander sprechen müssen, um einander zu verstehen, öffnet das System die Tür für flüssigere und effizientere Multi-Agenten-Systeme. Diese Systeme könnten komplexe Aufgaben koordinieren, wie etwa die Analyse riesiger Datenmengen oder das Lösen komplizierter wissenschaftlicher Probleme, ohne den Flaschenhals der Generierung und des erneuten Lesens von Text. Die Forscher demonstrierten, dass es möglich ist, einen Kommunikationskanal zu schaffen, der sich des Zustands des Empfängers bewusst ist, spezifische Updates aus einem gemeinsamen Speicher abruft und streng kostengünstiger und schneller bleibt als die durch den Sender-zentrierten Zusammenfassungen ersetzten Methoden. Dies stellt einen Wandel dar: weg von der Betrachtung von KI-Agenten als isolierte Entitäten, die ihre Gedanken in Worte übersetzen müssen, hin zur Betrachtung als ein kohärentes Netzwerk, das rohes Verständnis direkt teilen kann. Die Ergebnisse legen nahe, dass die Zukunft der kollaborativen künstlichen Intelligenz nicht in besserer Sprache liegen könnte, sondern in besseren Wegen, die stillen, internen Zustände zu teilen, die Intelligenz antreiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →