← Neueste Arbeiten
💻 computer science

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT ist ein neuartiges Framework, das multimodale große Sprachmodelle verbessert, indem es die ausführliche textbasierte Chain-of-Thought-Argumentation durch effiziente, schrittweise latente Gedankenrepräsentationen ersetzt und durch eine Trainingsstrategie, die einen leichtgewichtigen externen Decoder zur bidirektionalen Überwachung nutzt, aber diesen während der Inferenz entfernt, signifikante Beschleunigungen bei der Inferenz sowie eine überlegene Leistung erzielt.

Ursprüngliche Autoren: Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

Veröffentlicht 2026-07-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Der „gesprächige“ Roboter

Stellen Sie sich vor, Sie haben einen brillanten Roboter-Assistenten, der ein Bild betrachten und ein mathematisches Problem lösen kann. Um die richtige Antwort zu finden, muss der Roboter zuerst „nachdenken“.

Derzeit verwenden die meisten fortgeschrittenen Roboter eine Methode namens Chain-of-Thought (CoT). Dies ist so, als würde der Roboter laut mit sich selbst sprechen. Bevor er die endgültige Antwort gibt, schreibt er eine lange, schrittweise Geschichte in Textform auf: „Zuerst sehe ich ein Dreieck. Dann bemerke ich, dass die Linie 5 Zoll lang ist. Als Nächstes wende ich den Satz des Pythagoras an...“

Obwohl dies gut funktioniert, hat es zwei große Nachteile:

  1. Es ist langsam: Der Roboter muss jeden einzelnen Wort seines Denkprozesses eintippen. Wenn der Denkprozess lang ist, dauert das viel Zeit und Rechenleistung.
  2. Es ist starr: Sobeder der Roboter ein Wort geschrieben hat, ist er an diesen spezifischen Satz gebunden. Er kann seine Meinung nicht einfach ändern oder verschiedene Pfade erkunden, ohne die ganze Geschichte neu zu schreiben.

Die Lösung: CoLT (Chain of Latent Thoughts)

Die Autoren dieser Arbeit schlagen eine neue Art vor, diese Roboter das Denken beizubringen, genannt CoLT.

Anstatt den Roboter eine lange Geschichte schreiben zu lassen, lehrt CoLT den Roboter, in stillen, unsichtbaren Flüstertönen (genannt „latente Gedanken“) zu denken. Stellen Sie sich vor, der Roboter führt ein komplexes internes Gespräch in einem Geheimcode, den nur er selbst versteht. Er schreibt die Schritte nicht auf; er hält die Ideen einfach in seinem „Geist“ (seinem internen Computerspeicher) und springt direkt zur Antwort.

Die Analogie:

  • Der alte Weg (Text CoT): Wie ein Schüler, der eine Matheaufgabe löst, indem er jeden einzelnen Schritt auf ein Blatt Papier schreibt. Es ist klar, aber es dauert lange zu schreiben.
  • CoLT: Wie ein Schachgroßmeister, der ein Brett betrachtet. Er spricht die Züge nicht laut aus; er visualisiert die gesamte Strategie sofort in seinem Kopf und macht dann den Zug.

Die Herausforderung: Das „stille“ Problem

Den Forschern wurde klar, dass ein Roboter oft verwirrt ist, wenn man ihm einfach nur sagt, er solle „stillständig denken“. Ohne die Struktur des Schreibens von Wörtern könnten die internen Gedanken des Roboters zu Kauderwelsch oder bedeutunglosem Rauschen werden. Es ist, als würde man jemanden bitten, ein Rätsel im Kopf zu lösen, ohne jemals zu prüfen, ob seine Logik überhaupt Sinn ergibt.

Die Lösung: Der „Geheimübersetzer“

Um dies zu beheben, bauten die Autoren ein spezielles Trainingssystem mit drei „Coaches“ (Überwachungs-Signalen), um dem Roboter beizubringen, richtig in der Stille zu denken:

  1. Der Forward Coach (Der Übersetzer): Dieser Coach betrachtet den stillen Gedanken des Roboters und versucht, ihn zurück in Englisch zu übersetzen. Wenn der Gedanke des Roboters gut ist, kann der Coach den nächsten Schritt der Geschichte leicht schreiben. Wenn der Coach ihn nicht übersetzen kann, weiß der Roboter, dass er klarer denken muss.
  2. Der Backward Coach (Der Anker): Dieser Coach betrachtet die englische Geschichte und versucht, diese zurück in den stillen Gedanken des Roboters zu verwandelt. Dies stellt sicher, dass die stillen Gedanken des Roboters tatsächlich mit echten, logischen Ideen verbunden sind und nicht nur aus zufälligen Zahlen bestehen.
  3. Der Internal Coach (Der Fluss): Dieser Coach prüft, ob die Gedanken des Roboters logisch von einem Schritt zum nächsten fließen. Er stellt sicher, dass der Roboter nicht willkürlich von Idee A zu Idee Z springt, ohne eine Brücke dazwischen zu bauen.

Das Beste daran: Diese Coaches werden nur während des Lernens verwendet. Sobald der Roboter trainiert ist, werden die Coaches weggeworfen. Wenn der Roboter tatsächlich ein Problem für Sie löst, nutzt er seine stillen Gedanken direkt. Keine zusätzliche Übersetzung, keine zusätzlichen Schritte.

Die Ergebnisse: Schnell und Intelligent

Die Autoren testeten diese neue Methode bei acht verschiedenen anspruchsvollen Aufgaben, wie dem Lesen von Diagrammen, dem Lösen von wissenschaftlichen Fragen und dem Verständnis von Diagrammen.

  • Geschwindigkeit: Da der Roboter das Schreiben von tausenden Wörtern überspringt und stattdessen nur 3 „stille Schritte“ nutzt, ist er insgesamt 10-mal schneller und in der Denkphase 22-mal schneller als die alte textbasierte Methode.
  • Genauigkeit: Überraschenderweise wurde der Roboter nicht nur schneller, sondern auch intelligenter. Er übertraf andere Methoden, die versuchten, „stilles Denken“ anzuwenden, und schlug sogar Methoden, die teure zusätzliche Bilder benötigten, um zu lernen.
  • Robustheit: Wenn die Eingabe unordentlich war (wie ein verschwommenes Bild oder eine Frage mit Tippfehlern), war die stille Denkmethode viel stabiler als die textbasierte Methode. Es ist, als wäre ein Flüstern weniger anfällig für Hintergrundgeräusche als ein lautes Schreien.

Zusammenfassung

CoLT ist eine neue Art, KI das Denken beizubringen. Anstatt die KI zu zwingen, eine lange, langsame Geschichte zu schreiben, um ein Problem zu lösen, lehrt sie die KI, ein strukturiertes, logisches Gespräch in ihrem eigenen „Geist“ zu führen. Durch den Einsatz spezieller Trainingswerkzeuge, um sicherzustellen, dass diese stillen Gedanken Sinn ergeben, wird die KI sowohl viel schneller als auch genauer beim Lösen komplexer visueller Rätsel.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →