← Neueste Arbeiten
💻 computer science

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

Die Arbeit identifiziert, dass das Reinforcement-Learning-Verfahren GRPO bei Vision-Language-Modellen zu einem Verlust an Vielfalt führt, und schlägt stattdessen den neuen Ansatz Multi-Group Policy Optimization (MUPO) vor, um divergentes Denken zu fördern und die Leistung zu steigern.

Ursprüngliche Autoren: Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

Veröffentlicht 2026-04-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Der "Einbahnstraßen-Denker"

Stell dir vor, du hast zwei verschiedene Detektive, die ein Rätsel lösen sollen.

  1. Der Basis-Detektiv (das ursprüngliche Modell): Er ist etwas chaotisch. Er wirft viele Ideen in den Raum. Manchmal denkt er: "Vielleicht war es der Butler?", dann: "Oder vielleicht war es das Messer im Keller?", und dann: "Warte, lass uns den Garten durchsuchen!" Er versucht viele verschiedene Wege. Wenn er einen Weg nicht findet, probiert er sofort einen anderen. Er ist breit aufgestellt, aber auf einem einzelnen Weg vielleicht nicht so perfekt.
  2. Der RL-Detektiv (das mit KI-Training optimierte Modell): Dieser Detektiv wurde durch Bestrafung und Belohnung (Reinforcement Learning) trainiert. Er hat gelernt, dass ein bestimmter Weg (z. B. "immer zuerst den Butler verdächtigen") oft funktioniert. Also konzentriert er sich extrem stark darauf. Er denkt tief und detailliert über diesen einen Weg nach. Er wird sehr gut darin, diesen einen Weg zu meistern.

Das Problem:
Die Forscher haben festgestellt, dass der RL-Detektiv zwar auf seinem einen Weg sehr klug ist, aber völlig blind für alles andere wird. Wenn der Butler unschuldig ist und der Weg in eine Sackgasse führt, gibt der RL-Detektiv auf oder macht Fehler, weil er nicht mehr auf andere Ideen kommt. Er ist in eine "Einbahnstraße" gefahren und hat den Rest der Stadt vergessen.

In der Fachsprache nennen sie das "Diversity Collapse" (Zusammenbruch der Vielfalt). Das Modell verlernt quasi, kreativ zu sein, weil es zu sehr auf den "perfekten" Weg fixiert ist.

Die Lösung: MUPO (Die "Viele-Gruppen"-Strategie)

Um dieses Problem zu lösen, haben die Autoren eine neue Methode namens MUPO (Multi-Group Policy Optimization) entwickelt.

Stell dir MUPO wie einen klugen Teamleiter vor, der eine Gruppe von Detektiven leitet.

  • Bei der alten Methode (GRPO): Der Teamleiter sagt: "Alle 10 Detektive, rennt alle denselben Weg! Derjenige, der am schnellsten ans Ziel kommt, bekommt einen Bonus." Das Ergebnis: Alle rennen denselben Weg. Wenn dieser Weg falsch ist, verlieren alle.

  • Bei der neuen Methode (MUPO): Der Teamleiter sagt: "Okay, wir teilen uns in 3 Gruppen auf.

    • Gruppe A darf den Weg durch den Garten suchen.
    • Gruppe B darf das Dach inspizieren.
    • Gruppe C darf die Kellerfenster prüfen.

    Wichtig ist: Jede Gruppe bekommt einen Bonus, wenn sie einen anderen Weg geht als die anderen, aber trotzdem das Rätsel löst."

Der Clou:
Durch diese Aufteilung zwingt MUPO das Modell, nicht nur einen Weg perfekt zu machen, sondern viele verschiedene Wege gleichzeitig zu erkunden und zu verbessern. Es kombiniert die Tiefe des RL-Detektiven (er denkt tief über seinen Weg nach) mit der Breite des Basis-Detektiven (er probiert viele Wege aus).

Was bringt das?

  1. Bessere Fehlerbehebung: Wenn ein Rätsel sehr schwer ist und der "Standard-Weg" versagt, hat das MUPO-Modell immer noch andere Ideen im Hinterkopf, die es ausprobieren kann.
  2. Höhere Erfolgsquote: In Tests (wie bei Matheaufgaben oder Logikrätseln) haben die Modelle mit MUPO deutlich besser abgeschnitten als die vorherigen Spitzenmodelle. Sie finden die Lösung nicht nur schneller, sondern auch zuverlässiger, selbst wenn sie mehrere Versuche haben.
  3. Menschlicheres Denken: Es ahmt nach, wie Menschen Probleme lösen: Wir probieren oft verschiedene Ansätze aus, bevor wir uns auf den besten festlegen.

Zusammenfassung in einem Satz

Die Forscher haben entdeckt, dass KI-Modelle durch zu striktes Training ihre Kreativität verlieren und nur noch einen einzigen Weg gehen; mit ihrer neuen Methode MUPO zwingen sie die KI, wieder wie ein menschlicher Problemlöser zu denken: "Alle Wege führen nach Rom" – aber man sollte nicht nur einen Weg gehen, sondern mehrere gleichzeitig erkunden, um sicher anzukommen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →