← Neueste Arbeiten
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

Die Arbeit stellt Vero vor, eine Familie vollständig offener Vision-Language-Modelle, die durch Skalierung von RL-Daten und -Belohnungen über sechs Aufgabenkategorien hinweg (Vero-600K) den State-of-the-Art bei visuellem Reasoning erreicht und dabei proprietäre Modelle ohne zusätzliche geschlossene Daten übertrifft.

Ursprüngliche Autoren: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

Veröffentlicht 2026-04-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, du möchtest einen Roboter-Artist und Wissenschaftler gleichzeitig ausbilden. Er soll nicht nur mathematische Diagramme lesen können, sondern auch verstehen, wie viele Äpfel auf einem Tisch liegen, wo sich ein versteckter Schatz in einem Bild befindet, und sogar einen lustigen Instagram-Text zu einem Foto schreiben.

Das ist die große Herausforderung, an der das Team um die Universität Princeton gearbeitet hat. Sie haben Vero entwickelt – ein neues, „offenes" Modell für künstliche Intelligenz, das visuelles Denken meistert.

Hier ist die Geschichte von Vero, einfach erklärt:

1. Das Problem: Der verschlossene Kochtopf

Bisher waren die besten KI-Modelle, die Bilder verstehen, wie ein verschlossener Kochtopf. Man wusste, dass sie köstliche Gerichte (sehr gute Antworten) servierten, aber niemand durfte sehen, wie sie gekocht haben. Die Geheimrezepte (Daten und Trainingsmethoden) waren hinter verschlossenen Türen von großen Tech-Firmen versteckt. Man wusste nicht genau, ob sie nur für Mathe-Tests trainiert waren oder ob sie wirklich „denken" konnten.

Andere offene Projekte waren wie ein Kochkurs, der sich nur auf Pasta (Mathematik) spezialisiert hatte. Wenn man sie bat, einen Salat zuzubereiten (z. B. einen Raum zu beschreiben), versagten sie oft.

2. Die Lösung: Vero – Der Allrounder-Kochkurs

Die Forscher haben Vero geschaffen. Das ist wie ein riesiges, offenes Kochbuch, das jeder nutzen darf. Das Besondere daran? Sie haben das Modell nicht nur auf eine Sache trainiert, sondern auf sechs völlig verschiedene Disziplinen gleichzeitig:

  1. STEM: Wie ein Wissenschaftler (Mathe, Physik, Diagramme).
  2. Raum & Aktion: Wie ein Architekt oder Roboter (Wo ist was? Wie bewege ich mich?).
  3. Wissen & Erkennen: Wie ein Detektiv (Was ist das für ein Vogel? Welches Land ist das?).
  4. Diagramme & Text: Wie ein Büroangestellter (Tabellen lesen, Text in Bildern finden).
  5. Ortung & Zählen: Wie ein Zähler (Wie viele Hunde sind da? Wo ist der Hund?).
  6. Beschreibung & Anweisungen: Wie ein Künstler (Schreibe einen lustigen Text dazu).

3. Das Geheimrezept: Der „Bunte Mix" statt der Einbahnstraße

Das war der entscheidende Durchbruch. Früher dachte man: „Trainiere das Modell erst auf Mathe, dann auf Bildern."
Die Forscher haben aber entdeckt: Wenn man das Modell nur auf Mathe trainiert, vergisst es, wie man spricht. Wenn man es nur auf Bilder trainiert, vergisst es die Logik.

Stell dir vor, du lernst nur Klavier. Wenn du plötzlich Geige spielen sollst, klingen deine Finger steif. Vero lernt stattdessen, alle Instrumente gleichzeitig zu spielen.

  • Sie haben 600.000 Beispiele aus 59 verschiedenen Quellen gesammelt.
  • Sie haben das Modell so trainiert, dass es für jede Aufgabe die richtige „Denkstrategie" wählt. Bei Mathe denkt es lange und gründlich (wie ein Mathematiker). Bei der Ortung schaut es schnell und zielgerichtet hin (wie ein Jäger).

4. Der Belohnungssystem-Trick

Wie lernt man einem Roboter bei so vielen verschiedenen Aufgaben, was „gut" ist?
Stell dir vor, du gibst einem Schüler für eine Mathe-Antwort einen Stern, aber für einen lustigen Witz einen anderen Stern. Das wäre verwirrend.
Vero nutzt ein intelligentes Belohnungssystem:

  • Wenn die Antwort auf eine Mathefrage stimmt, gibt es Punkte.
  • Wenn die Antwort auf eine Bildbeschreibung kreativ ist, gibt es Punkte.
  • Das System prüft genau, ob die Antwort der richtigen Art von Aufgabe entspricht. So lernt das Modell: „Aha, bei diesem Bild muss ich zählen, bei jenem muss ich logisch denken."

5. Das Ergebnis: Der Meister der Vielfalt

Das Ergebnis ist beeindruckend. Vero ist jetzt so gut wie die besten geschlossenen Modelle (die Geheimrezepte der Tech-Giganten), aber es ist frei verfügbar.

  • Es schlägt andere Modelle in fast allen Kategorien.
  • Es kann nicht nur Mathe lösen, sondern auch verstehen, was auf einem Bildschirm passiert, oder einen Text zu einem Foto schreiben, ohne dabei die Logik zu verlieren.

Zusammenfassung in einem Satz

Vero ist wie ein universeller Schüler, der nicht nur für eine Prüfung gelernt hat, sondern durch das Üben mit einer riesigen, bunten Mischung aus Aufgaben gelernt hat, in jeder Situation die richtige Denkweise zu wählen – und das alles mit einem offenen Rezept, das jeder nachkochen kann.

Die Forscher zeigen damit: Man braucht keine geheimen Daten, um eine super-intelligente KI zu bauen. Man braucht nur die richtige Mischung aus Vielfalt und Geduld.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →