← Neueste Arbeiten
💬 NLP

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner ist eine Familie multimodaler Modelle, die durch das Erlernen der Werkzeugorchestrierung als allgemeine Fähigkeit mittels einer skalierbaren Datenpipeline, Tool-GRPO-Reinforcement-Learning und eines adaptiven Mechanismus zur dynamischen Werkzeugregulierung eine erstklassige visuelle Argumentation und Generalisierung auf ungesehene Werkzeuge erreicht.

Ursprüngliche Autoren: Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

Veröffentlicht 2026-01-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen brillanten, aber etwas tollpatschigen Assistenten, der versucht, ein komplexes Rätsel zu lösen, wie zum Beispiel das Navigieren durch ein Labyrinth oder das Reparieren eines kaputten Bildes. Manchmal bleibt dieser Assistent stecken, weil er die Details nicht klar sehen kann oder die Regeln des Labyrinths vergisst.

AdaReasoner ist eine neue Art, diesen Assistenten zu trainieren, damit er aufhört, alles im Kopf zu versuchen, und stattdessen genau weiß, wann er um Hilfe bitten muss, welches Werkzeug er anfordern soll und wie er es benutzt.

Hier ist die Aufschlüsselung, wie es funktioniert, unter Verwendung einfacher Analogien:

1. Das Problem: Die „Alles-selber-machen“-Falle

Aktuelle KI-Modelle sind wie Schüler, denen gesagt wird, sie sollen eine Matheaufgabe nur mit ihrem Gehirn lösen. Wenn die Aufgabe einen Taschenrechner erfordert, versucht der Schüler vielleicht, die Antwort zu erraten oder versucht, die Rechnung im Kopf durchzuführen und liegt dann falsch. Er weiß nicht, wann er den Taschenrechner greifen muss, oder er greift vielleicht das falsche Werkzeug (wie ein Lineal statt eines Taschenrechners).

2. Die Lösung: Ein „Werkzeug-Orchester“

Die Forscher haben AdaReasoner entwickelt, das Werkzeuge (wie eine Lupe, eine Karte oder einen Taschenrechner) wie Instrumente in einem Orchester behandelt. Die KI ist nicht mehr nur ein Solist; sie ist ein Dirigent.

  • Es weiß, wann es spielen muss: Es lernt, dass es für manche Aufgaben nötig ist, heranzuzoomen (ein „Lupe“-Werkzeug), aber für andere eine Linie zu ziehen (ein „Lineal“-Werkzeug).
  • Es weiß, wann es aufhören muss: Wenn ein Werkzeug nicht hilft, lernt es, es wieder wegzulegen und einen anderen Ansatz zu versuchen.
  • Es passt sich an neue Instrumente an: Selbst wenn man der KI ein brandneues Werkzeug gibt, das sie noch nie gesehen hat, kann sie herausfinden, wie man es benutzt, indem sie einfach die Bedienungsanleitung (die Beschreibung des Werkzeugs) liest.

3. Wie sie es trainiert haben (Das Drei-Schritte-Rezept)

Um der KI diese Fähigkeiten beizubringen, nutzten die Forscher einen dreistufigen Trainingsprozess:

  • Schritt 1: Die „Skriptierte Probe“ (Tool Cold Start)
    Stellen Sie sich einen Schauspiellehrer vor, der dem Schauspieler ein perfektes Skript für ein Stück gibt. Der KI werden hochwertige Beispiele gezeigt, wie man Probleme Schritt für Schritt löst und dabei Werkzeuge korrekt verwendet. Dies lehrt sie die grundlegenden „Bewegungen“ und wie man die Werkzeuge hält.

    • Analogie: Es ist, als würde man einem Koch genau zeigen, wie man eine Zwiebel schneidet, bevor man ihn kochen lässt.
  • Schritt 2: Das „Versuch und Irrtum“-Spiel (Tool GRPO)
    Soblich die KI die Grundlagen beherrscht, lassen die Forscher sie ein Spiel spielen, bei dem sie Punkte für das Lösen des Rätsels erhält.

    • Wenn sie das richtige Werkzeug zur richtigen Zeit benutzt, erhält sie eine große Belohnung.
    • Wenn sie ein Werkzeug benutzt, das nicht hilft, oder ohne zu prüfen rät, erhält sie eine kleinere Belohnung oder einen Abzug.
    • Analogie: Dies ist wie ein Videospiel, bei dem die KI lernt, dass die Nutzung eines „Jetpacks“, um einen Fluss zu überqueren, großartig ist, aber die Nutzung eines „Jetpacks“, um eine Tür zu öffnen, eine Verschwendung von Zeit ist. Sie lernt, ihre Strategie zu optimieren.
  • Schritt 3: Die „Geheimcode“-Herausforderung (Adaptives Lernen)
    Um sicherzustellen, dass die KI nicht nur die Namen der Werkzeuge auswendig lernt (wie zum Beispiel auswendig zu lernen, dass „Werkzeug A“ immer zum Messen ist), änderten die Forscher während des Trainings die Namen und Beschreibungen der Werkzeuge zufällig.

    • Analogie: Stellen Sie sich vor, Sie bringen jemandem das Autofahren bei, aber jeden Tag ändern Sie den Namen des Gaspedals von „Gas“ zu „Go“, „Fuel“ oder „X7a2“. Der Schüler muss lernen, was das Pedal tut, basierend auf seiner Funktion, nicht auf seinem Namen. Dies stellt sicher, dass die KI jedes Werkzeug handhaben kann, selbst wenn sie es noch nie zuvor gesehen hat.

4. Das Ergebnis: Kleines Gehirn, große Fähigkeiten

Der spannendste Teil der Arbeit ist, dass die Forscher ein relativ kleines KI-Modell (ein „7B“-Modell, was wie einem klugen Studenten entspricht) mit diesen Werkzeug-Fähigkeiten ausgestattet haben.

  • Das Ergebnis: Dieses kleine Modell wurde im Umgang mit Werkzeugen so gut, dass es viel größere, „geschlossene“ Modelle (wie GPT-5 und Claude Sonnet 4) bei schwierigen visuellen Rätseln schlug.
  • Die Analogie: Es ist, als würde man ein Fahrrad mit einem hochtechnologischen Getriebe und einem GPS ausstatten. Plötzlich kann das Fahrrad gegen einen Ferrari fahren, weil das Fahrrad genau weiß, wie es das Gelände navigiert, während der Ferrari einfach nur blind fährt.

5. Praxisbeispiele aus der Arbeit

Die Arbeit zeigt die KI bei Aufgaben wie:

  • Navigieren durch ein Labyrinth: Anstatt zu raten, benutzt sie ein Werkzeug, um Start- und Endpunkte zu finden, und nutzt dann ein „Pfadfindungs“-Werkzeug, um die perfekte Route zu zeichen und dabei Löchern auszuweichen.
  • Reparieren eines Puzzles: Sie benutzt ein Werkzeug, um den fehlenden schwarzen Fleck in einem Bild zu finden, und versucht dann, verschiedene Puzzleteile einzusetzen, bis eines perfekt passt.
  • Eine Website lesen: Sie benutzt ein „Crop“-Werkzeug, um in einen bestimmten Button hineinzoomen, und ein „OCR“-Werkzeug (wie ein digitales Auge), um den Text darauf zu lesen, um genau herauszufinden, wie man etwas kauft.

Zusammenfassung

AdaReasoner lehrt KI-Modelle, aufzuhören, intern versuchen zu wollen, in allem perfekt zu sein. Stattdessen lehrt es sie, kluge Manager zu sein, die wissen, wann sie ein Expertenwerkzeug rufen müssen, um die schwere Arbeit zu erledigen. Indem es lernt, sich an neue Werkzeuge und Aufgaben anzupassen, kann selbst eine kleine KI komplexe visuelle Probleme besser lösen als viel größere, teurere Systeme.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →