← Neueste Arbeiten
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

Das Papier stellt InfantAgent-Next vor, einen hochmodularen multimodalen Generalisten-Agenten, der auf Werkzeugen basierende und reine Vision-Fähigkeiten integriert, um eine kollaborative, schrittweise Computerinteraktion zu ermöglichen und dabei state-of-the-art-Leistung auf diversen Benchmarks einschließlich OSWorld, GAIA und SWE-Bench zu erzielen.

Ursprüngliche Autoren: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Veröffentlicht 2026-05-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen sehr klugen, aber etwas ungeschickten persönlichen Assistenten namens InfantAgent-Next.

In der Welt der Computerautomatisierung sind die meisten heutigen Assistenten entweder wie Spezialisten, die nur eine Sache wirklich gut können, oder wie Generalisten, die versuchen, alles zu erledigen, dabei aber oft verwirrt werden.

  • Manche Assistenten sind wie Bibliothekare: Sie sind hervorragend im Umgang mit einer spezifischen Liste von Werkzeugen (wie „im Internet suchen" oder „eine Datei öffnen"), aber wenn Sie sie bitten, auf einen Knopf auf einem Bildschirm zu klicken, den sie noch nie gesehen haben, frieren sie ein, weil sie kein Werkzeug für diesen spezifischen Knopf haben.
  • Andere Assistenten sind wie Künstler: Sie können auf einen Bildschirm schauen und „sehen", was dort ist, aber sie haben Schwierigkeiten, komplexe Mathematik zu betreiben oder Code zu schreiben, weil sie versuchen, dies allein mit ihren Augen zu erledigen, ohne Taschenrechner oder Texteditor.

InfantAgent-Next ist anders. Es ist, als würde man ein Schweizer Taschenmesser-Team einstellen, anstatt eine einzelne Person.

Wie es funktioniert: Das Team aus „Gehirn und Händen"

Anstatt dass ein einziges riesiges Gehirn versucht, alles zu erledigen, zerlegt InfantAgent-Next jede Aufgabe in kleine Schritte und sendet jeden Schritt an den dafür am besten geeigneten Experten.

  1. Der Manager (Der Planer): Wenn Sie fragen: „Speichere diese Webseite in meinen Lesezeichen", liest ein hochrangiges „Manager"-Modell Ihre Anfrage. Es versucht nicht, selbst die Maus zu bewegen. Stattdessen sagt es: „Okay, wir müssen den Browser öffnen, den Lesezeichen-Knopf finden und darauf klicken."
  2. Die Spezialisten: Der Manager ruft dann den richtigen Experten für die Aufgabe hinzu:
    • Das Auge (Visuelle Verankerung): Wenn die Aufgabe lautet „Klicke auf den roten Knopf", betrachtet ein spezialisierter Vision-Modell den Bildschirm, findet die genauen Pixelkoordinaten dieses roten Knopfes und teilt dem System mit, wo geklickt werden soll. Es ist wie ein scharfäugiger Späher, der einen blindgeschnürten Bogenschützen führt.
    • Der Rechner (Code-Ausführung): Wenn die Aufgabe lautet „Analysiere diese Excel-Datei", übergibt der Manager die Datei an einen Codierungsexperten, der ein Skript schreibt, um die Mathematik sofort zu erledigen, anstatt zu versuchen, die Zeilen durch Betrachten des Bildschirms zu zählen.
    • Das Ohr (Audio-Analyse): Wenn Sie eine Aufnahme hochladen und fragen: „Auf welcher Seitenzahl wird erwähnt?", hört ein spezialisierter Audio-Modell die Datei ab und extrahiert die Antwort.
  3. Das Gedächtnis: Das System führt ein gemeinsames Notizbuch. Jedes Mal, wenn ein Spezialist einen Schritt abgeschlossen hat, schreibt er ihn hinein. Der nächste Spezialist nimmt das Notizbuch auf, liest, was passiert ist, und setzt die Geschichte fort. Dies stellt sicher, dass das Team das Ziel nicht aus den Augen verliert.

Warum dies wichtig ist (Die „magischen" Tricks)

Die Studie hebt zwei Hauptprobleme hervor, die dieses System löst:

  • Das „Klick"-Problem: Viele KI-Agenten sind schlecht darin, die richtige Stelle auf einem Bildschirm anzuklicken. Sie könnten 5 Pixel zu links klicken und den Knopf verfehlen. InfantAgent-Next verwendet eine „Hineinzoomen"-Technik. Wenn es einen Knopf anklicken muss, rät es nicht einfach. Es macht ein Foto des Bildschirms, findet den allgemeinen Bereich, schneidet diesen Bereich aus, um ihn größer darzustellen, findet den Knopf erneut, schneidet ihn erneut aus und klickt dann. Es ist wie die Verwendung einer Lupe, um eine Nadel im Heuhaufen zu finden, was sicherstellt, dass der Klick präzise ist.
  • Das „Bearbeiten"-Problem: Beim Bearbeiten einer Textdatei liegen KI-Modelle oft bei den Zeilennummern falsch (z. B. „Ändere Zeile 5", wenn es eigentlich Zeile 6 sein sollte). InfantAgent-Next verfügt über ein „Doppel-Check"-System. Es schlägt eine Änderung vor, betrachtet dann den tatsächlichen Text zur Verifizierung und fragt: „Sagt Zeile 5 wirklich das, was ich denke?" Wenn nicht, passt es seinen Plan an, bevor es die Änderung vornimmt, und verhindert so unordentliche Fehler.

Was es leisten kann (Der Beweis)

Die Forscher testeten dieses „Team von Spezialisten" gegen andere hochrangige KI-Agenten bei drei Arten von Herausforderungen:

  1. Desktop-Aufgaben aus der realen Welt (OSWorld): Sie forderten den Agenten auf, Dinge wie „eine Datei herunterladen", „ein Dokument bearbeiten" und „eine Webseite navigieren" zu tun. InfantAgent-Next schlug den berühmten „Claude Computer Use"-Agenten um 7,27 %. Es war besser darin, die Aufgabe tatsächlich ohne menschliche Hilfe zu erledigen.
  2. Programmierung und Fehlerbehebungen (SWE-Bench): Sie forderten den Agenten auf, defekten Code in realen Softwareprojekten zu reparieren. Es schnitt ebenso gut oder besser ab als viele teure, proprietäre kommerzielle Agenten.
  3. Allgemeines Wissen und Logik (GAIA): Sie stellten komplexe Fragen, die das Durchsuchen des Webs, das Lesen von Dateien und logisches Schlussfolgern erforderten. InfantAgent-Next belegte unter allen Open-Source-Agenten den zweiten Platz und bewies, dass es knifflige, mehrstufige Logik bewältigen kann.

Das Fazit

InfantAgent-Next ist nicht einfach ein einziges großes KI-Modell, das versucht, alles zu sein. Es ist ein modularer Dirigent, der genau weiß, wann er das „Auge", das „Ohr", den „Coder" oder den „Maus-Klicker" rufen muss. Indem jeder Spezialist das tut, was er am besten kann, wird das gesamte System viel intelligenter, genauer und in der Lage, die unordentlichen, realen Aufgaben zu bewältigen, die wir täglich auf unseren Computern haben.

Die Forscher haben den Code für dieses „Team von Spezialisten" für jedermann verfügbar gemacht, damit er genutzt und studiert werden kann, mit der Hoffnung, in Zukunft noch bessere Computerassistenten zu entwickeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →