← Nieuwste papers
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

Het artikel introduceert InfantAgent-Next, een sterk modulaire multimodale generalistische agent die toolgebaseerde en puur visuele capaciteiten integreert om collaboratieve, stap-voor-stap computerinteractie mogelijk te maken en state-of-the-art prestaties bereikt op diverse benchmarks, waaronder OSWorld, GAIA en SWE-Bench.

Oorspronkelijke auteurs: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar iets onhandige, persoonlijke assistent hebt met de naam InfantAgent-Next.

In de wereld van computerautomatisering zijn de meeste assistenten tegenwoordig als specialisten die maar één ding heel goed kunnen, of als generalisten die alles proberen maar vaak in de war raken.

  • Sommige assistenten zijn als Bibliothecarissen: Ze zijn uitstekend in het gebruik van een specifieke lijst met hulpmiddelen (zoals "zoek het web" of "open een bestand"), maar als je hen vraagt op een knop te klikken op een scherm dat ze nog nooit hebben gezien, bevriezen ze omdat ze geen hulpmiddel hebben voor die specifieke knop.
  • Andere assistenten zijn als Artiesten: Ze kunnen naar een scherm kijken en "zien" wat er staat, maar ze worstelen met complexe wiskunde of het schrijven van code omdat ze proberen dit alles alleen met hun ogen te doen, zonder rekenmachine of teksteditor.

InfantAgent-Next is anders. Het is alsof je een Zwitsers zakmes-team huurt in plaats van één persoon.

Hoe het werkt: Het "Brein en Handen"-team

In plaats van één enorm brein dat alles probeert te doen, breekt InfantAgent-Next elke taak op in kleine stappen en stuurt elke stap naar de expert die het beste geschikt is.

  1. De Manager (De Planner): Wanneer je vraagt: "Bewaar deze webpagina in mijn bladwijzers", leest een hoog-niveau "Manager"-model je verzoek. Het probeert niet zelf op de muis te klikken. In plaats daarvan zegt het: "Oké, we moeten de browser openen, de bladwijzerknop vinden en erop klikken."
  2. De Specialisten: De Manager roept vervolgens de juiste expert voor de klus:
    • Het Oog (Visuele Verankering): Als de taak is "klik op de rode knop", kijkt een gespecialiseerd visueel model naar het scherm, vindt de exacte pixelcoördinaten van die rode knop en vertelt het systeem waar te klikken. Het is als een scherpsichtig spotters die een blinddoekboogschutter begeleidt.
    • De Rekenmachine (Code-uitvoering): Als de taak is "analyseer dit Excel-bestand", geeft de Manager het bestand door aan een code-expert die een script schrijft om de wiskunde direct uit te voeren, in plaats van te proberen de rijen te tellen door naar het scherm te kijken.
    • Het Oor (Audio-analyse): Als je een opname uploadt en vraagt: "Welk paginanummer wordt genoemd?", luistert een gespecialiseerd audio-model naar het bestand en haalt het antwoord eruit.
  3. Het Geheugen: Het systeem houdt een gedeeld notitieboek bij. Elke keer dat een specialist een stap afrondt, schrijft hij het op. De volgende specialist pakt het notitieboek op, leest wat er is gebeurd en zet het verhaal voort. Dit zorgt ervoor dat het team de doelstelling niet uit het oog verliest.

Waarom dit belangrijk is (De "Magische" trucs)

Het artikel benadrukt twee hoofdproblemen die dit systeem oplost:

  • Het "Klikken"-probleem: Veel AI-agenten zijn slecht in het klikken op de juiste plek op een scherm. Ze klikken misschien 5 pixels te links en missen de knop. InfantAgent-Next gebruikt een "Zoom-In"-techniek. Als het op een knop moet klikken, gokt het niet zomaar. Het maakt een foto van het scherm, vindt het algemene gebied, knipt dat gebied uit om het groter te maken, vindt de knop opnieuw, knipt het opnieuw uit, en klikt dan. Het is alsof je een vergrootglas gebruikt om een naald in een hooiberg te vinden, zodat de klik precies is.
  • Het "Bewerken"-probleem: Bij het bewerken van een tekstbestand krijgt AI vaak de regellijnen verkeerd (bijvoorbeeld: "Verander regel 5" terwijl het regel 6 zou moeten zijn). InfantAgent-Next heeft een "Dubbelcheck"-systeem. Het stelt een wijziging voor, kijkt vervolgens naar de daadwerkelijke tekst om te verifiëren: "Zegt regel 5 echt wat ik denk dat het zegt?" Zo niet, dan past het zijn plan aan voordat het de bewerking uitvoert, waardoor rommelige fouten worden voorkomen.

Wat het kan doen (Het bewijs)

De onderzoekers hebben dit "Team van Specialisten" getest tegen andere top-tier AI-agenten op drie soorten uitdagingen:

  1. Real-world desktoptaken (OSWorld): Ze vroegen de agent om dingen te doen zoals "een bestand downloaden", "een document bewerken" en "een website navigeren". InfantAgent-Next versloeg de beroemde "Claude Computer Use"-agent met 7,27%. Het was beter in het daadwerkelijk de klus te klaren zonder menselijke hulp.
  2. Coderen en bugfixes (SWE-Bench): Ze vroegen de agent om kapotte code in echte softwareprojecten te repareren. Het presteerde even goed als, of beter dan, veel dure, gesloten-bron commerciële agenten.
  3. Algemene kennis en logica (GAIA): Ze stelden complexe vragen die vereisten zoeken op het web, bestanden lezen en redeneren. InfantAgent-Next eindigde als tweede onder alle open-source agenten, wat bewijst dat het lastige, meerstapslogica aankan.

De conclusie

InfantAgent-Next is niet zomaar één groot AI-model dat probeert alles te zijn. Het is een modulaire dirigent die precies weet wanneer hij het "Oog", het "Oor", de "Coder" of de "Muis-klikker" moet roepen. Door elke specialist te laten doen waar hij het beste in is, wordt het hele systeem veel slimmer, nauwkeuriger en capabeler in het afhandelen van de rommelige, real-world taken waar we elke dag op onze computers mee geconfronteerd worden.

De onderzoekers hebben de code voor dit "Team van Specialisten" beschikbaar gesteld voor iedereen om te gebruiken en te bestuderen, in de hoop om in de toekomst nog betere computerassistenten te helpen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →