Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
Dit artikel toont aan dat tekstgebaseerde coding agents uitgerust met gesandboxed tools effectief complexe audio-video taken kunnen oplossen door multimodale problemen om te zetten in informatieverwerkingsworkflows, waarbij ze vaak native omnimodale modellen overtreffen, terwijl ze ook de Code-X trainingsreceptuur en de TerminalBench-O benchmark introduceren om open-source verwerking van vele modaliteiten te bevorderen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De "Slimme Stagiair" versus de "Supergenie"
Stel je voor dat je een enorme, complexe puzzel hebt gemaakt van videoclips, audio-opnames en documenten. Je moet deze oplossen.
Lama lang nam de techwereld aan dat je een "Supergenie" (een native omnimodale AI) nodig had om dit op te lossen. Dit Supergenie is een model dat de hele video- en audiofile in zijn geheel heeft "opgegeten", in een poging om elke enkele frame en geluidsgolf tegelijkertijd in zijn brein te begrijpen.
Dit artikel betoogt dat je hiervoor eigenlijk geen Supergenie nodig hebt. In plaats daarvan kun je een "Slimme Stagiair" (een coderingsagent) gebruiken.
De Slimme Stagiair probeert niet de hele video door te slikken. In plaats daarvan heeft hij een gereedschapskist. Hij bekijkt het bestand, pakt een specifiek hulpmiddel (zoals een video-editor of een spraak-naar-tekst-machine), extraheert precies dat kleine stukje informatie dat hij nodig heeft (zoals een transcript of een specifieke frame) en lost vervolgens de puzzel op met dat kleine stukje bewijs.
De hoofdbetoging van het artikel: De Slimme Stagiair, met behulp van tools, is eigenlijk sneller, goedkoper en vaak beter in het oplossen van deze puzzels dan het Supergenie dat probeert alles tegelijk te onthouden.
Hoe de "Slimme Stagiair" werkt
Zie de Slimme Stagiair als een detective in een bibliotheek.
- De Oude Manier (Native Modellen): Het Supergenie loopt de bibliotheek binnen en probeert elk boek te lezen, elke audiotape te beluisteren en elke film in de schappen tegelijkertijd te bekijken. Het raakt overweldigd, verbruikt veel energie (tokens) en mist soms details omdat het probeert te veel tegelijk te verwerken.
- De Nieuwe Manier (Sandboxed Agents): De Slimme Stagiair loopt de bibliotheek binnen, maar neemt alleen de specifieke boeken of tapes mee die hij nodig heeft.
- Als hij wil weten wat iemand heeft gezegd, gebruikt hij een Spraak-naar-Tekst-tool om de audio om te zetten in een geschreven transcript.
- Als hij wil weten wat er in een video gebeurt, gebruikt hij een Frame-Extractie-tool om een paar belangrijke plaatjes eruit te halen.
- Vervolgens leest hij dat transcript of bekijkt hij die plaatjes om de vraag te beantwoorden.
Het Resultaat: De Slimme Stagiair verbruikt veel minder energie (minder "tokens") omdat hij niet de hele bibliotheek in zijn hoofd draagt. Hij draagt alleen het specifieke bewijs dat hij nodig heeft.
Het Bewijs: Wie wint de race?
De onderzoekers hebben dit getest op vier verschillende "puzzelwedstrijden" (benchmarks) met betrekking tot video en audio.
- De Resultaten: De Slimme Stagiairs (met modellen zoals GPT-5.4 en Claude Opus) versloegen de beste Supergenie-modellen (zoals Gemini 3.1 Pro) in verschillende categorieën.
- De Analogie: Het is als een race tussen een persoon die probeert een hele encyclopedie te onthouden om een trivia-vraag te beantwoorden, versus een persoon die precies weet welk paginanummer hij in een bibliotheekindex moet opzoeken. De persoon met de index wint, omdat die efficiënt en nauwkeurig is.
Waarom zij winnen? (Het "Tool"-voordeel)
Het artikel stelt vast dat de Slimme Stagiairs winnen omdat ze de video/audio behandelen als grondstoffen om te verwerken, en niet als herinneringen om op te slaan.
- Selectieve Extractie: In plaats van een voetbalwedstrijd van 90 minuten te kijken om één doelpunt te vinden, gebruikt de Stagiair een tool om de video te scannen op "doelpunten"-gebeurtenissen en kijkt alleen naar die 30 seconden.
- Foutcorrectie: Als een tool faalt (bijv. de spraak-naar-tekst-machine raakt in de war door ruis), kan de Stagiair een andere tool proberen of een klein script schrijven om het te herstellen. Een Supergenie blijft vaak simpelweg hangen in de ruis.
Wat gaat er mis? (De Foutentaxonomie)
Zelfs de Slimme Stagiairs maken fouten. De onderzoekers hebben een "foutmenu" opgesteld om uit te leggen waarom:
- Slecht Gehoor: De spraak-naar-tekst-tool heeft de audio verkeerd verstaan.
- Slechte Ogen: De tool koos de verkeerde videoframe.
- Te Snel Opgeven: De agent stopte met zoeken naar aanwijzingen voordat het antwoord gevonden was.
- Verkeerde Feiten: Het vond de juiste video, maar zocht de verkeerde informatie op in een database.
- Slechte Rekensom: Het had de juiste feiten, maar voerde de berekening verkeerd uit.
- Defecte Tools: De computer had niet de juiste software geïnstalleerd om de tool uit te voeren.
Kunnen we de Stagiair beter leren? (Skill Injection)
De onderzoekers vroegen zich af: "Kunnen we de Stagiair nog slimmer maken zonder zijn brein te herbouwen?"
Ze probeerden drie methoden:
- Menselijke Coaching: De Stagiair een handleiding geven die door experts is geschreven.
- Zelfoefenen: De Stagiair laten proberen, falen en zijn eigen regels aanpassen op basis van een simpele "Goed/Fout"-controle.
- Leren van Logs: Een tweede AI de werklogs van de Stagiair laten bekijken, patronen vinden in wat wel en niet werkte, en een nieuwe "Best Practices"-gids voor de Stagiair schrijven.
De Winnaar: De Log-gedreven Zelf-distillatie (Leren van Logs) werkte het best. Het was alsof een coach de wedstrijdbeelden van de Stagiair bekeek en zei: "Je vergeet altijd de tijdstempel te controleren voordat je de tijd raadt." Dit verbeterde de nauwkeurigheid van de Stagiair aanzienlijk.
De Toekomst: Van "Begrijpen" naar "Doen"
Het artikel stelt dat we bewegen van een tijdperk waarin AI media alleen begrijpt (vragen beantwoorden over een video) naar een tijdperk waarin AI media verwerkt (de video bewerken, de audio knippen, een nieuw bestand maken).
Ze introduceerden een nieuwe test genaamd TerminalBench-O om dit te meten.
- De Taak: In plaats van alleen te vragen "Wie zit er in deze video?", moet de AI een hoogtepunt-video maken, een bijschrift schrijven en het bestand opslaan.
- De Uitdaging: Dit is veel moeilijker. Zelfs de beste AI slaagde slechts voor ongeveer 24% van deze taken. Het vereist lange planning en betrouwbaar gebruik van tools, wat de volgende grens is voor deze "Slimme Stagiairs".
Samenvatting
Je hebt geen gigantisch, duur brein nodig dat elke video en elk geluid onthoudt om complexe problemen op te lossen. Je hebt een slimme, efficiënte agent nodig die weet hoe hij tools moet gebruiken om de specifieke bewijslast te extraheren die hij nodig heeft. Deze aanpak is goedkoper, sneller en vaak nauwkeuriger dan proberen alles tegelijk te "begrijpen".
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.