← Nieuwste papers
🤖 AI

Just A Rather Very Intelligent Spoken Agent

Dit artikel introduceert JarvisBench, een nieuwe benchmark en modulair prototype dat is ontworpen om de effectiviteit van altijd aanstaande, gesproken bemiddelaars te evalueren bij het verbeteren van langdurige AI-agent-workflows door middel van realtime gebruikersinteractie, taaktransparantie en algehele prestaties via spoor-gegronde responsen en proactieve begeleiding.

Oorspronkelijke auteurs: Chen Chen, Zhehuai Chen

Gepubliceerd 2026-07-21
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chen Chen, Zhehuai Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De ontbrekende tussenpersoon in het tijdperk van AI

Stel je voor dat je een briljante, razendsnelle stagiair hebt ingehuurd om een complexe boomhut voor je te bouwen. Je geeft ze de blauwdrukken en zegt: "Ga je gang!" Dan loop je weg. Urenlang hoor je niets anders dan het incidentele boem van een hamer of het gezaag van hout. Je hebt geen idee of ze de boomhut wel correct bouwen, of ze een rotte tak zijn tegengekomen, of dat ze besloten hebben om een glijbaan in plaats van een ladder te bouwen. Je kunt niet zomaar even komen kijken zonder hun flow te onderbreken, en als je wacht tot ze klaar zijn met vragen stellen, ontdek je misschien te laat dat het hele ding gevaarlijk scheef staat. Dit is de huidige staat van veel geavanceerde AI-agenten: het zijn ongelooflijk capabele "werkers" die in lange, stille uitbarstingen opereren, waardoor hun menselijke bazen in het duister worden gelaten.

Dit artikel bevindt zich in de wereld van Kunstmatige Intelligentie (AI), met een specifieke focus op AI-agenten. Denk bij een AI-agent niet aan een chatbot die één vraag beantwoordt, maar aan een digitale werknemer die kan plannen, hulpmiddelen kan gebruiken (zoals webbrowsers of code-editors) en meerstaps-problemen kan oplossen over een langere periode. Het kernconcept hier is de "long-horizon" taak: een baan die tijd kost, veel stappen vereist en op subtiele manieren fout kan gaan. Het artikel betoogt dat hoewel onze AI-werkers slimmer worden, de manier waarop we met hen communiceren vastzit in het verleden. We hebben een nieuw soort interface nodig—niet alleen een manier om opdrachten te geven, maar een manier om verbonden te blijven, vragen te stellen en de werker in realtime te begeleiden zonder de show te onderbreken.

Maak kennis met Jarvis: De altijd-aan fluisteraar

De auteurs van dit artikel, Chen en Chen van NVIDIA, stellen een oplossing voor voor dit "buiten de lus"-probleem. Ze introduceren een concept genaamd JarvisBench, wat in essentie een testomgeving is voor een nieuw type AI-helper. Denk bij deze helper aan een "bemiddelaar" of een "tussenpersoon" die tussen jou (de gebruiker) en je hardwerkende AI-agent zit.

In de film Iron Man is het personage J.A.R.V.I.S. het perfecte voorbeeld van wat de auteurs willen bouwen. Hij wacht niet alleen tot Tony Stark een vraag stelt; hij luistert, kijdt naar wat Tony doet, beantwoordt vragen onmiddellijk en spreekt zelfs door als Tony op het punt staat een fout te maken. Het artikel suggereert dat huidige AI-agenten deze "Jarvis"-laag missen. Meestal geef je een instructie, werkt de AI in stilte, en krijg je alleen een tekstuele update als er iets misgaat. De auteurs vinden dat dit een te dunne verbinding is. Ze willen een agent die "altijd-aan" is, in staat is tot gesproken interactie, klaar is om uit te leggen wat er gebeurt, en in staat is om om een snelle duw van de mens te vragen als hij vastloopt.

Om te bewijzen dat dit idee werkt, heeft het team een prototype-systeem en een reeks regels gebouwd om het te testen, die ze JarvisBench noemen. Ze hebben niet zomaar één specifieke robot gebouwd; ze hebben een flexibel framework gecreëerd waarin verschillende "hersenen" (AI-modellen) en verschillende "werkers" kunnen worden ingeplugd om te zien hoe goed ze samenwerken.

De tweesporen-test: Helpt het het werk? Helpt het de mens?

De onderzoekers hebben een tweeledige uitdaging opgezet om te zien of hun "Jarvis"-idee daadwerkelijk een verschil maakt.

Spoor 1: De beste vriend van de werker (Agent-Collaboratie)
In dit spoor is het doel om te zien of het hebben van een Jarvis-bemiddelaar de AI-werker helpt om zijn taak daadwerkelijk beter te voltooien. Stel je voor dat de AI-werker probeert een complexe puzzel op te lossen of een stuk code te schrijven. Zonder Jarvis kan de werker vast komen te zitten in een lus van fouten of een verkeerde afslag nemen zonder het te beseffen tot het te laat is. Met Jarvis houdt de bemiddelaar elke beweging van de werker in de gaten. Als de werker twee keer dezelfde fout maakt of verward lijkt, pauzeert Jarvis de actie (of simuleert een pauze) en vraat een menselijke expert om een snelle tip. Die tip wordt vervolgens teruggegeven aan de werker.

De resultaten van hun tests waren veelbelovend. Ze voerden 34 verschillende langetermijn-taken uit (zoals het zoeken naar informatie, het organiseren van bestanden of het schrijven van code) met verschillende AI-werkers. Wanneer ze de Jarvis-bemiddelaar toevoegden, werden de werkers beter in het voltooien van hun taken. Bijvoorbeeld, een werker die de "Claude Opus 4.7" hersenen gebruikt, verbeterde zijn successcore van 64,01% naar 75,79%. De bemiddelaar deed het werk niet zelf; het fungeerde slechts als een brug, door knelpunten te signaleren en net genoeg menselijke begeleiding te brengen om de werker weer op het juiste pad te krijgen. Het artikel suggereert dat deze "tussenlaag" cruciaal is om AI-agenten te helpen herstellen van fouten zonder dat ze volledig opnieuw gebouwd hoeven te worden.

Spoor 2: De beste vriend van de mens (User-Interactie)
Het tweede spoor stelt een andere vraag: Maakt deze bemiddelaar de ervaring beter voor de mens? Stel je voor dat jij de baas bent en je wilt weten: "Wat ben je nu aan het doen?" of "Waarom heb je dat bestand gekozen?". Op de oude manier zou je door logs moeten graven of moeten wachten op een rapport. Met Jarvis kun je gewoon vragen: "Hé, wat is er aan de hand?" en direct een gesproken antwoord krijgen.

De onderzoekers testten dit door een gesimuleerde "niet-expert" gebruiker vragen te laten stellen terwijl de AI aan het werk was. Ze maten hoe goed de bemiddelaar de voortgang van de werker kon uitleggen op basis van wat hij zag, en hoe goed hij vragen over de context van de taak kon beantwoorden. Ze ontdekten dat het "brein" achter de bemiddelaar er veel toe doet. Een zeer intelligent brein (zoals GPT-5.4) was uitstekend in het beantwoorden van contextvragen en haalde een hoge score van 3,91 van de 5. Echter, zelfs kleinere, snellere breinen waren goed in het uitleggen van wat de werker op dat moment aan het doen was. De belangrijkste les hier is dat een goede bemiddelaar je op de hoogte kan houden en betrokken kan houden zonder dat je een tech-expert hoeft te zijn of naar een scherm vol code hoeft te staren.

Wat dit betekent (en wat het niet betekent)

Het artikel is voorzichtig in de opmerking dat dit voorlopige resultaten zijn op basis van simulaties en specifieke tests. Ze beweren niet dat ze alle AI-problemen hebben opgelost of een perfecte robot-Butler hebben gebouwd. Ze sluiten expliciet de mogelijkheid uit dat de bemiddelaar het werk moet overnemen of de taak zelf moet oplossen. De taak van de bemiddelaar is strikt het observeren, luisteren en begeleiden.

Ze ontdekten ook dat de kwaliteit van het "brein" van de bemiddelaar cruciaal is. Als het brein niet slim genoeg is, kan het de werker onnodig onderbreken of slecht advies geven. Maar wanneer het brein sterk is, creëert de combinatie van een slimme werker en een slimme bemiddelaar een team dat transparanter, behulpzamer en succesvoller is.

Kortom, dit artikel suggereert dat de toekomst van AI niet alleen draait om het slimmer maken van de werkers, maar om het bouwen van een betere conversatie tussen mens en machine. Door een "Jarvis"-laag toe te voegen, kunnen we eindelijk AI-agenten krijgen die niet alleen voor ons werken, maar mét ons werken, waarbij ze ons in de loop houden en klaar staan om te helpen wanneer de zaken ingewikkeld worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →