← Nieuwste papers
🤖 machine learning

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Dit artikel introduceert de Insights Generator (IG), een multi-agent systeem dat de diagnose van LLM-agentfouten automatiseert door systematisch grote corpora van uitvoeringstraces te analyseren om door bewijs onderbouwde natuurlijke taalinzichten te produceren, waarvan is aangetoond dat ze de agentprestaties aanzienlijk verbeteren en handmatige diagnostische methoden overtreffen in diepgang en dekking.

Oorspronkelijke auteurs: Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veronica Chatrath (Emily), Vijay S. Kalmath (Emily), Levi Lentz (Emily), Yuan (Emily
Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veronica Chatrath (Emily), Vijay S. Kalmath (Emily), Levi Lentz (Emily), Yuan (Emily), Xue

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een team zeer slimme, maar soms verwarde, robotassistenten. Deze robots proberen complexe puzzels op te lossen, zoals het organiseren van spreadsheets of het beantwoorden van moeilijke wetenschappelijke vragen. Soms krijgen ze het antwoord goed; andere keren falen ze.

Het Probleem: De "Naald in een Hooiberg" Debugging
Op dit moment proberen menselijke managers, wanneer een robot faalt, uit te zoeken waarom door te kijken naar een paar specifieke voorbeelden van het werk van de robot. Het is alsof je probeert te begrijpen waarom een auto-motor een vreemd geluid maakt door naar slechts één auto te luisteren die voorbijrijdt. Je hoort misschien een sputteren, maar je mist het patroon dat alle auto's sputteren wanneer ze op een regenachtige dag linksaf slaan.

Omdat de robots enorme hoeveelheden data produceren (duizenden pagina's "gedachten" en acties voor elke enkele taak), kunnen mensen het niet allemaal lezen. Ze eindigen met gokken op basis van een miniem steekproef. Dit betekent dat ze de "stille mislukkingen" missen – fouten waarbij de robot de taak afrondt zonder te crashen, maar het op de verkeerde manier doet.

De Oplossing: De "Insights Generator" (IG)
De auteurs hebben een nieuw systeem gebouwd dat de Insights Generator (IG) heet. Denk aan de IG niet als een enkele detective, maar als een gespecialiseerd detectivebureau met een specifieke workflow om het "naald in een hooiberg"-probleem op te lossen.

Hier is hoe het bureau werkt, met behulp van een eenvoudige analogie:

  1. De Orchestrator (De Bureau Manager): Dit is de baas. Hij doet het graven zelf niet. In plaats daarvan kijkt hij naar het grote geheel en beslist wat voor soort onderzoek nodig is.
  2. De Verkenners (De Explorers): Deze agenten worden eropuit gestuurd om te kijken naar een kleine, willekeurige steekproef van het werk van de robot. Hun taak is breed en nieuwsgierig te zijn. Ze zoeken naar vreemde patronen en komen met theorieën.
    • Voorbeeldtheorie: "Hé, ik heb gemerkt dat in 80% van de gevallen dat de robot faalt in wiskunde, hij het formule verkeerd schrijft maar niet crasht. Het is een 'stille mislukking'."
  3. De Onderzoekers (De Forensische Auditors): Zodra een Verkener een theorie heeft, nemen de Onderzoekers het over. Ze kijken niet alleen naar een paar voorbeelden; ze gaan door de hele enorme database van robotwerk (het "corpus"). Ze gebruiken krachtige tools om te tellen, te vergelijken en te bewijzen of de theorie waar is voor de hele groep, niet alleen voor de weinigen die ze zagen.
    • Het Resultaat: In plaats van een gok, produceren ze een rapport waarin staat: "We hebben 1.000 mislukte pogingen gecontroleerd. 84% daarvan had deze specifieke stille wiskundefout. Hier zijn de exacte pagina's waar het gebeurde."

Waarom is dit anders?
De meeste andere systemen proberen één robot tegelijk te repareren of classificeren fouten in een vooraf gemaakte lijst (zoals "Tool Error" of "Logic Error"). De IG is anders omdat hij nieuwe patronen ontdekt waarvan niemand wist dat ze bestonden. Hij scheidt het "gokken" (Verkenners) van het "bewijzen" (Onderzoekers) zodat hij niet overweldigd raakt door de pure omvang van de data.

Wat gebeurde er toen ze het testten?
De onderzoekers testten dit systeem op twee manieren:

  1. De "Rechter" Test: Ze lieten een super-slimme AI-rechter rapporten vergelijken die door de IG waren gemaakt met rapporten van andere systemen. De rapporten van de IG werden hoger beoordeeld omdat ze betere bewijzen en diepere verklaringen hadden. Het was alsof je een rapport vergelijkt dat zegt "De auto is kapot" (andere systemen) versus een rapport dat zegt "De auto crasht specifiek bij het linksaf slaan in de regen vanwege een losse draad, en hier is het videobewijs" (IG).
  2. De "Menselijke Reparateur" Test: Dit was het belangrijkste deel. Ze gaven echte menselijke ingenieurs (experts die deze robots bouwen) de rapporten van de IG en van andere systemen. De ingenieurs probeerden vervolgens de robots te repareren.
    • Het Resultaat: Ingenieurs die de IG-rapporten gebruikten, repareerden de robots 30% beter dan ingenieurs die het op één na beste systeem gebruikten. De IG-rapporten gaven hen de exacte "waar" en "waarom" die ze nodig hadden om de juiste wijzigingen aan te brengen, in plaats van slechts een vaag hint.

De Conclusie
Het artikel beweert dat door deze aanpak van het "Verkener en Onderzoeker" team te gebruiken, we eindelijk de verborgen patronen kunnen zien in hoe AI-agenten falen. Dit stelt menselijke experts in staat de onderliggende problemen veel effectiever op te lossen, waardoor een chaotische stapel foutenlogs wordt omgezet in een duidelijk, bewijsonderbouwd routekaart voor verbetering.

Wat het artikel niet beweert:

  • Het zegt niet dat dit systeem de robots automatisch repareert zonder menselijke hulp (hoewel ze een geautomatiseerde "patcher"-lus testten, lag het hoofdsucces bij menselijke experts).
  • Het beweert niet dat dit werkt voor elk type AI-probleem ter wereld, alleen voor het analyseren van de "sporen" (logs) van AI-agenten.
  • Het belooft niet om alle fouten te elimineren, maar wel om het proces van het vinden en repareren ervan veel efficiënter en accurater te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →