← Nieuwste papers
🤖 AI

TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

TraceGraph introduceert een graafgebaseerd framework dat trajecten van multi-model agenten transformeert naar gedeelde beslissingslandschappen om verborgen navigatieverschillen en faalpatronen te onthullen, wat op zijn beurt een valstrik-bewust herstelproces mogelijk maakt dat de resolutiepercentages op de SWE-bench aanzienlijk verbetert.

Oorspronkelijke auteurs: Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een groep van vijf verschillende ontdekkers kijkt die proberen een complex doolhof op te lossen. In het verleden, als je wilde weten wie de beste ontdekker was, keek je gewoon naar de eindscore: "Heeft hij de uitgang bereikt? Ja of Nee?"

Het paper TraceGraph betoogt dat deze "Ja of Nee"-score te veel verbergt. Het is alsof je een chef-kok beoordeelt op basis van of de taart is opgegeten, zonder op te merken dat de ene chef de keuken heeft afgebrand om daar te komen, terwijl een andere een schilderachtig pad door de tuin heeft genomen.

Zo werkt TraceGraph, eenvoudig uitgelegd:

1. De Gedeelde Kaart (Het Beslissingslandschap)

In plaats van het pad van elke ontdekker afzonderlijk te bekijken, neemt TraceGraph al hun stappen en voegt ze samen op één gigantische, gedeelde kaart.

  • De Stappen: Elke keer dat een AI-agent (de ontdekker) een actie onderneemt (zoals "een bestand lezen" of "een test uitvoeren") en een resultaat ziet, laat het een "voetafdruk" achter.
  • Het Clusteren: TraceGraph kijkt naar deze voetafdrukken. Als twee stappen erg op elkaar lijken (bijvoorbeeld: beide proberen een specifieke fout in hetzelfde bestand te herstellen), trekt het een lijn om ze te verbinden.
  • Het Resultaat: Dit creëert een web of een "landschap" van de taak. Sommige gebieden zijn veilig en leiden tot succes; andere zijn doodlopende wegen.

2. De Drie Kerngebeurtenissen

Zodra de kaart is gebouwd, observeert TraceGraph hoe elke AI zich over de kaart beweegt. Het geeft nog niet om de eindscore; het geeft om drie specifieke momenten:

  1. Toegang (Access): Heeft de AI de "productieve kern" gevonden? (Het veilige, waardevolle gebied waar goed werk wordt verricht).
  2. Valkuil-blootstelling (Trap Exposure): Is de AI een "valstrik" in gelopen? (Een verwarrend gebied waar veel anderen zijn gefaald of vastgelopen).
  3. Herstel (Repair): Als de AI in een valstrik is gevallen, is hij er dan in geslaagd om eruit te klimmen en terug te keren naar de productieve kern?

3. Wat de Kaart Onthulde

Toen de onderzoekers naar deze gedeelde kaart keken, ontdekten ze dingen die eenvoudige scores misten:

  • Verschillende Stijlen: Sommige modellen (zoals DeepSeek-V3.2) waren dappere ontdekkers. Ze vonden vaak de productieve kern, soms kwamen ze in vallen terecht, maar waren ze erg goed in het eruit klimmen (Herstel). Anderen (zo zoals Qwen3-Next) waren zeer voorzichtig. Ze kwamen zelden in vallen terecht, maar ze vonden de productieve kern ook zelden omdat ze te bang waren om te verkennen.
  • Verschillende Regels voor Verschillende Doolhoven: De onderzoekers testten dit op vijf verschillende soorten taken (zoals het oplossen van softwarebugs, het doorzoeken van het web of het gebruiken van tools). Ze ontdekten dat sommige doolhoven belonen met het vermijden van vallen (maak geen fout!), terwijl andere (zoals het repareren van softwarebugs) belonen met het herstellen van fouten. Een model dat goed is in het vermijden van vallen, kan in werkelijkheid falen bij een taak waarbij je juist moet kunnen herstellen van een fout.

4. Het "Valkuil-Detector" Experiment

Het meest opwindende deel is hoe ze deze kaart gebruikten om de AI in realtime te helpen.

  • Het Idee: Omdat ze precies wisten hoe een "valstrik" er op de kaart uitzag (een specifiek patroon van acties en fouten), bouwden ze een detector.
  • De Trigger: Wanneer een AI een nieuw probleem oploste en een patroon stapte dat overeenkwam met een bekende "valstrik", ging de detector af.
  • De Redding: Wanneer het alarm afging, liet het systeem de AI niet zomaar blijven falen. Het pauzeerde en probeerde twee eenvoudige oplossingen:
    1. De "Hot" Fix: Het vertelde de AI om het opnieuw te proberen met een beetje meer willekeur (zoals het schudden van de dobbelstenen) om te zien of een ander pad werkte.
    2. De "Note" Fix: Het gaf de AI een vriendelijke herinnering op basis van de fout: "Hé, je lijkt hier vast te zitten. Lees de fout opnieuw, focus op dit specifieke bestand en probeer één kleine wijziging."

Het Resultaat: Op een taak voor softwareherstel (SWE-bench) hielp het gebruik van deze valstrik-detector de AI om ongeveer 3 tot 4% meer problemen op te lossen dan hij uit zichzelf zou kunnen. Het bewees dat weten waar de vallen liggen, je in staat stelt om een vangnet te bouwen dat de AI opvangt voordat hij faalt.

Samenvatting

TraceGraph is een hulpmiddel dat ons stopt met alleen naar de eindscore van een AI te kijken. In plaats daarvan bouwt het een gedeelde kaart van hoe AI-agenten door taken bewegen. Het laat ons zien:

  • Welke modellen dappere ontdekkers zijn versus voorzichtige wandelaars.
  • Welke taken vereisen dat je fouten vermijdt versus het herstellen van fouten.
  • Hoe je een simpel "vangnet" kunt boueren dat detecteert wanneer een AI op het punt staat in een bekende valstrik te vallen en het hem een tweede kans geeft om het te herstellen.

Het verandert de zwarte doos van "AI faalde" in een helder verhaal: "De AI liep in een valstrik, maar met een beetje hulp had hij eruit kunnen klimmen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →