← Nieuwste papers
🤖 AI

TOM-SWE: User Mental Modeling For Software Engineering Agents

Het artikel introduceert ToM-SWE, een dual-agent architectuur die een software engineering agent koppelt aan een theory-of-mind partner om gebruikersintentie te modelleren en persistent geheugen te behouden, wat de succespercentages van taken en de gebruikerstevredenheid aanzienlijk verbetert in zowel benchmarkevaluaties als een real-world studie met professionele ontwikkelaars.

Oorspronkelijke auteurs: Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

Gepubliceerd 2026-02-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Vergeetachtige" Codeerrobot

Stel je voor dat je een briljante maar amnesische robot-assistent inhuurt om je te helpen een website te bouwen.

  • De Robot: Hij is ongelooflijk slim in het schrijven van code, het oplossen van bugs en het draaien van tests.
  • Het Probleem: Elke keer als je een nieuw gesprek begint, heeft de robot geen geheugen van wie je bent. Hij weet niet dat je een hekel hebt aan lange uitleg, dat je liever specifieke tools gebruikt, of dat je altijd je code wilt testen voordat je deze implementeert.
  • Het Resultaat: Je moet jezelf constant herhalen. "Maak het korter," "Gebruik deze bibliotheek," "Stel me niet zo veel vragen." De robot blijft gissen, en het gaat vaak mis, wat tijd verspilt en frustrerend is.

Huidige AI-coding agents zijn als deze robot: ze zijn geweldig in het technische werk, maar slecht in het begrijpen van jou.

De Oplossing: De "Gedachtenlezende" Partner (ToM-SWE)

De auteurs van dit paper hebben een nieuw systeem ontwikkeld genaamd ToM-SWE. In plaats van slechts één robot, hebben ze een tweepersoons-team gebouwd:

  1. De Bouwer (SWE Agent): Dit is de oorspronkelijke codeerrobot. Hij focust voor 100% op het schrijven van code, het draaien van tests en het oplossen van fouten. Hij maakt zich geen zorgen over jouw persoonlijkheid; hij doet gewoon het zware werk.
  2. De Gedachtenlezer (ToM Agent): Dit is een nieuwe, lichtgewicht partner. Zijn enige taak is om jou te bestuderen. Hij observeert hoe je praat, wat je leuk vindt en wat je in het verleden hebt gedaan. Hij bouwt een "mentaal model" van jouw voorkeuren.

Hoe ze samenwerken:
Voordat de Bouwer begint met coderen, vraagt hij aan de Gedachtenlezer: "Hé, waar houdt deze gebruiker van? Willen ze korte antwoorden? Gebruiken ze Python of JavaScript? Hebben ze vorige week nog een specifieke tool genoemd?"
De Gedachtenlezer controleert zijn aantekeningen en zegt: "Deze gebruiker is een professor die van beknopte antwoorden houdt en de voorkeur geeft aan Vercel voor hosting. Stel hem niet te veel vragen."
De Bouwer past vervolgens zijn plan aan en schrijft code die perfect bij jouw stijl past.

De "Mentaal Model" Analogie

Zie de Gedachtenlezer als een zeer attente persoonlijke assistent die een dagboek bijhoudt van jouw gewoonten.

  • Sessie 1: Je vertelt het systeem: "Maak een website voor mij." De Gedachtenlezer noteert: Gebruiker is een professor, houdt van academische stijlen, geeft de voorkeur aan Vercel.
  • Sessie 2 (Volgende week): Je zegt opnieuw: "Maak een website voor mij."
    • Oude Robot: "Oké, ik ga een generieke website maken."
    • ToM-SWE: De Bouwer vraagt het aan de Gedachtenlezer. De Gedachtenlezer zegt: "Weet je nog vorige keer? Dit is voor een universitair project. Gebruik academische lettertypen en host op Vercel."
    • Resultaat: De code is precies wat je wilde, zelfs hoewel je het niet opnieuw hebt gezegd.

Hoe ze het hebben getest

De onderzoekers hebben niet alleen gegokt dat dit zou werken; ze hebben twee soorten tests uitgevoerd:

  1. De "Simulatie" Test (Benchmarks):
    Ze creëerden een fictieve wereld waarin de AI moest praten met een "gesimuleerde gebruiker" (een andere AI die een mens nabootst). Ze gaven de gesimuleerde gebruiker verschillende persoonlijkheden (bijv. een die erg praatziek is, en een die zeer kortaf is).

    • Het Resultaat: Het ToM-SWE-team loste 59,7% van de taken succesvol op. De beste vorige robot (OpenHands) loste slechts 18,1% op.
    • De "Tevredenheidsscore": De gesimuleerde gebruikers beoordelden het ToM-SWE-team veel hoger (3,62 van de 5) omdat het team beter "luisterde" en hen niet irriteerde met onnodige vragen.
  2. De "Echte Leven" Test (Menselijke Studie):
    Ze lieten 17 echte professionele ontwikkelaars het systeem gebruiken gedurende drie weken tijdens hun daadwerkelijke, dagelijkse werk.

    • Het Resultaat: De ontwikkelaars vonden de suggesties van de Gedachtenlezer in 86% van de gevallen nuttig.
    • Wat ze waardeerden: Het systeem zei dingen als: "Je voegt meestal tests toe voor nieuwe functies, dus ik heb ze hier ook toegevoegd," of "Je geeft de voorkeur aan minimale code-aanpassingen, dus ik heb de wijzigingen klein gehouden."

Waarom dit ertoe doet

Het paper beweert dat voor AI om echt nuttig te zijn in software engineering, het niet alleen een code-generator kan zijn. Het moet een collaborateur zijn die de menselijke intentie begrijpt.

  • Oude manier: Je vertelt de AI wat hij moet doen, en hij raadt de rest.
  • Nieuwe manier (ToM-SWE): De AI onthoudt wie je bent, wat je leuk vindt en hoe je werkt, zodat hij je behoeften kan anticiperen voordat je er zelfs maar om vraagt.

Samenvatting in één zin

ToM-SWE is een tweeproces-systeem waarbij één agent de code schrijft en een tweede "gedachtenlezende" agent jouw persoonlijke voorkeuren en gewoonten onthoudt, waardoor het team veel efficiënter en met minder frustratie met jou kan samenwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →