Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents
Het artikel introduceert Collaborative Agent Reasoning Engineering (CARE), een systematische, fase-gestuurde methodologie die een workflow van drie partijen – vakexperts, ontwikkelaars en LLM-hulpagenten – benut om informele domeinintenties om te zetten in rigoureuze, verifieerbare specificaties voor het bouwen van betrouwbare AI-agenten in wetenschappelijke domeinen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een hoogopgeleide robotassistent probeert te bouwen om wetenschappers te helpen specifieke gegevens te vinden in een enorme bibliotheek. In het verleden probeerden mensen deze robots te leren door simpelweg met hen te praten, te raden wat ze moesten zeggen, en op het beste te hopen. Dit is als proberen een hond complexe wiskunde te leren door er willekeurige woorden tegen te schreeuwen; soms werkt het, maar meestal is het een rommel van proef en fout.
Dit artikel introduceert CARE (Collaborative Agent Reasoning Engineering), een nieuwe, gedisciplineerde manier om deze AI-assistenten te bouwen. In plaats van te raden, behandelt CARE het bouwen van een AI als het bouwen van een brug: je hebt een strikt blauwdruk nodig, een team van experts en een stap-voor-stap inspectieproces.
Hier is hoe CARE werkt, uiteengezet in eenvoudige concepten:
Het Drie-Partijen Team
CARE is niet zomaar een mens die met een computer praat. Het is een drieweggesprek tussen:
- De Vakexperts (SME's): De wetenschappers die de regels van het spel kennen (bijvoorbeeld: "We vertrouwen alleen gegevens uit 2020" of "Raad nooit het antwoord").
- De Ontwikkelaars: De ingenieurs die weten hoe ze de robot moeten bouwen.
- De "Hulpagenten": Dit zijn speciale AI-assistenten wiens enige taak het is om de mensen te helpen met elkaar te communiceren. Denk aan hen als een super-efficiënt schrijver of een vertaler. Ze luisteren naar de wetenschappers, stellen verhelderende vragen en schrijven de regels op in een duidelijk, gestructureerd formaat dat de ontwikkelaars kunnen begrijpen.
Het Probleem: De "Gekartelde Grens"
Het artikel legt uit dat AI lijkt op een gekarteld berglandschap. Soms is het ongelooflijk slim en behulpzaam; op andere momenten is het verward en verzonnen het feiten. Als je een expert bent, weet je hoe je de veilige paden moet navigeren. Als je een novice bent, kun je misschien van een afgrond afdwalen. Het doel van CARE is om de AI zo te bouwen dat het zich gedraagt als de expert, ongeacht wie het gebruikt.
Het CARE-Process: Een Vijf-Stappen Bouwplaats
In plaats van gewoon een prompt in te typen en op het beste te hopen, gebruikt CARE een "stadium-gated" proces. Dit betekent dat je niet naar de volgende stap kunt gaan totdat de huidige stap is goedgekeurd door de mensen.
- Omvang en Decompositie: Het team definieert het doel. Wat moet deze robot precies doen? De Hulpagent helpt de grenzen op te schrijven.
- Essentiële Informatie-ontsluiting: Het team verzamelt de "tools" en "context". Op welke databases kan de robot toegang krijgen? Hoe ziet een correct antwoord eruit? De Hulpagent zet deze antwoorden om in een checklist.
- Redeneringsbeleid en Veiligheidsrails: Dit is het belangrijkste onderdeel. Het team beslist hoe de robot denkt. Wanneer moet het om hulp vragen? Wanneer moet het zeggen "Ik weet het niet"? De Hulpagent schetst deze regels, en de mensen keuren ze goed.
- Prompt Architectuur: Pas nadat de regels zijn vastgesteld, schrijft het team de daadwerkelijke instructies (de "prompt") voor de AI. Omdat de regels al duidelijk zijn, is de prompt slechts een vertaling van die goedgekeurde regels, geen gok.
- Benchmarking en Verificatie: Voordat de robot aan het werk gaat, legt het een toets af. Het team maakt een reeks vragen om te zien of de robot daadwerkelijk de regels volgt die ze hebben opgeschreven.
De "Hulpagent" Analogie
Denk aan de Hulpagent als een bouwvoorman.
- De Wetenschapper (SME) zegt: "Ik heb een muur nodig die veilig en sterk is."
- De Ontwikkelaar zegt: "Oké, ik bouw het."
- Zonder een voorman zouden ze misschien ruzie maken over wat "sterk" betekent, of zou de ontwikkelaar een muur bouwen die er goed uitziet maar instort.
- Met de Hulpagent treedt deze tussenbeide en zegt: "Wetenschapper, betekent 'sterk' dat het 500 pond kan dragen? Ontwikkelaar, voldoet uw plan aan die eis van 500 pond?" Het schrijft de exacte specificaties op in een contract (het "artefact"). Als het plan later verandert, wordt het contract bijgewerkt, en weet iedereen precies wat er veranderd is.
De Realiteitstest: De NASA Case Study
Om te bewijzen dat dit werkt, bouwde het team een AI-agent voor NASA om te zoeken in een enorme catalogus van aardwetenschappelijke gegevens (het NASA Common Metadata Repository).
- De Wedstrijd: Ze bouwden twee agenten.
- Agent A (De CARE Agent): Gebouwd met het strikte 5-stappen CARE-proces met de Hulpagent.
- Agent B (De Baseline): Gebouwd op de "oude manier" (alleen met hetzelfde AI-model en dezelfde tools, maar zonder het strikte CARE-proces).
- De Resultaten:
- Bij een grote, geautomatiseerde test van 621 vragen vond de CARE-agent het juiste antwoord als eerste 71,7% van de tijd, terwijl de oude manier slechts 69,1% scoorde.
- Bij een kleinere, moeilijkere test die door echte NASA-wetenschappers was gemaakt (43 vragen), vond de CARE-agent het juiste antwoord in de top 5 resultaten 27,2% van de tijd, beter dan de 20,2% van de oude manier.
De Conclusie
Het artikel beweert dat door een gestructureerd proces te gebruiken waarbij mensen en "Hulpagenten" samenwerken om duidelijke regels op te schrijven voordat de AI wordt gebouwd, je een betrouwbaardere, veiligere en beter presterende robot krijgt. Het verandert het chaotische kunst van "prompt engineering" in een voorspelbare engineeringdiscipline.
Belangrijke Opmerking: Het artikel testte dit alleen op het vinden van wetenschappelijke gegevens. Het claimt niet dat deze methode werkt voor medische diagnose, juridisch advies of andere specifieke velden, tenzij die velden expliciet worden genoemd in toekomstig werk, wat dit artikel niet behandelt. Het succes is strikt beperkt tot het gegeven voorbeeld van NASA-gegevenszoekopdrachten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.