← Nieuwste papers
💬 NLP

A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback

Dit artikel introduceert een tweestaps, multi-agent LLM-framework dat interpreteerbare kwaliteitscriteria voor chirurgische feedback ontdekt om live interacties in de operatiekamer automatisch te scoren, waarbij een superieure prestatie wordt aangetoond ten opzichte van eerdere methoden bij het voorspellen van de effectiviteit van feedback en gedragsaanpassingen van de trainee.

Oorspronkelijke auteurs: Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter Wager, Anima Anandkumar, Andrew J. Hung

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter Wager, Anima Anandkumar, Andrew J. Hung

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een chirurgische operatiezaal voor als een hoog-risico orkest. De chirurg in opleiding is de eerste violist en de leidende chirurg (de leraar) is de dirigent. Om de muziek perfect te laten klinken, moet de dirigent feedback geven. Maar hier zit het probleem: soms is de feedback van de dirigent een zacht gefluister, soms een scherpe schreeuw en soms is het gewoon een verwarrend gemompel.

Jarenlang hebben onderzoekers geprobeerd deze muzikale aanwijzingen te beoordelen door te luisteren naar wat de dirigent zegt (bijvoorbeeld "corrigeer de noot" versus "speel harder"). Maar dit nieuwe artikel stelt dat hoe de feedback wordt gegeven, net zo belangrijk is als de woorden zelf. Klonk de leraar dringend? Was de instructie duidelijk? Klonken ze bemoedigend?

De auteurs, een team van Caltech en Cedars-Sinai, bouwden een "slimme robotluisteraar" (een framework voor Large Language Models) om dit op te lossen. Hier is hoe ze dat deden, opgesplitst in eenvoudige stappen:

1. Het "Brainstormfeest" (Ontdekking)

In plaats van te raden wat goede feedback is, vroegen de onderzoekers een team van AI-agenten (denk aan vijf verschillende expert-muziekcritici) om duizenden echte chirurgische gesprekken te beluisteren.

  • De Opzet: Ze gaven deze AI-agenten een lijst met wat "goed" eruit ziet (zoals "de student heeft zijn fout gecorrigeerd") en vroegen hen om uit te zoeken waarom sommige feedback werkte en sommige niet.
  • Het Resultaat: De AI-agenten kwamen met een lange, rommelige lijst van ideeën. De onderzoekers hielden vervolgens een "consolidatievergadering" waarbij ze vergelijkbare ideeën groepeerden en deze terugbrachten tot zes gouden regels voor goede feedback:
    1. Bemoedigend: Verhoogt het het vertrouwen? (bijvoorbeeld "Groot werk!")
    2. Dringend: Schreeuwt het "Stop direct!"? (bijvoorbeeld "Niet coaguleren!")
    3. Hanteerbaar: Is het een specifieke stap? (bijvoorbeeld "Verplaats de naald 2 cm naar links.")
    4. Tijdig: Was het gezegd terwijl de actie plaatsvond, of uren later?
    5. Duidelijk: Is het makkelijk te begrijpen, of verwarrend?
    6. Reflecterend: Laat het de student nadenken? (bijvoorbeeld "Waarom heb je dat gekozen?")

2. De "Robotrechter" (Scoren)

Zodra ze deze zes regels hadden, maakten ze van de AI een rechter. Ze voerden 4.200 echte stukjes chirurgische feedback in en vroegen de AI om elk stukje te scoren van 1 tot 5 op alle zes de regels.

  • De Analogie: Stel je een leraar voor die een essay van een student corrigeert. In plaats van alleen een cijfer te geven, geeft deze robot een gedetailleerd rapport: "Je urgentie was een 5/5, maar je duidelijkheid was slechts een 2/5."

3. Het Bewijs (Werkt het?)

Het team testte of deze robotscores daadwerkelijk voorspelden wat er daarna in de operatiezaal gebeurde.

  • De Test: Ze keken of de student zijn gedrag veranderde (zoals een instrument correct verplaatsen) of simpelweg "Oké" zei om de leraar te bevestigen.
  • Het Resultaat: De zes regels van de AI waren beter in het voorspellen van reacties van studenten dan eerdere methoden die alleen keken naar het onderwerp van het gesprek.
    • Voorbeeld: Ze ontdekten dat "Dringende" en "Hanteerbare" feedback studenten sneller deden bewegen. Maar "Reflecterende" en "Duidelijke" feedback liet studenten meer terugpraten.
    • Verrassing: "Bemoedigende" feedback maakte studenten juist minder geneigd om hun gedrag te veranderen of zich te melden. Het artikel suggereert dat dit komt omdat bemoediging vaak wordt gebruikt wanneer de student het al goed doet, dus is er geen verandering nodig!

4. De Menselijke Check (Betrouwbaarheid)

Om zeker te weten dat de robot niet gewoon hallucineerde, vroegen ze echte menselijke chirurgen om dezelfde feedback te beoordelen met de zes regels van de AI.

  • De Overeenkomst: De mensen en de AI waren het vrij goed met elkaar eens (ongeveer 60-70% overeenstemming). Dit bewijst dat de regels duidelijk genoeg zijn om zowel door mensen als machines te worden begrepen.

Waarom Dit Belangrijk Is (Volgens Het Artikel)

Dit framework is als het geven van een "kwaliteitscontrole-dashboard" aan elke chirurgische leraar.

  • Het vertelt je niet alleen wat er werd onderwezen; het vertelt je ook hoe goed het werd onderwezen.
  • Het kan automatisch duizenden uren chirurgie beoordelen zonder dat er een mens dagenlang hoeft te zitten en aantekeningen te maken.
  • Het helpt identificeren of een leraar te vaag, te laat of te verwarrend is, wat kan helpen bij het verbeteren van de opleiding van chirurgen.

Kortom: Het artikel bouwde een AI-systeem dat leerde chirurgische leraren te beoordelen, niet op hun woordenschat, maar op hun leveringsstijl. Het ontdekte dat duidelijk, dringend en hanteerbaar zijn de geheime saus is om studenten echt hun fouten in real-time te laten corrigeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →