← Nieuwste papers
💻 computer science

Learning Selective LLM Autonomy from Copilot Feedback in Enterprise Customer Support Workflows

Dit artikel presenteert een ingezet systeem dat copilot-feedback en UI-interactiesporen benut om een selectief LLM-agent te trainen voor het automatiseren van enterprise-klantensupportworkflows, waarbij een automatiseringspercentage van 45% en een reductie van de afhandeltijd met 39% wordt bereikt terwijl de kwaliteit wordt behouden door middel van een op vertrouwen gebaseerd afstotingsmechanisme.

Oorspronkelijke auteurs: Nikita Borovkov, Elisei Rykov, Olga Tsymboi, Sergei Filimonov, Nikita Surnachev, Dmitry Bitman, Anatolii Potapov

Gepubliceerd 2026-04-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nikita Borovkov, Elisei Rykov, Olga Tsymboi, Sergei Filimonov, Nikita Surnachev, Dmitry Bitman, Anatolii Potapov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een drukke klantenserviceafdeling voor als een enorme, complexe controlekamer. Binnenin zijn menselijke operators voortdurend bezig met computers te hanteren, knoppen te drukken, formulieren in te vullen en berichten te typen om klantenproblemen op te lossen. Het is een baan met hoge inzet, waarbij één verkeerde klik een hoofdpijn voor een klant kan veroorzaken.

Dit artikel beschrijft een nieuw systeem voor een "slimme assistent" dat is gebouwd voor deze controlekamer. In plaats van de mensen volledig te vervangen, fungeert het systeem als een super-attent copiloot die leert hoe het de auto moet besturen, maar pas het stuur overneemt wanneer het 100% zeker weet dat er geen crash zal plaatsvinden.

Hier is hoe het werkt, opgesplitst in eenvoudige stappen:

1. De "Schaduw"-fase (Leren door te kijken)

Eerst doet het systeem niets. Het kijkt alleen maar. Het registreert elke klik, toetsaanslag en schermverandering die de menselijke operators maken terwijl ze duizenden klantcases oplossen. Denk hierbij aan een nieuwe bestuurder die op de bijrijdersplaats zit en wekenlang een professionele bestuurder door de stad ziet rijden, waarbij elke bocht en stopbord wordt gememoriseerd.

2. De "Copiloot"-fase (Suggesties doen, niet beslissen)

Vervolgens begint het systeem suggesties te doen. Het zegt: "Hé, gebaseerd op wat ik heb gezien, moet je waarschijnlijk deze knop als volgende indrukken."

  • De rol van de mens: De operator kan dan zeggen: "Ja, goed idee," en het systeem dit laten doen, of ze kunnen zeggen: "Nee, doe het op deze manier."
  • Het leren: Elke keer dat de mens het systeem corrigeert, leert het systeem. Het is als een leerling die een correctie met een rode pen krijgt op een huiswerkopdracht. In slechts twee weken wordt het systeem heel goed in het raden van de juiste volgende zet.

3. De "Selectieve Autopiloot"-fase (Veilig het stuur overnemen)

Dit is het belangrijkste deel. Het systeem neemt niet blindelings de controle over. Het heeft een ingebouwde "Veiligheidsrechter" (een critic).

  • Hoge zekerheid: Als het systeem erg zeker is (bijvoorbeeld: "Druk op de knop 'Volgende'"), doet het dit automatisch op de achtergrond.
  • Lage zekerheid: Als het systeem onzeker is (bijvoorbeeld: "Moet ik dit specifieke bericht naar de klant sturen?"), stopt het en vraagt het de mens om hulp.
  • Het resultaat: De menselijke operator kan nu meerdere gesprekken tegelijkertijd volgen. Ze hoeven alleen maar in te grijpen wanneer het systeem pauzeert om een vraag te stellen. Ze typen niet meer zelf; ze zijn alleen het veiligheidsnet.

Hoe het omgaat met fouten

Het artikel merkt op dat het systeem is gebouwd om voorzichtig te zijn.

  • Het "Stop"-bord: Als het computerscherm op een vreemde manier verandert die het systeem nog niet eerder heeft gezien, of als het systeem nerveus wordt over een beslissing, geeft het direct de controle terug aan de mens.
  • De "Reset"-knop: Als het systeem een fout maakt, raakt het niet de controle kwijt. Het stopt, laat de mens het scherm herstellen, en pakt dan precies op het punt waar het gebleven was weer op.

De resultaten in de praktijk

Het team testte dit in een echte bedrijfsmilieu met ongeveer 15.000 klanten.

  • Snelheid: Het systeem behandelde 45% van het hele gesprek van begin tot eind zonder menselijke hulp.
  • Tijdswinst: De tijd die een operator actief aan één klant moest besteden, daalde met 39%.
  • Kwaliteit: De kwaliteit van de ondersteuning nam niet af. De klanten waren net zo tevreden als voorheen.

De grote conclusie

Het artikel betoogt dat je geen robot nodig hebt die probeert alles perfect te doen om nuttig te zijn. In plaats daarvan heb je een robot nodig die selectief dapper is. Het doet automatisch de saaie, repetitieve, laag-risicovolle taken (zoals knoppen indrukken of formulieren invullen), maar het weet precies wanneer het moet zeggen: "Ik weet het niet zeker, jij regelt deze."

Deze aanpak is sneller te bouwen dan traditionele computerprogramma's (waarbij mensen rigide regels moeten schrijven voor elk mogelijk scenario) en betrouwbaarder dan een "wilde" AI die probeert alles alleen te doen. Het verandert de menselijke operator van een "bestuurder" in een "vlootmanager", die veel gesprekken tegelijkertijd superviseert met veel minder stress.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →