← Nieuwste papers
💬 NLP

CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories

CRMWeaver is een nieuw framework voor het bouwen van krachtige business agents dat gebruikmaakt van synthetische datageneratie en reinforcement learning voor training, gecombineerd met een gedeeld geheugenmechanisme tijdens inferentie, om complexe, heterogene zakelijke taken effectief af te handelen en competitieve prestaties te behalen op de CRMArena-Pro dataset.

Oorspronkelijke auteurs: Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je net een briljante, superintelligente robotassistent hebt gebouwd. Het kan gedichten schrijven, wiskundige problemen oplossen en chatten als een mens. Maar nu wil je het in een echt kantoor aan het werk zetten. Plotseling is de robot in de war. Hij staart naar een enorme, verwarde web van spreadsheets, klantgegevens en bedrijfsregels. Hij weet niet welk bestand hij moet openen, hoe hij de verbanden moet leggen tussen een verkooprapport en een verzendlogboek, of hoe hij een vraag moet beantwoorden die het controleren van drie verschillende databases tegelijk vereist. Dit is de uitdaging van "Business Agents". Dit zijn AI-systemen die ontworpen zijn om echt werk te doen, zoals het beantwoorden van klantvragen of het analyseren van verkoopgegevens, maar de echte wereld is rommelig, vol complexe verbindingen en constant in beweging.

Om deze agenten te helpen, gebruiken wetenschappers een paar belangrijke trucs. Ten eerste gebruiken ze "Large Language Models" (LLM's), die als gigantische digitale hersenen zijn getraind op bijna alles wat mensen ooit hebben geschreven. Deze hersenen zijn geweldig in het begrijpen van taal, maar hebben speciale training nodig om specifieke taken uit te voeren. Ten tweede gebruiken ze "Reinforcement Learning", een methode waarbij de AI leert door dingen te proberen, "punten" te krijgen voor goede zetten en punten te verliezen voor slechte zetten, een beetje zoals een videogame-personage dat een level omhoog gaat. Ten slotte experimenteren ze met "Long-term Memory", waarbij ze de AI een notitieblok geven om op te schrijven wat hij heeft geleerd van eerdere taken, zodat hij niet telkens opnieuw moet beginnen. De grote vraag is: Kunnen we een business agent bouwen die slim genoeg is om deze rommelige, echte kantoorpuzzels aan te pakken zonder een supercomputer ter grootte van een huis nodig te hebben?

Maak kennis met CRMWeaver, een nieuwe aanpak van onderzoekers van Alibaba en Southeast University die probeert dit probleem op te lossen met een slim driedelig recept. Denk aan CRMWeaver als een meesterkleermaker die niet alleen een robot leert hoe hij moet naaien; ze leren de robot ook hoe hij een complex patroon moet lezen, hoe hij kan oefenen op nepstof, en hoe hij een "spiekbriefje" van succesvolle steken kan bijhouden voor toekomstig gebruik.

Ten eerste realiseerde het team zich dat het moeilijk is om een AI te leren om complexe zakelijke gegevens te verwerken, omdat er niet genoeg praktijkvoorbeelden zijn om op te oefenen. Daarom hebben ze een Synthetic Data generator gemaakt. Stel je een videogame-ontwerper voor die een nepstad bouwt met nepmensen en nepproblemen, puur zodat de speler kan oefenen. De onderzoekers gebruikten AI om duizenden nep zakelijke vragen en antwoorden te genereren, variërend van eenvoudige vragen zoals "Hoe lang is de garantie?" tot ongelooflijk complexe vragen die het springen tussen vijf verschillende tabellen met gegevens vereisen. Dit gaf de AI een enorme speeltuin om van te leren.

Vervolgens gebruikten ze een Two-Stage Training proces. In de eerste fase gebruikten ze "Supervised Fine-Tuning" (SFT). Dit is als een leraar die de student stap voor stap laat zien wat de juiste manier is om een probleem op te lossen. De AI keek naar hoogwaardige voorbeelden van hoe instrumenten te gebruiken (zoals SQL om databases op te vragen) en hoe men over een probleem nadenkt. In de tweede fase lieten ze de AI vrij om zelfstandig problemen op te lossen via Reinforcement Learning. Hier werd de AI de vrije hand om dingen op eigen kracht te proberen. Als hij het juiste antwoord kreeg, kreeg hij een beloning; als hij een fout maakte, leerde hij van de fout. Ze gebruikten een speciale, efficiënte methode genaamd DAPO om ervoor te zorgen dat de AI snel leerde en niet in slechte gewoonten verviel. Dit hielp de AI om te generaliseren, wat betekent dat hij nieuwe, ongeziene problemen kon afhandelen waar hij niet specifiek op geoefend had.

Ten slotte, en misschien wel het belangrijkste, gaven ze de agent een Shared Memory systeem. In een echt kantoor, als je vandaag een lastig probleem oplost, schrijf je dat misschien op in een gedeeld notitieblok zodat je collega's die oplossing morgen kunnen gebruiken. CRMWeaver doet dit digitaal. Wanneer de AI een nieuwe vraag krijgt, controleert hij zijn "geheugenbank" om te zien of hij eerder iets soortgelijks heeft opgelost. Als hij een overeenkomst vindt, haalt hij de "richtlijn" of het "recept" op voor hoe dat probleem werd opgelost en gebruikt dit om te helpen bij het beantwoorden van de nieuwe vraag. Dit stelt de agent in staat om te leren van zijn eigen eerdere successen en de successen van sterkere modellen, waardoor hij veel beter wordt in het afhanden van taken die hij nog nooit eerder heeft gezien.

De onderzoekers testten hun creatie op een uitdagende benchmark genaamd CRMArena-Pro, die een echte zakelijke omgeving simuleert met 25 verschillende soorten data-objecten en 19 verschillende soorten taken, van het controleren van de naleving van beleid tot het uitvoeren van complexe database-queries. Ze lieten hun lichte model (gebaseerd op een 4-miljard parameter model genaamd Qwen3-4B) strijden tegen enkele van de grootste, krachtigste AI-modellen ter wereld, waaronder GPT-4o, Gemini 2.5-Pro en een massaal model van 235 miljard parameters.

De resultaten waren indrukwekkend. Ondanks dat het veel kleiner en goedkoper is om te draaien, behaalde de CRMWeaver-agent scores die concurrerend waren met, en in sommige gevallen zelfs beter dan, deze gigantische modellen. In de Business-to-Business (B2B) categorie behaalde het een gemiddelde score van 55,6, en in Business-to-Consumer (B2C) een score van 57,1. Het blonk met name uit in database-taken, met een score van 73,0 in B2B en 72,8 in B2C, waarmee het bijna elk ander getest model versloeg. De ablation studies (waarbij ze onderdelen van het systeem verwijderden om te zien wat er gebeurde) lieten zien dat elk onderdeel ertoe deed: het verwijderen van het geheugen, de reinforcement learning of de initiële training zorgde allemaal voor een significante daling van de scores.

De auteurs merken echter voorzichtig op wat de beperkingen van hun werk zijn. Ze geven toe dat hun systeem momenteel goed omgaat met queries van één gebruiker, maar nog niet volledig de complexe, meerkeurige gesprekken beheerst waarbij een mens en de AI langdurig met elkaar chatten. Ze vermelden ook dat het trainen van deze agenten nog steeds rekenintensief is en aanzienlijke hardware vereist, wat hen vooralsnog beperkt tot kleinere modellen. Maar over het algemeen suggereert CRMWeaver dat we, door slimme datageneratie, rigoureuze training en een gedeeld geheugensysteem te combineren, krachtige, praktische business agents kunnen bouwen die niet de omvang van een supercomputer nodig hebben om het werk te doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →