Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
Palmyra x6 is een op ondernemingen gerichte agentische taalmodellen die staat van de kunst prestaties behaalt op benchmarks voor het gebruik van tools door middel van een conservatieve, gecontroleerde post-training benadering met behulp van Anchored Supervised Fine-Tuning op een compacte, geverifieerde dataset.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het snel evoluerende landschap van kunstmatige intelligentie is een hardnekkige uitdaging geweest hoe men grote taalmodellen kan leren om als betrouwbare assistenten te fungeren zonder de vaardigheden die ze al bezitten te breken. Traditioneel vereiste het creëren van een hoogwaardig model voor een specifieke taak het volledig opnieuw opbouwen van het hele systeem, een proces dat vergelijkbaar is met het construeren van een nieuwe motor voor elk verschillend voertuig. Recentelijk hebben onderzoekers ontdekt dat het vaak voldoende is om een bestaand, krachtig model te nemen en het gedrag ervan zorgvuldig te verfijnen voor een specifiek doel, mits de trainingsdata van uitzonderlijke kwaliteit is en de leermethode precies is. Deze aanpak richt zich op "agentic" taken, waarbij het model niet alleen vragen moet beantwoorden, maar ook actief stappen moet plannen, digitale hulpmiddelen zoals webzoeken of code-executie moet gebruiken, en complexe, meerstaps-workflows moet navigeren om problemen op te lossen. Het doel is om een AI te creëren die effectief kan functioneren in een real-world digitale omgeving, door taken af te handelen die langetermijnplanning en interactie met diverse softwaresystemen vereisen, in plaats van simpelweg tekst te genereren.
Een team van onderzoekers bij Writer, Inc. heeft deze uitdaging aangepakt met de ontwikkeling van Palmyra x6, een model dat specifiek is ontworpen om uit te blinken in deze agentic taken. In plaats van een enorme nieuwe model vanaf de grond op te bouwen, begonnen ze met een geavanceerde bestaande fundering genaamd GLM-5.2, een model met honderden miljarden parameters. Bij deze fundering pasten zij een zeer gespecialiseerde trainingsmethode toe genaamd Anchored Supervised Fine-Tuning. Deze techniek is ontworpen om het model nieuwe vaardigheden te leren — specifiek, hoe het hulpmiddelen gebruikt en complexe taken plant — terwijl het strikt voorkomt dat het de algemene kennis en redeneervermogens die het al bezat, vergeet of degradeert. Het resultaat is een systeem dat complexe digitale omgevingen kan navigeren, zoals die met webzoeken, code-executie en documentextractie, met een niveau van competentie dat de vorige versies van hun eigen agent aanzienlijk overtreft en concurreert met de meest geavanceerde beschikbare modellen.
De kern van deze prestatie ligt in de kwaliteit en de aard van de data die voor de training is gebruikt. In plaats van het model enorme hoeveelheden internettekst te voeren, genereerden de onderzoekers een compacte, zeer gecureerde dataset bestaande uit slechts 626 voorbeelden. Elk voorbeeld is een volledige, geverifieerde traject van een taak die door een AI-agent wordt opgelost. Dit zijn synthetische verhalen waarin de AI een reeks stappen plant, verschillende hulpmiddelen aanroept om informatie te verzamelen of acties uit te voeren, en tot een correcte oplossing komt. Om ervoor te zorgen dat deze voorbeelden perfect waren, gebruikten de onderzoekers een rigoureus proces waarbij een "leraar"-model eerst een succesvol pad demonstreerde, waarna een "student"-model werd gevraagd om dezelfde probleemstelling onafhankelijk op te lossen, waarbij het plan van de leraar alleen als een hoogwaardige leidraad werd gebruikt. Als het student-model probeerde het proces te omzeilen door het antwoord te kopiëren of faalde in het correct gebruiken van de hulpmiddelen, werd de poging verworpen. Alleen de meest succesvolle, eerlijke pogingen werden behouden, wat resulteerde in een kleine maar ongelooflijk hoogwaardige bibliotheek van voorbeelden die het model leerden te denken en te handelen als een competente agent.
Om van deze kleine dataset te leren zonder de oorspronkelijke capaciteiten te verliezen, gebruikten de onderzoekers een methode die fungeert als een veiligheidsanker. Tijdens het trainingsproces wordt het model constant herinnerd aan zijn oorspronkelijke, ongetrainde zelf. Dit "anker" zorgt ervoor dat terwijl het model leert om hulpmiddelen te gebruiken en taken te plannen, het niet afdwaalt van de algemene intelligentie en veiligheidsgedragingen waarmee het begon. Dit is cruciaal omdat training op een kleine dataset er anders voor zou kunnen zorgen dat het model overmatig gespecialiseerd raakt of het vermogen verliest om algemene gesprekken te voeren. Door het model aan zijn oorspronkelijke staat te verankeren, waren de onderzoekers in staat om nieuwe agentic vaardigheden te injecteren zonder de fundering te eroderen. Ze maakten ook gebruik van een gespecialiseerde wiskundige optimizer, een hulpmiddel dat het model helpt efficiënter te leren door de interne verbindingen te behandelen als geometrische vormen in plaats van enkel getallen, waardoor het beter gebruik kan maken van de beperkte beschikbare data.
De resultaten van deze aanpak waren onmiddellijk en substantieel. Bij tests tegen een breed scala aan benchmarks die het vermogen van een AI meten om hulpmiddelen te gebruiken, langetermijntaken te plannen en complexe instructies op te volgen, toonde Palmyra x6 een enorme verbetering ten opzichte van het vorige standaardmodel dat door de agent van Writer werd gebruikt. Het vertoonde bijzonder sterke winsten in financieel onderzoek, waar het het web moest doorzoeken en data moest analyseren, evenals in algemene scenario's voor het gebruik van hulpmiddelen. Het model presteerde ook competitief tegen andere toonaangevende frontier-modellen, en rangschikte vaak bovenaan de groep wat betreft gemiddelde scores over meerdere verschillende tests heen. Misschien wel het belangrijkste is dat het model een hoge mate van veiligheid en neutraliteit behield. In tests die politieke bias en weigeringsgedrag meten, toonde Palmyra x6 een gebalanceerde aanpak door meerdere kanten van controversiële kwesties te presenteren en schadelijke verzoeken te weigeren op een frequentie die consistent is met het basismodel, wat bewees dat de nieuwe vaardigheden niet ten koste gingen van veiligheid of betrouwbaarheid.
De onderzoekers merkten er zorgvuldig bij op dat dit model een gespecialiseerd instrument is, geen universele vervanging voor alle AI-taken. De sterke punten liggen specifiek in agentic workflows waarbij het hulpmiddelen kan aanroepen en plannen kan uitvoeren, terwijl de prestaties op andere soorten taken worden bepaald door de capaciteiten van het basismodel waarop het is gebouwd. De trainingsdata, hoewel klein in aantal, was voldoende om het specifieke gedrag van het gebruik van hulpmiddelen te leren omdat de leermethode conservatief en precies was ontworpen. Het model is nu beschikbaar voor commercieel gebruik, met een versie die efficiënt kan worden uitgevoerd op standaard hardware. Dit werk demonstreert dat met de juiste combinatie van hoogwaardige data, een zorgvuldige trainingsdoelstelling en een stabiele fundering, het mogelijk is om zeer capabele AI-agenten te creëren zonder de noodzaak van massale, hulpbronnenintensieve hertraining vanaf nul. Het succes van Palmyra x6 suggereert een toekomst waarin AI-assistenten met precisie en veiligheid kunnen worden afgestemd op complexe, real-world banen, waarbij ze vertrouwen op een paar honderd perfecte voorbeelden in plaats van miljoenen imperfecte.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.