Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents
Dit artikel introduceert LuckyStar 111B, een hybride redeneermodel ontwikkeld door Cohere en LG CNS dat efficiënt een post-getraind meertalig basismodel aanpast voor Koreaans-Engelse enterprise-agenten via specifieke fine-tuning en kwantisatiestrategieën, waarbij de tool-gebruikscapaciteiten zoals function calling en NL2SQL aanzienlijk worden verbeterd terwijl de algemene kwaliteit van instructie-opvolging behouden blijft onder geheugenbeperkingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante, meertalige assistent hebt genaamd LuckyStar. Deze assistent is enorm (111 miljard "hersencellen" of parameters) en werkt voor grote bedrijven. De uitdaging was dat bedrijven deze assistent slim genoeg nodig hadden om complexe wiskundige problemen op te lossen, computercode te schrijven en met databases te communiceren (zoals SQL), maar ze hadden ook nodig dat hij snel en goedkoop in gebruik was en vloeiend zowel Koreaans als Engels kon spreken zonder in de war te raken.
Hier is het verhaal van hoe de onderzoekers LuckyStar hebben gebouwd en afgesteld, eenvoudig uitgelegd:
1. Het vertrekpunt: Een slimme basis
In plaats van een nieuw brein vanaf nul op te bouwen (wat lijkt op het leren lezen aan een baby vanaf nul), begonnen ze met een zeer slim, reeds getraind model genaamd Command A. Denk hierbij aan het inhuren van een ervaren werknemer die al perfect weet hoe hij instructies moet opvolgen in zowel het Koreaans als het Engels. Ze hoefden hem alleen nog maar een paar nieuwe, specifieke vaardigheden voor het werk aan te leren.
2. De "Schakelaar"-truc: Hybride redeneren
De grootste innovatie was het geven van een mentale schakelaar aan de assistent, die wordt aangestuurd door een "preamble" (een korte instructie aan het begin van een gesprek).
- Modus A (De Sprinter): Als je een simpele vraag stelt zoals "Wat is het weer?", vertelt de schakelaar het model om snel en beknopt te zijn.
- Modus B (De Detective): Als je een moeilijke wiskundevraag of een complexe database-query stelt, vertelt de schakelaar het model om "hardop na te denken", waarbij het vele stappen doorloopt om de oplossing te vinden voordat het het antwoord geeft.
- Waarom dit belangrijk is: Ze hadden niet twee verschillende robots nodig. Eén robot kon beide taken perfect uitvoeren door simpelweg van "instelling" te veranderen op basis van de prompt.
3. De taalpuzzel: Denken in het Engels, spreken in het Koreaans
Tijdens de training merkten ze een vreemde fout op. Wanneer ze het model een vraag in het Koreaans stelden, begon het model vaak in het Koreaans te denken, maar eindigde het antwoord vaak per ongeluk in het Engels. Het was alsoals een student die in het Frans studeert, maar zijn uiteindelijke essay in het Spaans schrijft.
Om dit op te lossen, gebruikten ze een slimme strategie:
- Ze leerden het model om te denken (het complexe redeneerwerk te doen) in het Engels, omdat de trainingsdata voor wiskunde en logica voornamelijk in het Engels was.
- Maar ze strafden het model streng af als het niet het eindantwoord in de taal van de gebruiker gaf (Koreaans).
- Het resultaat: Het model leerde zijn interne "detectivewerk" in het Engels te doen, maar het eindverslag altijd in de taal aan te leveren waar de gebruiker om vroeg.
4. De "Tool" Training: Leren omgaan met databases
Om de assistent goed te laten worden in "Agentic" taken (het gebruiken van tools zoals SQL-databases), moesten ze zeer voorzichtig zijn.
- Het Cold Start Probleem: In het begin was het model verschrikkelijk in het schrijven van database-queries. Het was alsof je iemand probeert te leren autorijden in een racewagen terwijl diegene nog nooit een stuur heeft vastgehouden.
- De Oplossing: Ze gebruikten een "probeer en verwerp"-methode. Ze genereerden duizenden mogelijke antwoorden, controleerden welke ervan daadwerkelijk werkten (die "verifieerbaar" waren), en voedden alleen de correcte antwoorden terug aan het model om van te leren. Dit bouwde een sterke fundering voordat ze met de geavanceerde training begonnen.
5. Het "Praatzieke" Probleem: Leren om stil te zijn
Nadat ze het model hadden geleerd een geweldige detective te zijn, werd het een beetje te praatziek. Het gaf lange, uitweidende verklaringen, zelfs wanneer je alleen een "Ja" of "Nee" wilde.
- De Fix: Ze gebruikten een techniek genaamd Preference Alignment. Ze lieten het model voorbeelden zien van "Goede, beknopte antwoorden" versus "Slechte, langdradige antwoorden" en zeiden tegen het model: "We geven de voorkeur aan de korte versies." Hiermee stemden ze het model af om behulpzaam te zijn zonder irritant te zijn.
6. De Hardware Hack: Een walvis in een badkuip passen
Het model is enorm (111 miljard parameters). Normaal gesproken heb je een enorme, dure supercomputer nodig om het te draaien.
- De Truc: Ze gebruikten 4-bit kwantisatie. Stel je voor dat je een foto met een hoge resolutie zo sterk comprimeert dat de bestandsgrootte de helft wordt, maar je kunt het plaatje nog steeds perfect herkennen.
- Het Resultaat: Dit stelde hen in staat om dit enorme 111-miljard-parameter model op een enkele standaard grafische kaart (een H100 GPU) te draaien zonder veel kwaliteitsverlies. Dit maakt het veel goedkoper en gemakkelijker voor bedrijven om het daadwerkelijk te gebruiken.
Samenvatting van de resultaten
Het uiteindelijke model, LuckyStar 111B, is een praktische, tweetalige (Koreaans/Engels) agent die:
- Wiskunde- en logica-problemen beter oplost dan het oorspronkelijke basismodel.
- Effectief kan communiceren met databases en tools kan gebruiken.
- De taal van de gebruiker correct spreeert, zelfs wanneer het in een andere taal denkt.
- Op een enkele server kan draaien, wat geld bespaart.
Het paper concludeert dat je voor zakelijk gebruik niet altijd een nieuw, perfect model vanaf nul nodig hebt. In plaats daarvan kun je een slim bestaand model nemen, het een "schakelaar" geven voor verschillende taken, het leren om tools zorgvuldig te gebruiken, en het comprimeren om efficiënt te draaien.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.