Mi:dm 2.0 Korea-centric Bilingual Language Models
KT introduceert Mi:dm 2.0, een tweetalige familie van grote taalmodellen met varianten van 11,5 miljard en 2,3 miljard parameters die gebruikmaken van een uitgebreide datapijplijn en culturele afstemming om state-of-the-art prestaties te behalen op Korea-specifieke benchmarks, terwijl ze zowel onderzoek als commerciële toepassingen ondersteunen onder een MIT-licentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren niet alleen de Koreaanse taal te begrijpen, maar ook de ziel van de Koreaanse cultuur. Dat is precies wat het team bij KT (Korea Telecom) heeft gedaan met hun nieuwe creatie, Mi:dm 2.0.
Beschouw de meeste bestaande AI-modellen als toeristen die een woordenboek hebben uit het hoofd geleerd. Ze kunnen "Hallo" en "Dank u wel" zeggen in het Koreaans, maar ze begrijpen misschien niet waarom je een buiging maakt, hoe je het juiste niveau van beleefdheid gebruikt voor je baas versus je vriend, of de diepe historische verwijzingen in een grap. Mi:dm 2.0 is echter ontworpen om een plaatselijke bewoner te zijn. Het spreekt niet alleen de taal; het denkt, redeneert en voelt alsof het bij de Koreaanse samenleving hoort.
Hier is een overzicht van hoe ze het hebben gebouwd, met behulp van eenvoudige analogieën:
1. Het Probleen: De "Toerist" versus de "Lokale Bewoner"
De auteurs merkten op dat hoewel veel AI-modellen Koreaans kunnen spreken, ze vaak onnatuurlijk klinken of de culturele nuances missen. Het is alsof een toerist probeert eten te bestellen op een lokale markt, maar per ongeluk de chef beledigt omdat hij de lokale gebruiken niet kende. Bestaande modellen werden getraind op data die ofwel te klein, van te lage kwaliteit, of simpelweg niet in staat was om de specifieke "vibe" van het Koreaanse leven te vangen.
2. De Oplossing: Een "Cultureel Dieet"
Om dit op te lossen, heeft het team de AI niet alleen meer data gevoerd; ze gaven het betere data. Ze behandelden de trainingsdata als een chef die een gastronomisch maaltijd bereidt:
- De Ingrediënten (Data): Ze hebben niet zomaar alles van het internet gegrepen. Ze bouwden een strikte "kwaliteitscontrole"-pijplijn. Stel je een zeef voor die gebroken zinnen, beledigende opmerkingen en verwarrende tekst eruit filtert, en alleen de heldere, hoogwaardige en cultureel relevante verhalen, nieuws en boeken overhoudt.
- Het Synthetische Supplement: Omdat hoogwaardige Koreaanse data zeldzaam is (zoals het vinden van een specifieke zeldzame specerij), hebben ze "synthetische" data gecreëerd. Ze namen bestaande kennis en herschreven deze in nieuwe formaten, zoals het veranderen van een droge encyclopedische vermelding in een les uit een tekstboek of een nieuwsbericht in een gesprek, om er zeker van te zijn dat de AI van diverse bronnen leert.
- Het Gebalanceerde Menu: Ze merkten op dat de AI te veel "geesteswetenschappen" (geschiedenis, literatuur) at en niet genoeg "STEM" (wetenschap, techniek, wiskunde). Daarom hebben ze bewust extra "STEM-gerechten" bereid om ervoor te zorgen dat de AI veelzijdig is en niet ziek wordt van een eenzijdige dieet.
3. De Twee Modellen: De "Meesterchef" en het "Zakmes"
Ze hebben twee versies van deze AI uitgebracht om aan verschillende behoeften te voldoen:
- Mi:dm 2.0 Base (11,5 Miljard Parameters): Denk aan dit als de Meesterchef. Het is groot, krachtig en handelt complexe taken af zoals diep redeneren, lange verhalen schrijven of moeilijke wiskundige problemen oplossen. Het is gebouwd door een kleiner model van 8 miljard parameters te nemen en het dieper te "rekken" (meer lagen toe te voegen) om het slimmer te maken zonder de basisstructuur te veranderen.
- Mi:dm 2.0 Mini (2,3 Miljard Parameters): Dit is het Zakmes. Het is klein, lichtgewicht en ontworpen om te draaien op apparaten met beperkte rekenkracht (zoals een telefoon of een laptop). Ze hebben de kennis van de Meesterchef "gesnoeid", waarbij de belangrijkste vaardigheden behouden zijn, zodat het nog steeds geweldig werk kan leveren zonder een enorme keuken nodig te hebben.
4. De Training: Van "Lezen" naar "Conversatie"
- Pre-training (De bibliotheek lezen): Eerst las de AI miljoenen documenten om de basis van taal, feiten en logica te leren.
- Post-training (Gezellenchap/Leerlingwezen): Na het lezen ging de AI door een gespecialiseerd leerlingschap. Ze leerden het specifieke vaardigheden aan:
- Instructies opvolgen: Leren om "Ja, meneer" te zeggen en precies te doen wat je vraagt, niet alleen wat het denkt dat je wilt.
- Veiligheid: Leren wat je niet moet zeggen. Ze leerden het om schadelijke onderwerpen (zoals haatzaaien of illegale handelingen) te herkennen en beleefd te weigeren eraan deel te nemen, als een verantwoordelijk volwassene.
- Toolgebruik: Het leren hoe het externe tools kan gebruiken, zoals een rekenmachine of een zoekmachine, om realtime antwoorden te krijgen.
5. De Resultaten: De "Lokale Test" doorstaan
Het team testte Mi:dm 2.0 tegen andere beroemde AI-modellen met speciale Koreaanse tests (zoals een culturele IQ-test).
- Het Oordeel: Mi:dm 2.0 haalde de tests niet alleen; het excelleerde in de tests. Het scoorde hoger dan andere modellen op het begrijpen van de Koreaanse geschiedenis, cultuur en complexe sociale situaties.
- De "Naald in de Hooiberg": Ze testten of de AI een minuscuul stukje informatie in een enorm document kon vinden (zoals het vinden van een naald in een hooiberg). Mi:dm 2.0 was hier uitstekend in, wat bewees dat het lange, gedetailleerde gesprekken kan afhandelen zonder de draad kwijt te raken.
- Veiligheid: Wanneer de AI werd geprobeerd te misleiden met lastige vragen die bedoeld waren om de AI iets gemeens of gevaarlijks te laten zeggen, hield Mi:dm 2.0 stand tegenover de concurrenten, wat aantoont dat het een sterk "moreel kompas" heeft.
Samenvatting
Mi:dm 2.0 is een tweetalige (Koreaans-Engels) AI die specifiek is ontworpen om Korea-centrisch te zijn. In plaats van een generieke robot die toevallig Koreaans spreekt, is het opgevoed met een dieet van hoogwaardige, cultureel rijke data om de nuances, humor en waarden van de Koreaanse samenleving te begrijpen. Of je nu een krachtig brein nodig hebt voor complexe taken (Base) of een behendige helper voor alledaagse taken (Mini), deze AI is ontworpen om minder op een machine en meer op een deskundige lokale vriend te voelen.
Noot: Het paper vermeldt dat de modellen onder de MIT-licentie worden uitgebracht voor onderzoek en commercieel gebruik, en de ontwikkelaars erkennen dat hoewel ze streven naar veiligheid, geen enkele AI perfect is en nog steeds fouten kan maken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.