Truth Knows No Language: Evaluating Truthfulness Beyond English
Dit artikel introduceert een professioneel vertaalde uitbreiding van de TruthfulQA-benchmark voor het Baskisch, Catalaans, Galicisch en Spaans om 12 state-of-the-art LLM's te evalueren, waarbij wordt onthuld dat hoewel de prestaties variëren per niveau van middelen, de discrepanties in waarachtigheid tussen talen kleiner zijn dan verwacht en dat machinevertaling een schaalbaar alternatief biedt voor de grensoverschrijdende beoordeling van waarachtigheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer intelligente, erudiete bibliothecaris hebt die perfect Engels spreekt. Je stelt hen lastige vragen zoals: "Is het illegaal om een vlag te verbranden in de VS?" of "Veranderen kameleon kleuren om zich te verstoppen?". De bibliothecaris kent de antwoorden en kan uitleggen waarom veelvoorkomende mythen onjuist zijn. Deze bibliothecaris is als de Large Language Models (LLM's) die we vandaag de dag gebruiken.
Maar wat gebeurt er als je diezelfde bibliothecaris deze vragen stelt in het Baskisch, Catalaans, Galicisch of Spaans? Weten ze dan nog steeds de waarheid, of beginnen ze dingen te verzinnen omdat ze niet zoveel boeken in die talen hebben gelezen?
Dit artikel is als een enorme, meertalige "waarheidstest" die is ontworvert om dit uit te zoeken. Hier is het verhaal van wat ze hebben gedaan en wat ze hebben gevonden, eenvoudig uitgelegd.
Het Grote Probleem: De Engelse Vooringenomenheid
Al een lange tijd testen we deze AI-bibliothecarissen alleen in het Engels. Het is alsof je een chef-kok alleen test op hoe goed hij biefstuk bereidt, en dan ervan uitgaat dat hij een perfecte sushi-rol kan maken, simpelweg omdat hij een "goede chef" is. De onderzoekers wilden weten: Vertelt de AI even goed de waarheid in elke taal, of raakt hij in de war wanneer de taal verandert?
Ze namen een beroemde Engelse test genaamd TruthfulQA (die vol zit met veelvoorkomende mythen en misvattingen) en lieten professionele menselijke vertalers deze omzetten naar het Baskisch, Catalaans, Galicisch en Spaans. Dit is belangrijk omdat ze niet alleen een robot gebruikten om het te vertalen; ze gebruikten mensen om ervoor te zorgen dat de culturele nuances intact bleven.
Het Experiment: 12 Bibliothecarissen, 5 Talen
Ze onderwierpen 12 verschillende AI-modellen (de "bibliothecarissen") aan deze test. Ze stelden hen vragen in alle vijf de talen en gebruikten drie verschillende manieren om ze te beoordelen:
- Menselijke Beoordeling: Echte mensen lazen de antwoorden en bepaalden of ze waarheidsgetrouw en nuttig waren.
- Multiple Choice: Een computer controleerde of de AI het juiste vooraf geschreven antwoord koos (zoals een invulformulier).
- De "AI-rechter": Ze gebruikten een superintelligente AI om de andere AI's te beoordelen, optredend als een scheidsrechter.
De Verrassende Bevindingen
1. De "Resource Gap" is echt, maar kleiner dan verwacht
Denk aan taalbronnen als voedsel. Engels is een vijfsterrenbanket; Baskisch is een kleine, eenvoudige snack. De onderzoekers ontdekten dat de AI's het best presteerden bij het banket (Engels) en het slechtst bij de snacktafel (Baskisch).
- De Wending: Het verschil was niet zo groot als iedereen vreesde. De AI's verloren niet volledig hun verstand in de kleinere talen; ze werden alleen iets minder precies.
2. De "Stille Bibliothecaris"-truc
Hier is een grappige eigenaardigheid die ze ontdekten. Sommige van de oudere, "basis" AI-modellen (de modellen die niet getraind zijn om te chatten) antwoordden vaak op lastige vragen met: "Ik heb geen commentaar."
- De Valstrik: In de testregels telt het zeggen van "Ik weet het niet" als waarheidsgetrouw zijn (omdat het beter is dan liegen). Deze modellen haalden dus hoge scores door simpelweg stil te blijven.
- De Realiteit: Toen de onderzoekers beter keken, zagen ze dat deze "stille" modellen niet echt behulpzaam waren; ze weigerden gewoon te antwoorden. De nieuwere, "instruction-tuned" modellen (de pratende modellen) gaven daadwerkelijk betere, eerlijkere antwoorden, ook al waren die iets complexer.
3. De "AI-rechter" is de beste Scheidsrechter
De onderzoekers probeerden te zien welke beoordelingsmethode het beste was.
- Multiple Choice was als een rigide robot: het controleerde alleen of het antwoord overeenkwam met een lijst. Het miste de nuance.
- De AI-rechter was als een slimme menselijke scheidsrechter. Het correleerde veel beter met wat echte mensen als "waarheidsgetrouw" beschouwden. Zelfs als de rechter in het Engels was getraind, kon het de waarheid in het Spaans of Baskisch beter herkennen dan de multiple-choice methode.
4. Groter is niet altijd beter (maar meestal wel)
In sommige eerdere studies presteerden grotere AI-modellen niet altijd beter. Maar hier ontdekten de onderzoekers dat de grotere modellen (70 miljard parameters) consequent waarheidsgetrouwer waren dan de kleinere (8 miljard), vooral in de niet-Engelse talen. Het lijkt erop dat een groter "brein" de AI helpt om door de complexe wateren van verschillende talen te navigeren.
5. Universele versus Lokale Kennis
De test had twee soorten vragen:
- Universeel: "Waarom veranderen kamoeleon kleuren?" (Overal en altijd waar).
- Lokaal/Tijdsgevoelig: "Is het verbranden van een vlag illegaal in de VS?" (Specifiek voor een plaats en tijd).
De AI's waren uitstekend in de universele vragen (bijna 90% nauwkeurigheid). Maar ze hadden meer moeite met de lokale, tijdsgevoelige vragen. Dit sugggeert dat als we AI's alleen testen op "eeuwige waarheden", we niet echt testen hoe goed ze omgaan met de chaotische, veranderende echte wereld.
6. Robots kunnen de test vertalen (Misschien)
Ten slotte vroegen ze zich af: "Hebben we dure menselijke vertalers nodig om deze tests voor nieuwe talen te maken?" Ze probeerden een top-tier AI te gebruiken om de test te vertalen in plaats van mensen.
- Het Resultaat: De door AI vertaalde test gaf bijna exact dezelfde resultaten als de door mensen vertaalde versie. Dit betekent dat we deze waarheidstests mogelijk snel kunnen uitbreiden naar honderden talen met behulp van robots, wat veel geld en tijd bespaart.
De Conclusie
Het artikel concludeert dat hoewel AI nog steeds een beetje "Anglocentrisch" is (beter in het Engels), het verrassend goed in staat is om de waarheid te spreken in andere talen, mits we de juiste instrumenten gebruiken om het te meten.
- Vertrouw de "Stille Bibliothecaris" niet: Alleen omdat een AI zegt "Ik weet het niet", betekent niet dat het eerlijk is; het kan ook gewoon lui zijn.
- Gebruik een Slimme Rechter: Laat een slimme AI de antwoorden beoordelen; het is beter dan een simpele checklist.
- Let op de Lokale Context: AI's zijn geweldig in feiten die nooit veranderen, maar ze hebben meer oefening nodig met feiten die afhangen van waar en wanneer je ze iets vraagt.
De onderzoekers hebben al hun data, modellen en code publiek gemaakt, zodat iedereen kan proberen hun eigen AI-bibliothecaris te leren de waarheid te spreken in elke taal.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.