Temporal Reliability of ChatGPT-Generated Bilingual Texts: Implications for AI-Assisted Language Learning and Multilingual Information Access
Deze studie evalueert de temporele betrouwbaarheid van vier opeenvolgende ChatGPT-versies in tweetalige vertalingen binnen de domeinen financiën, technologie en openbaar beleid, waarbij wordt onthuld dat modelupdates geen consistente verbeteringen in semantische nauwkeurigheid of leesbaarheid garanderen, maar in plaats daarvan uiteenlopende prestatiecurven vertonen die continue, domeinspecifieke evaluaties voor AI-ondersteunde taaltoepassingen noodzakelijk maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente, alwetende robotvriend hebt die elke taal op aarde spreekt. Je vraagt de robot om een lastige zin te vertalen, en hij geeft je een perfect antwoord. Maar wat als je exact dezelfde vraag een maand later stelt, nadat de robot een "software-update" heeft gehad? Geeft hij dan nog steeds hetzelfde antwoord, of is hij iets vergeten, heeft hij van mening veranderd, of is hij in een andere stijl gaan spreken? Dit is de grote vraag achter een nieuwe studie in de wereld van Kunstmatige Intelligentie (AI) en taal.
Wetenschappers noemen deze superintelligente robots "Large Language Models" (LLM's). Het zijn als digitale hersenen die kunnen schrijven, vertalen en chatten. Normaal gesproken, wanneer we een nieuwe videogame of een nieuwe telefoon kopen, verwachten we dat de nieuwste versie beter is dan de oude. We gaan ervan uit dat als een bedrijf "Versie 5.0" en daarna "Versie 6.0" uitbrengt, de tweede slimmer, sneller en nauwkeuriger is. Maar bij deze AI-robots is het niet altijd zo eenvoudig. Ze worden voortdurend aangepast en bijgewerkt achter de schermen, waardoor ze soms hun manier van denken of spreken veranderen zonder dat wij het zelfs maar weten. Deze studie stelt een zeer belangrijke vraag: als je AI gebruikt om je te helpen een taal te leren of nieuws in een vreemde taal te lezen, kun je er dan op vertrouwen dat de "nieuwste" versie ook echt de beste is? Of wordt de robot soms slechter in bepaalde dingen terwijl hij in andere zaken juist beter wordt?
Het Experiment: De Geheugen van de Robot Testen
Om dit te ontdekken, besloot een onderzoeker genaamd Zhihan Fu een spelletje "verschillen zoeken" te spelen met vier verschillende versies van een populaire AI-chatbot (genaamd GPT-5.0, GPT-5.4, GPT-5.5 en GPT-5.6 Sol). Denk aan deze versies als vier verschillende snapshots van dezelfde persoon genomen over een periode van enkele maanden.
De onderzoeker vroeg de robot niet alleen om te chatten; hij gaf hem een zeer specifieke uitdaging. Hij nam drie artikelen uit de echte wereld mee—één over geld (finance), één over zonne-energietechnologie en één over overheidsregels (public policy)—en vroeg elke versie van de robot om deze vanuit het Chinees naar het Engels te vertalen. Hij gebruikte voor elke versie exact dezelfde instructies en vergeleek hun antwoorden met een "gouden standaard" vertaling gemaakt door een menselijke expert.
Hij gebruikte twee hoofdmethoden om de vertalingen te beoordelen:
- De "Betekenis"-check: Hij gebruikte een hulpmiddel genaamd COMET om te zien hoe dicht de betekenis van de robot bij de betekenis van de menselijke expert lag. Hield hij alle feiten juist aan?
- De "Leesbaarheid"-check: Hij mat hoe gemakkelijk de tekst te lezen was. Was het te moeilijk? Waren de zinnen te lang? Gebruikte hij de juiste woorden?
De Verrassing: De Robot Wordt Niet in een Rechte Lijn Beter
De resultaten waren een beetje alsof je naar een achtbaan kijkt die in verschillende richtingen op en neer gaat voor verschillende passagiers. De grote verrassing was dat nieuwere versies van de AI niet automatisch beter waren. Sterker nog, de prestaties van de robot veranderden op vreemde, onvoorspelbare manieren, afhankelijk van waar de robot over praatte.
Dit is wat er gebeurde in elke "wereld" die de robot bezocht:
- De Wereld van de Overheidsregels (Public Policy): Dit was de enige plek waar de robot gestaag beter werd in het correct houden van de betekenis. Met elke nieuwe versie steeg de "Betekenis"-score en bereikte het hoogste punt met de nieuwste versie, GPT-5.6 Sol. Er zat echter een addertje onder het gras: naarmate de betekenis nauwkeuriger werd, werd de tekst moeilijker te lezen. De nieuwere versies begonnen in een complexere, onhandige stijl te schrijven die minder aanvoelde als een soepel verhaal en meer als een stijf juridisch document.
- De Wereld van het Geld (Finance): Hier was de robot een tijdje vrij stabiel, maar hij bereikte een piek met versie GPT-5.5 voordat hij met de nieuwste versie weer iets slechter werd. De nieuwste versie was hier niet de kampioen.
- De Wereld van Zonne-energie (Technologie): Dit was de wildste rit. De robot begon sterk, werd zelfs beter met versie GPT-5.4, en werd daarna slechter met elke update die volgde. Tegen de tijd dat de nieuwste versie (GPT-5.6 Sol) arriveerde, was het vermogen om de betekenis correct te houden gedaald tot onder zelfs de allereerste versie! De nieuwste versie deed echter iets interessants: hij brak de lange, verwarrende zinnen op in kortere, krachtigere zinnen, waardoor de tekst er makkelijker leesbaar uitzag, ook al miste het eigenlijk een aantal belangrijke technische details.
De Belangrijkste Conclusie: "Nieuwer" Betekent Niet "Beter"
De studie suggereert dat we niet zomaar kunnen aannemen dat de nieuwste AI-update het beste hulpmiddel voor de klus is. Het is als een chefkok die een nieuwe keuken krijgt. Misschien maakt de nieuwe oven hun taarten perfect, maar maken de nieuwe messen hun snijwerk van groenten langzamer.
- Voor Overheidsteksten: De nieuwste AI is het meest accuraat, maar is ook het moeilijkst te lezen.
- Voor Technische Handleidingen: De nieuwste AI schrijft in kortere zinnen (wat er goed uitziet), maar verliest daardoor eigenlijk belangrijke betekenis vergeleken met oudere versies.
- Voor Geldteksten: De middelste versie (GPT-5.5) was de beste, niet de nieuwste.
De onderzoeker ontdekte dat het vermogen van de robot om de betekenis correct te houden en zijn vermogen om makkelijk leesbaar te zijn, vaak in tegengestelde richtingen bewogen. Soms maakte het nauwkeuriger maken van de tekst de tekst moeilijker te begrijpen. Andere keren maakte het korter en eenvoudiger maken van de tekst de tekst minder accuraat.
Waarom Dit Belangrijk Is Voor Jou
Als je een student bent die AI gebruikt om je te helpen een taal te leren, of als je probeert nieuws uit een ander land te lezen, is deze studie een waarschuwing. Het vertelt ons dat we niet zomaar de "nieuwste" versie van een AI moeten pakken en ervan uit moeten gaan dat het de slimste is. De "beste" versie hangt volledig af van wat je precies wilt doen.
Als je een complexe overheidsregel moet begrijpen, kan de nieuwste versie je de juiste feiten geven, maar op een verwarrende manier. Als je een technische handleiding leest, ziet de nieuwste versie er misschien simpel uit, maar kan het een cruciale veiligheidswaarschuwing hebben gemist. De studie suggereert dat we deze AI-tools keer op keer opnieuw moeten testen en ze moeten controleren op specifieke taken, omdat de robot zijn persoonlijkheid verandert telkens wanneer hij een update krijgt. De "perfecte" AI-vertaler bestaat nog niet; in plaats daarvan hebben we een robot die constant verschuift, en we moeten voorzichtig zijn met welke versie we voor welke taak vertrouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.