← Nieuwste papers
💬 NLP

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

Dit artikel stelt een pijplijn voor voor het overdragen van geannoteerde datasets tussen talen met behulp van Large Language Models, waarbij de effectiviteit wordt aangetoond door het Engelse DEFT-corpus naar het Russisch te vertalen om een bron voor het minen van zeldzame term-definitieparen te creëren die wetenschappelijke trendanalyse en besluitvorming ondersteunt.

Oorspronkelijke auteurs: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Gepubliceerd 2026-07-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ongelooflijk gedetailleerde bibliotheek hebt van Engelse boeken waarin elk belangrijk woord (zoals "photosynthesis" of "inflation") is gemarkeerd, en de definitie ervan direct ernaast staat geschreven. Deze bibliotheek is een goudmijn voor computers die proberen te leren hoe ze wetenschap en technologie kunnen begrijpen. Echter, deze bibliotheek bestaat alleen in het Engels.

Het probleem? Er is geen evenwaardige bibliotheek in het Russisch. Het bouwen van een nieuwe vanaf nul zou zijn alsof je een team van duizenden mensen inhuurt om elk boek te lezen, de woorden te vinden en de definities met de hand op te schrijven. Het zou eeuwig duren en een fortuin kosten.

Het Grote Idee: De "Slimme Vertaler" Afkorting
De auteurs van dit artikel vroegen zich af: Kunnen we een super-slimme AI (een Large Language Model of LLM) gebruiken om als een vertaler te fungeren die niet alleen de woorden vertaalt, maar ook de markeringen en definities met de woorden mee verplaatst?

Denk er als volgt over: Stel je een kaart van een stad voor met alle beroemde bezienswaardigheden in rode cirkels. Je wilt een kaart van dezelfde stad, maar in een andere taal. Een normale vertaler zou alleen de straatnamen in de nieuwe taal schrijven, waardoor de rode cirkels op de verkeerde plekken blijven zweven. De auteurs wilden een AI die kon zeggen: "Oké, ik zie de rode cirkel rond 'Eiffel Tower' in het Engels. In het Frans is dat 'Tour Eiffel'. Ik zal de rode cirkel verplaatsen zodat deze rond 'Tour Eiffel' staat."

Hoe Ze Het Testten
Ze namen een specifieke Engelse dataset genaamd DEFT (die vol zit met wetenschappelijke termen en hun definities) en probeerden deze naar het Russisch te "overdragen" met behulp van verschillende AI-modellen (zoals ChatGPT, Llama, DeepSeek en Qwen).

Ze probeerden twee hoofdbenaderingen:

  1. De "Wiskunde" Benadering: Ze zeiden tegen de AI: "Het woord begint bij karakter 10 en eindigt bij karakter 20. Vertaal de tekst, en vertel me daarna de nieuwe karakternummers voor het Russische woord."
    • Resultaat: De AI raakte in de war. Het is alsof je iemand vraagt de stenen in een muur te tellen terwijl die persoon tegelijkertijd de muur in een andere kleur aan het herbouwen is. De AI verloor steeds de telling of kreeg de nummers niet goed.
  2. De "Zoek het Woord" Benadering: Ze veranderden de instructies. In plaats van om nummers te vragen, zeiden ze: "Hier is de Engelse zin met het gemarkeerde woord. Hier is de Russische vertaling. Markeer het Russische woord dat overeenkomt met het Engelse woord."
    • Resultaat: Dit werkte veel beter! Het was alsof je de AI simpelweg vroeg om naar de bijbehorende afbeelding te wijzen, in plaats van complexe wiskunde te laten doen.

De Resultaten

  • De Beste Vertaler: Het AI-model DeepSeek deed het beste werk bij het correct verplaatsen van de "markeringen" (de annotaties). Het gaf in 94% van de gevallen het juiste antwoord.
  • De Kwaliteit: De resulterende Russische dataset is niet perfect. De auteurs noemen het "silver grade" in plaats van "gold grade". Het is niet 100% accuraat, maar het is goed genoeg om een solide startpunt te zijn. Het is als het hebben van een conceptversie van een boek die voor 90% af is; je hebt alleen nog een menselijke redacteur nodig om de resterende 10% aan fouten te herstellen, wat veel sneller is dan het hele boek vanaf nul schrijven.
  • Nieuwe Modellen Trainen: Ze gebruikten deze nieuwe, door AI vertaalde Russische dataset om een kleiner, simpeler AI-model (een BERT-model) te trainen. Deze nieuwe Russische AI leerde redelijk goed termen en definities te herkennen, wat bewees dat de "silver" data nuttig genoeg was om een computer iets nieuws te leren.

Waarom Dit Belangrijk Is
De auteurs leggen uit dat deze methode een game-changer is voor "onderbediende" talen (talen die niet genoeg digitale data hebben). In plaats van jaren te wachten op het bouwen van een dataset vanaf nul, kunnen onderzoekers deze "slimme vertalers" gebruiken om snel een concept-dataset te maken. Dit helpt wetenschappers en beleidsmakers in Rusland (en potentieel andere talen later) om trends in wetenschap en technologie veel sneller te analyseren.

Wat Ze Niet Hebben Gedaan
Het artikel is zeer specifiek over de beperkingen:

  • Ze hebben alleen Engels-naar-Russisch getest.
  • Ze hebben niet getest of de AI de taak beter kan uitvoeren dan een menselijke vertaler (ze geven toe dat menselijke vertalers nog steeds beter zijn).
  • Ze hebben de AI niet getest op het moeilijkste deel van de oorspronkelijke taak (het koppelen van termen aan definities), en laten dat over voor toekomstig werk.

Kortom, het artikel laat zien dat hoewel AI nog niet perfect is, het een krachtig hulpmiddel is voor het "kopiëren en plakken" van kennis van het Engels naar het Russisch, wat onderzoekers een enorme hoeveelheid tijd en moeite bespaart.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →