← Derniers articles
💬 NLP

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

Cet article propose un pipeline pour transférer des ensembles de données annotés entre les langues en utilisant des modèles de langage de grande taille, démontrant son efficacité en traduisant le corpus anglais DEFT en russe afin de créer une ressource de minage de termes et définitions rares qui soutient l'analyse des tendances scientifiques et la prise de décision.

Auteurs originaux : Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Publié 2026-07-08
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une bibliothèque massive et incroyablement détaillée de livres en anglais où chaque mot important (comme « photosynthèse » ou « inflation ») est surligné, et sa définition est écrite juste à côté. Cette bibliothèque est une mine d'or pour les ordinateurs qui tentent de comprendre comment appréhender la science et la technologie. Cependant, cette bibliothèque n'existe qu'en anglais.

Le problème ? Il n'existe pas d'équivalent en russe. Construire une telle bibliothèque à partir de zéro reviendrait à embaucher une équipe de milliers de personnes pour lire chaque livre, trouver les mots et écrire les définitions à la main. Cela prendrait une éternité et coûterait une fortune.

La Grande Idée : Le raccourci du « Traducteur Intelligent »
Les auteurs de cet article se sont posé la question suivante : Pouvons-nous utiliser une IA super intelligente (un grand modèle de langage ou LLM) pour agir comme un traducteur qui ne se contente pas de traduire les mots, mais qui déplace aussi les surlignages et les définitions avec eux ?

Voyez cela de cette manière : Imaginez que vous avez la carte d'une ville avec tous les monuments célèbres entourés en rouge. Vous voulez une carte de la même ville, mais dans une langue différente. Un traducteur normal se contenterait d'écrire les noms des rues dans la nouvelle langue, laissant les cercles rouges flotter au mauvais endroit. Les auteurs voulaient une IA capable de dire : « D'accord, je vois le cercle rouge autour de "Eiffel Tower" en anglais. En français, c'est "Tour Eiffel". Je vais déplacer le cercle rouge pour qu'il entoure "Tour Eiffel" à la place. »

Comment ils l'ont testé
Ils ont pris un ensemble de données anglais spécifique appelé DEFT (qui regorge de termes scientifiques et de leurs définitions) et ont tenté de le « transférer » en russe en utilisant plusieurs modèles d'IA différents (comme ChatGPT, Llama, DeepSeek et Qwen).

Ils ont essayé deux approches principales :

  1. L'approche « Mathématique » : Ils ont dit à l'IA : « Le mot commence au caractère 10 et se termine au caractère 20. Traduisez le texte, puis indiquez-moi les nouveaux numéros de caractères pour le mot russe. »
    • Résultat : L'IA s'est emmêlée les pinceaux. C'est comme demander à quelqu'un de compter les briques d'un mur tout en reconstruisant simultanément ce même mur dans une couleur différente. L'IA perdait sans cesse le compte ou se trompait dans les chiffres.
  2. L'approche « Repérer le mot » : Ils ont changé les instructions. Au lieu de demander des chiffres, ils ont dit : « Voici la phrase anglaise avec le mot surligné. Voici la traduction russe. Veuillez surligner le mot russe qui correspond au mot anglais. »
    • Résultat : Cela a bien mieux fonctionné ! C'était comme demander à l'IA de simplement pointer du doigt l'image correspondante plutôt que d'effectuer des calculs mathématiques complexes.

Les Résultats

  • Le meilleur traducteur : Le modèle d'IA DeepSeek a fait le meilleur travail pour déplacer correctement les « surlignages » (les annotations). Il a donné la bonne réponse environ 94 % du temps.
  • La Qualité : Le jeu de données russe résultant n'est pas parfait. Les auteurs l'appellent de qualité « argent » (silver grade) plutôt que « or » (gold grade). Il n'est pas fiable à 100 %, mais il est suffisamment bon pour servir de point de départ solide. C'est comme avoir le brouillon d'un livre qui est terminé à 90 % ; il suffit qu'un éditeur humain corrige les 10 % d'erreurs restantes, ce qui est beaucoup plus rapide que d'écrire tout le livre à partir de zéro.
  • Entraînement de nouveaux modèles : Ils ont utilisé ce nouveau jeu de données traduit par l'IA pour entraîner une IA russe plus petite et plus simple (un modèle BERT). Cette nouvelle IA russe a appris à repérer les définitions et les termes de manière raisonnable, prouvant que les données « argent » étaient assez utiles pour enseigner quelque chose de nouveau à un ordinateur.

Pourquoi cela importe
Les auteurs expliquent que cette méthode change la donne pour les langues « sous-dotées » (les langues qui ne disposent pas de suffisamment de données numériques). Au lieu d'attendre des années pour construire un jeu de données à partir de rien, les chercheurs peuvent utiliser ces « traducteurs intelligents » pour créer rapidement un brouillon de jeu de données. Cela aide les scientifiques et les décideurs en Russie (et potentiellement d'autres langues plus tard) à analyser les tendances de la science et de la technologie beaucoup plus rapidement.

Ce qu'ils n'ont pas fait
L'article est très précis sur ses limites :

  • Ils n'ont testé que l'anglais vers le russe.
  • Ils n'ont pas testé si l'IA pouvait faire le travail mieux qu'un traducteur humain (ils admettent que les traducteurs humains sont toujours meilleurs).
  • Ils n'ont pas testé l'IA sur la partie la plus difficile de la tâche originale (lier les termes aux définitions), laissant cela pour des travaux futurs.

En résumé, l'article montre que bien que l'IA ne soit pas encore parfaite, elle est un outil puissant pour « copier-coller » la connaissance de l'anglais vers le russe, faisant gagner aux chercheurs un temps et des efforts considérables.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →