← Derniers articles
💻 computer science

Temporal Reliability of ChatGPT-Generated Bilingual Texts: Implications for AI-Assisted Language Learning and Multilingual Information Access

Cette étude évalue la fiabilité temporelle de quatre versions successives de ChatGPT dans la traduction bilingue à travers les domaines de la finance, de la technologie et des politiques publiques, révélant que les mises à jour des modèles ne garantissent pas d'améliorations constantes de l'exactitude sémantique ou de la lisibilité et présentent plutôt des trajectoires de performance divergentes qui nécessitent des évaluations continues et spécifiques au domaine pour les applications linguistiques assistées par l'IA.

Auteurs originaux : Zhihan Fu

Publié 2026-07-22
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhihan Fu

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un ami robot super intelligent et omniscient qui parle toutes les langues de la Terre. Vous lui demandez de traduire une phrase difficile, et il vous donne une réponse parfaite. Mais que se passe-t-il si vous posez exactement la même question un mois plus tard, après qu'un robot a reçu une « mise à jour logicielle » ? Donne-t-il toujours la même réponse, ou a-t-il oublié quelque chose, a-t-il changé d'avis ou a-t-il commencé à parler dans un style différent ? C'est la grande question derrière une nouvelle étude dans le monde de l'Intelligence Artificielle (IA).

Les scientifiques appellent ces robots super intelligents des « Grands Modèles de Langage » (LLM). Ils sont comme des cerveaux numériques capables d'écrire, de traduire et de discuter. Habituellement, quand nous achetons un nouveau jeu vidéo ou un nouveau téléphone, nous nous attendons à ce que la version la plus récente soit meilleure que l'ancienne. Nous supposons que si une entreprise sort la « Version 5.0 » puis la « Version 6.0 », la seconde est plus intelligente, plus rapide et plus précise. Mais avec ces robots d'IA, les choses ne sont pas toujours aussi simples. Ils sont constamment ajustés et mis à jour en coulisses, changeant parfois leur façon de penser ou de parler sans même que nous le sachions. Cette étude pose une question très importante : si vous utilisez une IA pour vous aider à apprendre une langue ou à lire des informations dans une langue étrangère, pouvez-vous être sûr que la version la plus « récente » est réellement la meilleure ? Ou bien le robot devient-il parfois moins bon à certaines choses même s'il s'améliore dans d'autres ?

L'expérience : Tester la mémoire du robot

Pour le découvrir, un chercheur nommé Zhihan Fu a décidé de jouer au jeu du « cherche et trouve les différences » avec quatre versions différentes d'un chatbot populaire (nommé GPT-5.0, GPT-5.4, GPT-5.5 et GPT-5.6 Sol). Voyez ces versions comme quatre instantanés différents de la même personne pris sur plusieurs mois.

Le chercheur n'a pas seulement demandé au robot de discuter ; il lui a lancé un défi très spécifique. Il a pris trois articles du monde réel — un sur l'argent (finance), un sur la technologie solaire (technologie) et un sur les règles gouvernementales (politique publique) — et a demandé à chaque version du robot de les traduire du chinois vers l'anglais. Il a utilisé les mêmes instructions pour chaque version et a comparé leurs réponses à une traduction « étalon d'or » réalisée par un expert humain.

Il a utilisé deux méthodes principales pour juger les traductions :

  1. La vérification du « Sens » : Il a utilisé un outil appelé COMET pour voir à quel point le sens du robot était proche du sens de l'expert humain. Est-ce qu'il a conservé tous les faits correctement ?
  2. La vérification de la « Lisibilité » : Il a mesuré la facilité de lecture du texte. Était-il trop difficile à lire ? Les phrases étaient-elles trop longues ? Utilisait-il les bons mots ?

La surprise : Le robot ne progresse pas de manière linéaire

Les résultats ressemblaient un peu à l'observation d'une montagne russe qui monte et descend dans différentes directions pour différents passagers. La grande surprise fut que les versions plus récentes de l'IA n'étaient pas automatiquement meilleures. En fait, la performance du robot changeait de manière étrange et imprévisible selon le sujet abordé.

Voici ce qui s'est passé dans chaque « monde » visité par le robot :

  • Le monde des règles gouvernementales (Politique publique) : C'était le seul endroit où le robot s'améliorait régulièrement pour conserver le sens correct. À chaque nouvelle version, le score de « Sens » augmentait, atteignant son point le plus haut avec la version la plus récente, GPT-5.6 Sol. Cependant, il y avait un piège : à mesure que le sens devenait plus précis, le texte devenait plus difficile à lire. Les versions plus récentes commençaient à écrire dans un style plus complexe et lourd, qui ressemblait moins à un récit fluide qu'à un document juridique rigide.
  • Le monde de l'argent (Finance) : Ici, le robot est resté assez stable pendant un certain temps, puis a atteint un sommet avec la version GPT-5.5 avant de régresser légèrement avec la version la plus récente. La version la plus récente n'était pas la championne ici.
  • Le monde de l'énergie solaire (Technologie) : C'était le parcours le plus mouvementé. Le robot a commencé fort, s'est encore amélioré avec la version GPT-5.4, puis est devenu moins bon avec chaque mise à jour suivante. Au moment où la version la plus récente (GPT-5.6 Sol) est arrivée, sa capacité à conserver le sens correct était tombée en dessous de la toute première version ! Cependant, la version la plus récente a fait quelque chose d'intéressant : elle a découpé les longues phrases confuses en phrases plus courtes et percutantes, donnant l'impression que le texte était plus facile à lire, même si elle omettait en réalité certains détails techniques importants.

La grande conclusion : « Plus récent » ne signifie pas « Meilleur »

L'étude suggère que nous ne pouvons pas simplement supposer que la dernière mise à jour de l'IA est le meilleur outil pour la tâche. C'est comme un chef qui reçoit une nouvelle cuisine. Peut-être que le nouveau four fait que ses gâteaux sont parfaits, mais que les nouveaux couteaux rendent la découpe des légumes plus lente.

  • Pour les textes gouvernementaux : La version la plus récente de l'IA est la plus précise, mais elle est aussi la plus difficile à lire.
  • Pour les manuels techniques : La version la plus récente de l'IA écrit des phrases plus courtes (ce qui est agréable visuellement), mais elle perd en réalité du sens par rapport aux versions précédentes.
  • Pour les textes financiers : La version intermédiaire (GPT-5.5) était la meilleure, et non la plus récente.

Le chercheur a découvert que la capacité du robot à conserver le sens correct et sa capacité à être facile à lire évoluaient souvent dans des directions opposées. Parfois, rendre le texte plus précis le rendait plus difficile à comprendre. D'autres fois, le rendre plus court et plus simple le rendait moins précis.

Pourquoi cela vous concerne

Si vous êtes un étudiant utilisant l'IA pour vous aider à apprendre une langue, ou si vous essayez de lire des informations provenant d'un autre pays, cette étude est un avertissement. Elle nous dit que nous ne devrions pas simplement choisir la version la plus « récente » d'une IA en supposant qu'elle est la plus intelligente. La « meilleure » version dépend entièrement de ce que vous voulez faire.

Si vous avez besoin de comprendre une règle gouvernementale complexe, la version la plus récente pourrait vous donner les bons faits, mais de manière confuse. Si vous lisez un manuel technique, la version la plus récente pourrait paraître simple, mais elle pourrait avoir manqué une consigne de sécurité cruciale. L'étude suggère que nous devons continuer à tester ces outils d'IA encore et encore, en les vérifiant pour des tâches spécifiques, car le robot change de personnalité à chaque mise à jour. Le traducteur d'IA « parfait » n'existe pas encore ; à la place, nous avons un robot qui change constamment, et nous devons être prudents quant à la version à laquelle nous faisons confiance pour quelle tâche.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →