← Derniers articles
💬 NLP

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX est un cadre d'appel de fonctions qui améliore l'affinement des données de pré-entraînement à grande échelle en introduisant une édition programmatique adaptative dotée de capacités d'insertion, de suppression et de modification, surmontant ainsi les limites d'efficacité et de fiabilité des approches existantes basées sur des règles ou sur les LLM pour atteindre une efficacité de données et une performance de modèle supérieures.

Auteurs originaux : Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

Publié 2026-07-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot super intelligent à parler comme un humain. Pendant longtemps, la recette secrète consistait simplement à utiliser plus de données. Vous jetiez une montagne de livres, de sites web et d'articles au robot, en espérant qu'il apprenne tout par la simple force du volume. Mais maintenant, nous avons frappé un mur. Nous avons aspiré presque chaque fragment utile de texte sur Internet. La règle du « plus c'est mieux » commence à s'estomper, comme une batterie qui se décharge.

Alors, que faisons-nous ? Nous arrêtons d'accumuler et nous commençons à nettoyer.

Voici UltraX, un nouvel outil conçu pour agir comme un éditeur microscopique et ultra-rapide pour les livres d'entraînement du robot. Mais voici le twist : au lieu de simplement supprimer de mauvaises phrases ou de réécrire des paragraphes entiers (ce qui est lent et risqué), UltraX utilise une astuce ingénieuse appelée appel de fonction (function calling).

Le « Maître Lego » contre l'« Équipe de Démolition »

Considérez les anciennes méthodes de nettoyage de données comme une équipe de démolition.

  • Les méthodes basées sur des règles sont comme des ouvriers avec un marteau et une liste de contrôle. Ils fracassent tout ce qui ressemble à une publicité ou à un symbole bizarre. Mais ils sont maladroits ; parfois, ils abattent une magnifique sculpture (une information précieuse) simplement parce qu'elle ressemblait un peu à un tas de briques.
  • Les grands éditeurs d'IA sont comme des artistes qui réécrivent toute l'histoire pour la rendre parfaite. Mais ils sont lents, coûteux, et parfois ils changent tellement l'intrigue que l'histoire n'a plus de sens.

UltraX est différent. C'est comme un maître Lego doté d'un ensemble d'outils spécifiques. Au lieu de réécrire tout le livre, il donne au robot une petite liste d'instructions :

  1. Supprime cette ligne de déchets (comme une publicité).
  2. Remplace cette faute de frappe bizarre par le mot correct.
  3. Insère une pièce d'information manquante qui s'est perdue dans le désordre.

Le document argumente explicitement contre l'idée qu'il faille réécrire des textes entiers pour les corriger. Il montre que le simple fait de supprimer des éléments (comme le font d'autres outils) ne suffit pas, car vous pourriez accidentellement jeter de bonnes informations. Il soutient également que tenter de générer de nouveaux paragraphes entiers est trop lent et peu fiable pour l'échelle massive de données nécessaires pour entraîner ces robots. UltraX prouve que les éditions précises et chirurgicales sont la clé.

Comment cela fonctionne : La « Recette » et le « Chef »

Le processus se déroule en deux actes principaux :

Acte 1 : L'Entraînement (Enseigner au Chef)
D'abord, les chercheurs devaient apprendre à leur petit modèle de « raffinage » comment être un bon éditeur. Ils n'ont pas fait de suppositions ; ils ont utilisé un « chef intelligent » (une IA puissante) pour écrire des versions parfaites et propres de pages web désordonnées. Ensuite, ils ont utilisé une astuce de mappage spéciale pour transformer ces versions propres en une recette d'instructions (comme « supprimer la ligne 5 », « corriger le mot 12 »). Ils ont filtré les recettes confuses et ont appris à leur petit modèle à suivre ces instructions parfaitement.

Acte 2 : Le Nettoyage (Le Passage à l'Échelle)
Maintenant, ils prennent ce « raffineur » entraîné et le laissent en liberté sur des milliards de pages web. Il lit un bloc de texte, prédit la liste exacte des mouvements Lego nécessaires pour le réparer, puis un programme informatique exécute ces mouvements instantanément. Parce que le modèle n'a qu'à produire une courte liste de commandes (comme « supprimer la ligne 3 ») plutôt que d'écrire toute une nouvelle histoire, il est incroyablement rapide et ne se fatigue pas.

Les Résultats : Plus Rapide, Plus Intelligent et Plus Efficace

Les chercheurs ont testé cela en entraînant un robot de 1 milliard de paramètres à partir de zéro en utilisant différents types de données nettoyées. Voici ce qu'ils ont trouvé :

  • De meilleurs scores : Sur un test de 10 compétences différentes (comme répondre à des questions scientifiques ou comprendre des blagues), le robot entraîné avec les données UltraX a obtenu des scores plus élevés que les robots entraînés avec des données brutes ou des données nettoyées par d'autres méthodes. En fait, UltraX était le meilleur performeur sur les cinq types différents de données Internet qu'ils ont testés.
  • Le boost de « 2 % » : Sur plusieurs ensembles de données, UltraX a apporté une amélioration relative de plus de 2 %. Dans le monde de l'IA, c'est un bond énorme.
  • Faire plus avec moins : C'est la partie la plus cool. Le robot entraîné par UltraX a atteint le même niveau de performance élevé en utilisant moins de tokens d'entraînement (moins de mots) que les autres. Cela suggère qu'UltraX rend les données plus « denses » en informations utiles, de sorte que le robot apprend plus vite.

Ce qu'ils n'ont pas fait (Et ce dont ils ne sont pas sûrs)

Il est important de connaître les limites de cette histoire. Le document ne prétend pas que cela résout tout pour toujours.

  • Ils n'ont testé cela que sur des données web en anglais. Ils admettent ne pas l'avoir encore essayé sur le chinois ou d'autres langues, où le « bruit » pourrait avoir une apparence totalement différente.
  • Ils ont entraîné un modèle de 1 milliard de paramètres. Ils n'ont pas encore prouvé si cela fonctionne exactement de la même manière sur les modèles massifs de l'ordre du billion de paramètres qui arrivent bientôt.
  • Ils suggèrent que les gains proviennent de l'équilibre entre la suppression du bruit et la conservation des bonnes informations, mais ils ne prétendent pas avoir une formule parfaite pour chaque type de désordre sur Internet.

L'essentiel

UltraX suggère que l'avenir de l'enseignement de l'IA ne consiste pas à trouver plus de données, mais à être plus intelligent avec les données que nous avons déjà. En utilisant une approche précise basée sur des instructions qui peut supprimer, corriger et insérer des parties spécifiques de texte, il nettoie la bibliothèque du robot plus vite et mieux que les anciennes méthodes. C'est un passage du « tout jeter contre le mur » à la « suppression chirurgicale des déchets », et les résultats montrent qu'un peu de nettoyage intelligent va très loin.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →