← Derniers articles
🤖 machine learning

Interactive Training 2: Auditable Control Plane for Live Model Training

Cet article présente Interactive Training 2, un plan de contrôle open-source qui permet un pilotage auditable et en temps réel de l'entraînement de modèles en direct grâce à un protocole partagé et un espace de travail Aim personnalisé, permettant ainsi aux humains comme aux agents automatisés de modifier en toute sécurité les paramètres d'entraînement à travers divers flux de travail.

Auteurs originaux : Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng

Publié 2026-07-22
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un grand chef cuisiner un plat complexe. Vous voyez la marmite bouillonner, vous sentez les épices et vous remarquez que la sauce s'épaissit trop. Autrefois, si vous vouliez dire au chef de baisser le feu ou d'ajouter une pincée de sel, il fallait courir dans la cuisine, saisir un outil spécifique et murmurer des instructions que seul ce chef comprenait. Si vous vouliez parler à un autre chef préparant un plat différent, il vous fallait un tout nouvel ensemble d'outils et un nouveau langage. C'est ainsi que l'entraînement des modèles d'intelligence artificielle fonctionnait : les chercheurs pouvaient observer le processus de « cuisson », mais modifier la recette pendant qu'elle se déroulait était laborieux, nécessitait un code personnalisé pour chaque expérience et était difficile à suivre.

Maintenant, imaginez que chaque cuisine soit équipée d'un système d'interphone universel et magique. Vous pourriez vous approcher et dire « ajoute plus de sel » ou « baisse le feu », et le chef vous entendrait, vérifierait s'il est possible de le faire à ce moment précis, puis effectuerait le changement exactement quand la marmite sera prête. Le meilleur dans tout cela ? Le système noterait précisément qui a demandé quoi, quand cela a été demandé, et si le chef l'a fait. C'est le monde de l'« Entraînement Interactif », un domaine où les chercheurs tentent de diriger les modèles d'IA pendant qu'ils apprennent, plutôt que de simplement les regarder. La grande question est la suivante : comment rendre ce pilotage facile, sûr et traçable pour n'importe quel chef IA, et pas seulement pour ceux utilisant une marque de cuisinière spécifique ?

Ce document présente Interactive Training 2, un nouveau « plan de contrôle » qui agit comme cet interphone universel pour l'entraînement de l'IA. Les auteurs ont construit un système open-source qui permet aux humains, aux scripts informatiques ou même aux agents d'IA (comme des robots intelligents) de communiquer avec un modèle en cours d'entraînement via un langage unique et partagé. Au lieu d'écrire un nouveau code pour chaque expérience, un chercheur indique simplement au système : « Voici les boutons que je peux tourner (comme la vitesse d'apprentissage) et les touches sur lesquelles je peux appuyer (comme sauvegarder un point de contrôle) ».

Voici comment cela fonctionne en pratique : un chercheur (ou un agent d'IA intelligent) observe un tableau de bord en direct montissant comment le modèle se comporte. Si le modèle éprouve des difficultés, il peut envoyer une requête via le système, telle que « abaisser le taux d'apprentissage à 0,00002 ». Le modèle d'entraînement ne change pas instantanément ; il attend plutôt un moment sûr dans son processus de cuisson — ce que les auteurs appellent un « point de contrôle » — pour effectuer le changement. Il vérifie ensuite si la requête est valide, l'applique, et consigne toute l'histoire dans un journal numérique. Ce journal relie la requête au résultat, au nouveau score et à la version sauvegardée du modèle, créant ainsi une piste claire et auditable de qui a fait quoi et quand.

L'équipe a testé ce système sur cinq types de tâches d'IA différents, incluant l'enseignement de la compréhension des sentiments humains (analyse de sentiment) et le jeu (apprentissage par renforcement). Ils ont démontré que le même système pouvait gérer aussi bien des ajustements simples du taux d'apprentissage que des changements complexes dans la manière dont le modèle traite les données. Lors de ces tests, ils ont utilisé un agent d'IA pour agir en tant qu'« assistant du chef », qui observait les résultats, décidait de la prochaine modification à apporter et envoyait la requête. Le système a enregistré avec succès chaque étape, du plan initial au résultat final, prouvant que l'on peut piloter un modèle d'IA en direct sans casser le code ni perdre la trace de l'historique.

Le document ne prétend pas avoir résolu tous les problèmes de l'entraînement de l'IA ou être une solution miracle garantissant des résultats parfaits. Au contraire, il propose une base réutilisable. Il suggère qu'en séparant le « pilotage » de la « cuisson », nous pouvons rendre l'entraînement plus flexible et plus facile à étudier. Les auteurs démontrent que cette approche fonctionne à travers différents frameworks et qu'elle permet tant aux humains qu'aux agents automatisés de collaborer pour améliorer les modèles d'IA en temps réel, tout en conservant un registre parfait de l'ensemble du parcours.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →