← Derniers articles
🤖 AI

daVinci-Dev: Agent-native Mid-training for Software Engineering

Le papier présente daVinci-Dev, un cadre pour le mid-training agentique qui exploite une nouvelle stratégie de données « agent-native » combinant des trajectoires contextuellement et environnementalement natives pour surmonter les décalages de distribution, permettant aux modèles de 32B et 72B d'atteindre des performances de pointe sur SWE-Bench Verified avec nettement moins de jetons d'entraînement que les méthodes précédentes.

Auteurs originaux : Ji Zeng, Dayuan Fu, Tiantian Mi, Yumin Zhuang, Yaxing Huang, Xuefeng Li, Lyumanshan Ye, Muhang Xie, Qishuo Hua, Zhen Huang, Mohan Jiang, Hanning Wang, Jifan Lin, Yang Xiao, Jie Sun, Yunze Wu, Pengfei
Publié 2026-01-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ji Zeng, Dayuan Fu, Tiantian Mi, Yumin Zhuang, Yaxing Huang, Xuefeng Li, Lyumanshan Ye, Muhang Xie, Qishuo Hua, Zhen Huang, Mohan Jiang, Hanning Wang, Jifan Lin, Yang Xiao, Jie Sun, Yunze Wu, Pengfei Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'Idée Principale : Enseigner à un Robot à Être un Vrai Programmeur

Imaginez que vous vouliez apprendre à un robot comment réparer une voiture en panne.

L'Ancienne Méthode (Post-Entraînement) :
La plupart des modèles d'IA actuels sont comme des étudiants qui ont lu tous les manuels de mécanique de la bibliothèque (Pré-entraînement) mais n'ont jamais touché une clé à molette. Pour leur apprendre à réparer des voitures, les chercheurs leur montrent quelques vidéos d'experts en train de réparer des voitures (Apprentissage Supervisé) et les laissent ensuite s'exercer dans un garage, en les corrigeant uniquement lorsqu'ils commettent une erreur (Apprentissage par Renforcement).

  • Le Problème : Le « garage » est petit et coûteux à construire. On ne peut s'exercer que sur quelques voitures. De plus, l'étudiant ne voit que la voiture finale réparée, pas le processus désordonné de l'essai, de l'échec, de la vérification du moteur, et de la nouvelle tentative.

La Nouvelle Méthode (daVinci-Dev / Entraînement de Milieu de Parcours Natif pour les Agents) :
Les auteurs de ce papier disent : « Enseignons au robot avant de l'envoyer au garage ». Ils introduisent une étape intermédiaire appelée Entraînement de Milieu de Parcours (Mid-Training).

Au lieu de simplement montrer la voiture finie au robot, ils le nourrissent d'une immense bibliothèque de journaux de réparation réels provenant de millions de mécaniciens de terrain. Ils ne montrent pas seulement le résultat final ; ils montrent toute l'histoire :

  1. Le mécanicien examinant la voiture en panne.
  2. Le mécanicien ouvrant le capot et lisant le manuel.
  3. Le mécanicien tentant une réparation, entendant un bruit bizarre, et réalisant que cela n'a pas fonctionné.
  4. Le mécanicien tentant une autre réparation jusqu'à ce que cela fonctionne.

Ils appellent cela des données « Natives pour les Agents » car elles imitent l'expérience réelle d'un agent (un travailleur) dans le monde réel, plutôt que de simplement mémoriser des faits statiques.


Les Deux Ingrédients Spéciaux

Pour construire cette bibliothèque d'entraînement, l'équipe a créé deux types d'« histoires » (données) à partir de GitHub (un site géant où les programmeurs partagent du code) :

1. Les Histoires « Contextuellement Natives » (La Bibliothèque Large)

  • Ce que c'est : Ils ont pris des millions de « Pull Requests » (demandes de modification de code) et ont reconstruit l'histoire complète.
  • L'Analogie : Imaginez le dossier d'un détective sur une affaire. Il ne montre pas seulement le crime résolu ; il montre le détective en train de lire le journal intime du suspect, de trouver le bon fichier, de faire une supposition, puis de changer d'avis en fonction de nouveaux indices.
  • Pourquoi cela aide : Cela enseigne à l'IA le flux de travail. Elle apprend qu'avant de modifier un fichier, elle doit d'abord le trouver et le lire. Cela couvre une immense variété de langages et de situations (68,6 milliards de mots de données).

2. Les Histoires « Environnementalement Natives » (La Simulation en Direct)

  • Ce que c'est : Ils n'ont pas seulement lu des journaux ; ils ont réellement exécuté le code. Ils ont placé un agent d'IA à l'intérieur d'un environnement informatique réel et fonctionnel (un conteneur Docker) et l'ont laissé essayer de corriger des bugs.
  • L'Analogie : C'est comme mettre l'étudiant dans un vrai garage avec un vrai moteur. L'étudiant tente de serrer un boulon, et le moteur fait un gros clac (une erreur). L'étudiant entend l'erreur, s'arrête, et essaie un autre outil.
  • Pourquoi cela aide : Cela apprend à l'IA comment réagir à un retour d'information réel. Elle apprend que « si je tape cette commande, l'ordinateur va me hurler un message d'erreur », ce qui est une chose que les livres statiques ne peuvent pas enseigner. Cette partie est plus petite (3,1 milliards de mots) mais de très haute qualité car elle est « réelle ».

Les Résultats : À quel point cela a-t-il fonctionné ?

L'équipe a testé leur nouvel « étudiant » (le modèle daVinci-Dev) sur un examen célèbre appelé SWE-Bench Verified, qui est comme un examen de conduite final pour les ingénieurs logiciels.

  • Le Score : Leur modèle de 72 milliards de paramètres a obtenu un taux de réussite de 58,5 %.
  • La Comparaison : Cela a battu la meilleure méthode open-source précédente (Kimi-Dev), qui tournait autour de 48,6 %.
  • L'Efficacité : Ils ont accompli cela en utilisant moins de la moitié de la quantité de données d'entraînement (tokens) que le précédent détenteur du record. C'est comme obtenir un A+ à un examen en étudiant 50 heures au lieu de 100, parce que le matériel d'étude était bien meilleur.
  • La Surprise : Bien qu'ils aient commencé avec un modèle de base « général » (Qwen2.5-Base) qui n'était pas spécifiquement entraîné pour le codage, ce nouveau mode d'entraînement l'a rendu meilleur en codage que des modèles qui commençaient comme des « experts en codage ».

Pourquoi cela est important (selon le papier)

Le papier soutient que la plus grande erreur commise dans l'enseignement du codage à l'IA a été de traiter l'IA comme un étudiant qui ne fait que lire des manuels scolaires. Le véritable génie logiciel est une boucle : Trouver le problème → Lire le code → Tenter une correction → Voir si cela casse → Corriger à nouveau.

En nourrissant l'IA de données qui préservent cette boucle (à la fois l'histoire du travail et le retour d'information en temps réel de l'ordinateur), ils ont construit une base beaucoup plus solide.

En bref : Ils n'ont pas seulement appris à l'IA à quoi ressemble le code ; ils lui ont appris comment penser comme un programmeur en simulant le processus désordonné d'essais et d'erreurs du développement logiciel réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →