← Derniers articles
💬 NLP

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

Cet article démontre que les agents de codage uniquement textuels, dotés d'outils en bac à sable, peuvent résoudre efficacement des tâches audio-vidéo complexes en convertissant les problèmes multimodaux en flux de travail de traitement d'informations, surpassant souvent les modèles omnimodaux natifs, tout en introduisant la recette d'entraînement Code-X et le benchmark TerminalBench-O pour faire progresser le traitement de nombreuses modalités en open-source.

Auteurs originaux : Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

Publié 2026-06-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'Idée Maîtresse : Le « Stagiaire Intelligent » vs le « Super-Génie »

Imaginez que vous ayez un puzzle massif et complexe composé de clips vidéo, d'enregistrements audio et de documents. Vous devez le résoudre.

Pendant longtemps, le monde de la technologie a supposé qu'il vous fallait un « Super-Génie » (une IA omnimodale native) pour résoudre cela. Ce Super-Génie est un modèle qui a « avalé » l'intégralité du fichier vidéo et audio d'un coup, tentant de comprendre chaque image et chaque onde sonore à la fois à l'intérieur de son cerveau.

Ce papier soutient que vous n'avez pas réellement besoin d'un Super-Génie pour cela. À la place, vous pouvez utiliser un « Stagiaire Intelligent » (un agent de codage).

Le Stagiaire Intelligent ne cherche pas à avaler toute la vidéo. Au lieu de cela, il possède une boîte à outils. Il regarde le fichier, saisit un outil spécifique (comme un éditeur vidéo ou une machine de transcription audio) et extrait juste la petite portion d'information dont il a besoin (comme une transcription ou une image précise), puis résout le puzzle grâce à cette petite preuve.

La thèse principale du papier : Le Stagiaire Intelligent, en utilisant des outils, est en réalité plus rapide, moins coûteux et souvent meilleur pour résoudre ces puzzles que le Super-Génie qui tente de tout mémoriser à la fois.


Comment fonctionne le « Stagiaire Intelligent »

Considérez le Stagiaire Intelligent comme un détective dans une bibliothèque.

  1. L'ancienne méthode (Modèles natifs) : Le Super-Génie entre dans la bibliothèque et essaie de lire tous les livres, d'écouter toutes les cassettes audio et de regarder tous les films sur les étagères simultanément. Il est submergé, consomme beaucoup d'énergie (tokens) et manque parfois des détails parce qu'il essaie de traiter trop de choses à la fois.
  2. La nouvelle méthode (Agents en environnement sécurisé/Sandbox) : Le Stagiaire Intelligent entre dans la bibliothèque mais ne prend que les livres ou les cassettes spécifiques dont il a besoin.
    • S'il a besoin de savoir ce que quelqu'un a dit, il utilise un outil de Speech-to-Text pour transformer l'audio en une transcription écrite.
    • S'il a besoin de savoir ce qu'il y a dans une vidéo, il utilise un outil d'extraction de trames (Frame-Extraction) pour extraire quelques images clés.
    • Il lit ensuite cette transcription ou regarde ces images pour répondre à la question.

Le résultat : Le Stagiaire Intelligent utilise beaucoup moins d'énergie (moins de « tokens ») car il ne porte pas toute la bibliothèque dans sa tête. Il ne transporte que les preuves spécifiques dont il a besoin.

Les Preuves : Qui gagne la course ?

Les chercheurs ont testé cela sur quatre différents « concours de puzzles » (benchmarks) impliquant des vidéos et de l'audio.

  • Les résultats : Les Stagiaires Intelligents (utilisant des modèles comme GPT-5.4 et Claude Opus) ont battu les meilleurs modèles Super-Génies (comme Gemini 3.1 Pro) dans plusieurs catégories.
  • L'analogie : C'est comme une course entre une personne essayant de mémoriser une encyclopédie entière pour répondre à une question de culture générale, et une personne qui sait exactement quelle page consulter dans un index de bibliothèque. La personne avec l'index gagne car elle est efficace et précise.

Pourquoi gagnent-ils ? (L'avantage de l'« Outil »)

Le papier a découvert que les Stagiaires Intelligents gagnent parce qu'ils traitent la vidéo/l'audio comme des matières premières à traiter, et non comme des souvenirs à stocker.

  • Récupération sélective : Au lieu de regarder un match de football de 90 minutes pour trouver un seul but, l'Intelligent utilise un outil pour scanner la vidéo à la recherche d'événements de type « but » et ne regarde que ces 30 secondes.
  • Correction d'erreurs : Si un outil échoue (par exemple, si la machine de transcription se trompe à cause du bruit), l'Intelligent peut essayer un autre outil ou écrire un petit script pour corriger le problème. Un Super-Génie reste souvent bloqué par le bruit.

Ce qui peut mal tourner (La taxonomie des échecs)

Même les Stagiaires Intelligents font des erreurs. Les chercheurs ont créé un « menu des échecs » pour expliquer pourquoi :

  1. Mauvaise audition : L'outil de transcription a mal entendu l'audio.
  2. Mauvaise vue : L'outil a choisi la mauvaise image de la vidéo.
  3. Abandon prématuré : L'agent a arrêté de chercher des indices avant d'avoir trouvé la réponse.
  4. Fausses informations : Il a trouvé la bonne vidéo mais a cherché la mauvaise information dans une base de données.
  5. Erreur de calcul : Il avait les bonnes informations mais a fait un mauvais calcul.
  6. Outils défectueux : L'ordinateur n'avait pas le bon logiciel installé pour faire fonctionner l'outil.

Peut-on apprendre au Stagiaire à être meilleur ? (Injection de compétences)

Les chercheurs se sont demandé : « Pouvons-nous rendre l'Intelligent encore plus intelligent sans reconstruire son cerveau ? »

Ils ont testé trois méthodes :

  1. Coaching humain : Donner à l'Intelligent un manuel écrit par des experts.
  2. Auto-pratique : Laisser l'Intelligent essayer, échouer et ajuster ses propres règles basées sur une simple vérification « Vrai/Faux ».
  3. Apprentissage par les logs : Faire en sorte qu'une seconde IA observe les journaux de travail (logs) de l'Intelligent, identifie les schémas de ce qui a fonctionné et de ce qui n'a pas fonctionné, et rédige un nouveau guide de « Bonnes Pratiques » pour l'Intelligent.

Le gagnant : La Distillation par auto-apprentissage via les logs (Learning from Logs) a été la plus efficace. C'était comme avoir un coach qui examine la vidéo du match de l'Intelligent et lui dit : « Tu oublies toujours de vérifier l'horodatage avant de deviner l'heure. » Cela a considérablement amélioré la précision de l'Intelligent.

Le Futur : De la « Compréhension » à l'« Action »

Le papier soutient que nous passons d'une ère où l'IA se contente de comprendre les médias (répondre à des questions sur une vidéo) à une ère où l'IA traite les médias (éditer la vidéo, couper l'audio, créer un nouveau fichier).

Ils ont introduit un nouveau test appelé TerminalBench-O pour mesurer cela.

  • La tâche : Au lieu de simplement demander « Qui est dans cette vidéo ? », l'IA doit créer un montage des moments forts, écrire une légende et enregistrer le fichier.
  • Le défi : C'est beaucoup plus difficile. Même la meilleure IA n'a réussi qu'environ 24 % de ces tâches. Cela nécessite une planification longue et une utilisation fiable des outils, ce qui est la prochaine frontière pour ces « Stagiaires Intelligents ».

Résumé

Vous n'avez pas besoin d'un cerveau gigantesque et coûteux qui mémorise chaque vidéo et chaque son pour résoudre des problèmes complexes. Vous avez besoin d'un agent intelligent et efficace qui sait utiliser des outils pour extraire les preuves spécifiques dont il a besoin. Cette approche est moins chère, plus rapide et souvent plus précise que d'essayer de tout « comprendre » d'un coup.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →