← Derniers articles
💻 computer science

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

L'article présente Beacon, un nouveau modèle de raisonnement visuel agentique qui améliore la performance globale en abordant les limites des modèles existants en matière d'adaptabilité de mode et d'effet d'outil grâce à un cadre d'apprentissage par renforcement comprenant des récompenses adaptatives axées sur la nécessité et une expansion des capacités guidée par des indices.

Auteurs originaux : Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

Publié 2026-07-31
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un ami robot super intelligent capable de regarder des images et de répondre à des questions à leur sujet. Ce robot fait partie d'un domaine appelé « l'IA multimodale », où les ordinateurs apprennent à comprendre à la fois le texte et les images. Habitellement, lorsqu'un tel robot voit une image complexe, il essaie de résoudre l'énigme en utilisant uniquement son cerveau (le raisonnement textuel). Mais parfois, l'énigme est trop difficile pour la simple réflexion ; il a besoin d'une paire d'« outils », comme une loupe pour zoomer, une calculatrice pour compter des choses, ou une paire de ciseaux pour découper une section de l'image. C'est ce qu'on appelle le « raisonnement visuel agentique ». La grande question que les scientifiques se posent n'est pas seulement « Le robot sait-il utiliser des outils ? », mais plutôt « Le robot sait-il quand les utiliser ? ». Si le robot saisit un marteau pour casser une noix, il perd du temps et risque de briser la noix. S'il essaie de compter mille petits points avec ses yeux au lieu d'utiliser un compteur, il pourrait donner une mauvaise réponse. Nous nous en soucions parce que nous voulons que nos assistants IA soient efficaces et précis, et non simplement occupés.

Entrez en scène Beacon, un nouveau type de modèle d'IA créé par des chercheurs qui ont réalisé que beaucoup de robots « utilisant des outils » actuels sont un peu maladroits. Ils ont tendance à utiliser leurs outils pour tout, même pour des tâches simples qu'ils pourraient résoudre les yeux fermés, et ils échouent souvent à les utiliser quand la tâche est réellement impossible sans aide. Les auteurs de cet article, une équipe issue d'universités et de l'équipe Kling, ont décidé de construire un robot plus intelligent qui sait exactement quand poser ses outils et quand les ramasser.

Ils ont découvert que les modèles existants sont comme des étudiants qui continuent d'utiliser une calculatrice pour une addition simple comme 2+22+2, gaspillant ainsi du temps et faisant parfois des erreurs stupides parce qu'ils comptent trop sur la machine. Parallèlement, face à un problème mathématique vraiment difficile, ces mêmes étudiants oublient souvent d'utiliser la calculatrice. Les chercheurs ont mesuré ce comportement et ont découvert que pour de nombreux modèles actuels, l'« aide » que les outils apportent sur les problèmes difficiles est presque complètement annulée par le « préjudice » qu'ils causent sur les problèmes faciles.

Pour corriger cela, ils ont construit Beacon en utilisant une méthode d'entraînement spéciale appelée Apprentissage par Renforcement. Voyez cela comme l'entraînement d'un chien avec un ensemble de règles très spécifiques. D'abord, ils ont appris au modèle comment utiliser des outils (comme écrire du code Python pour recadrer une image ou compter des pixels) grâce à beaucoup de pratique. Ensuite, ils ont introduit deux astuces ingénieuses pour lui apprendre quand les utiliser :

  1. La Récompense « Sensible à la Nécessité » : Imaginez un professeur qui donne une étoile dorée si vous résolvez un problème sans calculatrice, mais qui donne quand même une étoile d'argent si vous utilisez la calculatrice correctement uniquement lorsque le problème est trop difficile à faire de tête. Si vous utilisez la calculatrice sur un problème facile, vous n'obtenez aucune étoile. Cela apprend au modèle à réserver ses outils pour les tâches difficiles.
  2. L'Expansion « Guidée par des Indices » : Parfois, un problème est si difficile que le modèle se retrouve bloqué et abandonne. Au lieu de simplement abandonner, les chercheurs ont fait appel à un modèle « expert » (comme un tuteur génie) pour rédiger un indice qui guide le robot sur comment utiliser un outil pour résoudre le problème, sans pour autant donner la réponse. Le robot s'entraîne ensuite à résoudre le problème avec cet indice, apprend la stratégie, et finit par apprendre à le faire de lui-même sans l'indice.

Les résultats sont impressionnants. Testé sur 13 benchmarks différents et exigeants (allant du comptage de billes sur une piste à la compréhension de scores de badminton), Beacon est devenu le modèle open-source le plus performant. Il n'a pas seulement progressé dans l'utilisation des outils ; il est devenu meilleur pour les choisir. Les données montrent que Beacon a amélioré son score global de 6,07 points en moyenne par rapport à sa version de base. Plus important encore, il a montré un « Gain d'Outil » de +3,14 %, ce qui signifie que les outils qu'il utilise l'ont réellement aidé à résoudre des problèmes qu'il ne pouvait pas résoudre auparavant, sans pour autant gâcher les tâches faciles.

En résumé, l'article suggère que l'avenir d'une IA intelligente ne dépend pas seulement du fait d'avoir plus d'outils ou d'être plus intelligente en général, mais de la sagesse de savoir quand chercher un outil et quand faire confiance à son propre jugement. Beacon prouve qu'avec le bon entraînement, l'IA peut apprendre à être un partenaire réfléchi plutôt qu'un utilisateur d'outils frénétique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →