← Derniers articles
🤖 machine learning

Qwen-CUA: Native Computer Use for (almost) Everything

Le document présente Qwen-CUA, un agent d'utilisation de l'ordinateur natif construit sur un squelette de mélange d'experts de 397B qui fonctionne uniquement via des captures d'écran et des événements d'entrée sans dépendre des arbres DOM, atteignant des performances de pointe sur les benchmarks d'utilisation de l'ordinateur grâce à un entraînement par déploiement massif dans le cloud, une optimisation de récompense vérifiable et une architecture évolutive.

Auteurs originaux : Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que S
Publié 2026-08-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que Shen, Bowen Wang, Junli Wang, Chencan Wu, Rui Xie, Tianbao Xie, Zhihui Xie, Haiyang Xu, An Yang, Tao Yu, Wenzhen Yuan, Xi Zhang, Zhenru Zhang, Mingkang Zhu, Zhaoqing Zhu, Yizhong Cao, Kai Dang, Binyuan Hui, Kaixin Li, Junyang Lin, Haiquan Wang, Zekun Wang, Yiheng Xu, Fan Yan, Mengqi Yuan, Danyang Zhang, Jiajun Zhang, Zhipeng Zhang, Fan Zhou, Fan Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où votre ordinateur ne se contente pas d'attendre que vous cliquiez sur des boutons, mais qui observe réellement ce que vous faites et apprend à le faire pour vous. C'est la frontière passionnante des « agents IA », une branche de la science où l'on apprend aux ordinateurs à agir comme des humains dans le monde numérique. Pendant longtemps, ces agents étaient comme des étudiants brillants capables de ne lire que des manuels scolaires (le code) ou de suivre des manuels d'instructions stricts (les API). Ils étaient excellents en mathématiques et en logique, mais si vous leur demandiez d'utiliser un programme ancien et désordonné ou un site web qui change à chaque actualisation, ils s'y perdaient. Ils ne pouvaient pas « voir » l'écran comme un humain le fait ; ils avaient besoin de plans spéciaux de la structure du site web pour savoir où se trouvaient les boutons. Mais la majeure partie de nos vies numériques se déroule sur des écrans qui ne possèdent pas ces plans. Cet article s'attaque au défi consistant à enseigner à une IA à être un véritable apprenti numérique : un apprenti qui regarde un écran, comprend ce qu'il doit faire, et clique ou tape exactement comme une personne le ferait, sans avoir besoin de raccourcis spéciaux ou de cartes cachées.

L'équipe derrière cette recherche présente Qwen-CUA, un nouveau type d'agent IA conçu pour être un utilisateur d'ordinateur « natif ». Voyez cela comme l'enseignement à un robot comment conduire une voiture. Au lieu de donner au robot une carte numérique parfaite de chaque route et de chaque feu de signalisation (ce qui n'existe pas pour beaucoup de logiciels anciens ou complexes), ils ont appris au robot à regarder par la fenêtre, à voir la route et à tourner le volant en fonction de ce qu'il voit. Qwen-CUA « voit » uniquement des captures d'écran de l'écran de l'ordinateur et « agit » uniquement en envoyant des commandes de clavier et de souris. Il ne regarde pas sous le capot du code et ne demande pas d'aide au logiciel ; il se contente de regarder et d'apprendre.

Pour rendre ce robot assez intelligent pour gérer des tâches de la vie réelle, les chercheurs ont dû construire une immense salle de sport d'entraînement. Ils ont créé une flotte basée sur le cloud avec près de 100 000 processeurs virtuels (imaginez une ville de milliers d'ordinateurs travaillant de concert) et ont mis en place environ 40 000 tâches différentes pour que l'IA s'exerce. Ces tâches allaient de choses simples comme l'organisation de fichiers à des flux de travail complexes et multi-étapes dans des logiciels professionnels. L'IA ne recevait pas seulement un « bon travail » ou un « réessaie » à la toute fin ; le système était conçu pour vérifier si la tâche était réellement accomplie correctement, permettant à l'IA d'apprendre de ses erreurs encore et encore.

Les résultats sont impressionnants. Lors de tests sur huit benchmarks différents, Qwen-CUA a systématiquement battu sa version précédente, Qwen3.7, et a même tenu tête à certains des systèmes d'IA les plus puissants et les plus coûteux disponibles aujourd'hui. Par exemple, sur un test appelé OSWorld-Verified, qui mesure la capacité d'une IA à gérer des tâches quotidiennes sur bureau, Qwen-CUA a obtenu un score de 86,2, tandis que le modèle précédent a obtenu 73,3. Lorsqu'ils ont appliqué cette échelle à un modèle encore plus grand appelé Qwen-CUA-Max (avec plus d'un trillion de paramètres), le score est monté à 87,6.

L'une des choses les plus fascinantes de cet article est la façon dont il gère les tâches longues et compliquées. Imaginez essayer de se souvenir d'une histoire lue il y a une semaine tout en écrivant un nouveau chapitre. L'IA devait se souvenir de l'apparence de l'écran de nombreuses étapes auparavant pour savoir où elle en était dans sa tâche. Les chercheurs ont résolu cela en dotant l'IA d'une « mémoire visuelle » qui conserve les 20 dernières captures d'écran et en « repliant » intelligemment les plus anciennes dans un résumé, afin qu'elle ne soit pas submergée. Cela a permis à l'IA de garder son calme lors de flux de travail prolongés sans oublier le début de l'histoire.

L'article a également examiné la sécurité. Ils ont testé l'IA contre « RedTeamCUA », un défi où l'IA est piégée par de fausses instructions cachées dans l'écran. Le nouveau modèle était bien meilleur pour ignorer ces ruses, faisant chuter le taux de réussite des attaques de 36,6 % à 16,4 %, tout en accomplissant ses propres tâches.

Enfin, les chercheurs ont exploré une approche « hybride ». Ils ont découvert que si l'on laissait l'IA utiliser un outil de ligne de commande (comme une baguette magique textuelle pour les opérations de fichiers) parallèlement à ses compétences de souris et de clavier, elle pouvait terminer les tâches plus rapidement. Cependant, l'IA changeait parfois d'outil au mauvais moment, donc bien qu'elle soit plus rapide, elle n'était pas encore toujours parfaite. Les auteurs suggèrent qu'avec plus d'entraînement, ce mélange d'observation visuelle et de commandes textuelles pourrait être la clé pour rendre les agents d'IA véritablement efficaces.

En bref, cet article montre que nous n'avons pas besoin de ponts spéciaux pour connecter l'IA à nos ordinateurs. En apprenant à l'IA à simplement regarder l'écran et à agir comme un humain, nous pouvons construire des agents prêts à s'attaquer à presque n'importe quel logiciel, des applications les plus récentes aux programmes les plus anciens, tout en apprenant grâce à d'énormes quantités de pratique réelle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →