← Derniers articles
💻 computer science

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack est un cadre de travail sans entraînement qui améliore l'efficacité des grands modèles de langage omnimodaux en combinant la suppression de la redondance structurelle pré-LLM avec le raffinement sémantique post-interaction, atteignant des compromis performance-efficacité supérieurs à travers de multiples bancs d'essai tout en réduisant considérablement les coûts computationnels.

Auteurs originaux : Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

Publié 2026-08-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot super intelligent comment comprendre le monde. Vous ne lui donnez pas seulement un livre à lire ; vous lui montrez un film et jouez une bande sonore en même temps. C'est le monde passionnant de l'IA « Omni-modale », où les ordinateurs apprennent à voir, entendre et lire tout cela à la fois. Mais voici le hic : les films et les bandes sonores sont énormes. Une seule seconde de vidéo ou d'audio peut être décomposée en des milliers de petites « briques » numériques appelées jetons (tokens). Si vous essayez de donner un film entier au robot, il est submergé, comme un étudiant qui essaierait de lire toute une bibliothèque en une minute. Cela prend un temps infini, coûte une fortune en électricité et le robot finit souvent par être confus par le volume colossal d'informations. Les scientifiques ont essayé de résoudre ce problème en jetant les briques « ennuyeuses » avant même que le robot ne commence sa lecture, espérant ne garder que les plus importantes. Cependant, les anciennes méthodes pour jeter les choses étaient un peu maladroites — elles éliminaient parfois des indices cruciaux simplement parce qu'ils paraissaient différents de leurs voisins, ou elles essayaient de deviner ce qui était important avant que le robot n'ait eu la chance de réellement comprendre l'histoire.

Entrez en scène OmniPack, une nouvelle stratégie ingénieuse conçue pour aider ces robots capables de tout voir et de tout entendre à travailler plus vite sans perdre la tête. Voyez OmniPack comme un processus d'édition en deux étapes pour un scénario de film chaotique. D'abord, avant même que le robot ne lise le scénario, OmniPack agit comme un éditeur rigoureux qui scanne les images brutes. Il ne se contente pas de supprimer les moments calmes ; il cherche les moments « forts » (comme un crash soudain ou un flash lumineux) et s'assure également de ne pas sauter les décors de fond importants et calmes qui se produisent loin dans le temps. Il regroupe les briques similaires pour qu'elles ne prennent pas d'espace supplémentaire, créant ainsi un « best-of » qui préserve la structure de l'histoire.

Mais la magie opère vraiment lors de la seconde étape. Une fois que le robot a commencé à lire le scénario et à se parler à lui-même, OmniPack intervient à nouveau. Cette fois, il écoute les questions du robot. Si le robot demande : « De quelle couleur était la voiture ? », OmniPack sait qu'il doit conserver les jetons liés à la voiture et à la couleur, même s'ils étaient discrets ou petits. Il utilise la propre curiosité du robot pour affiner l'information, fusionnant les détails les plus utiles. Le résultat est une réduction massive du travail que le robot doit accomplir. Sur un modèle spécifique appelé Qwen2.5-Omni-7B, OmniPack a réussi à réduire le travail requis à seulement 16,7 % de la quantité originale tout en conservant 98,0 % de l'intelligence d'origine du robot. Même lorsqu'ils ont poussé les limites en réduisant le travail à un infime 6,8 %, le robot se souvenait toujours de 92,9 % de ce qu'il était censé savoir. C'est comme si l'on réduisait une encyclopédie massive à un simple dépliant, mais que ce dépliant contenait pourtant toutes les réponses dont vous avez besoin.

Les chercheurs ont découvert que les anciennes méthodes échouaient souvent car elles tentaient de compresser les choses trop tôt ou de manière trop simple. Ils ont soutenu que le fait de jeter des jetons en se basant uniquement sur leur aspect « bruyant » ou « similaire » faisait manquer des indices importants et dispersés. Ils ont également montré que l'utilisation de l'audio pour compresser la vidéo (ou vice versa) avant que le robot n'ait eu la chance de mélanger ces deux sens ne fonctionnait pas bien. Au lieu de cela, OmniPack suggère une approche « spécialisée par étape » : d'abord, nettoyer la structure en fonction du type de média spécifique (vidéo ou audio), puis, après que le robot a eu la chance de les mélanger, utiliser la tâche ou la question spécifique pour effectuer la compression finale et intelligente.

Dans leurs tests sur cinq ensembles de défis différents, OmniPack a systématiquement battu toutes les autres méthodes auxquelles ils ont été comparés. Qu'il s'agisse de tester sur des clips courts ou des vidéos longues, la nouvelle méthode offrait toujours le meilleur équilibre entre vitesse et intelligence. Les auteurs suggèrent qu'en coordonnant ces deux étapes — un nettoyage structurel d'abord, puis un raffinement intelligent basé sur la question — ils peuvent rendre ces modèles d'IA puissants beaucoup plus efficaces sans avoir besoin de les réentraîner de zéro. C'est un moyen de rendre les robots super intelligents plus rapides et moins coûteux à exploiter, tout en les gardant affûtés même lorsque les vannes d'information sont grandes ouvertes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →