← Derniers articles
💻 computer science

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

Ce papier présente OneDrive, un cadre de conduite autonome unifié qui intègre des comportements de décodage hétérogènes au sein d'un seul transformateur basé sur un modèle vision-langage pré-entraîné, permettant ainsi d'atteindre des performances de pointe sur les benchmarks de conduite tout en réduisant la latence d'inférence.

Auteurs originaux : Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

Publié 2026-04-21
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de construire le cerveau d'une voiture autonome. Jusqu'à présent, les ingénieurs avaient un problème majeur : ils devaient utiliser deux cerveaux différents pour faire le même travail.

D'un côté, ils avaient un génie des langues (un modèle de type "Chatbot" ou VLM) qui était excellent pour comprendre des images et écrire des histoires, mais qui ne savait pas bien calculer des trajectoires précises. De l'autre, ils avaient un mathématicien rigide (un modèle de conduite classique) qui calculait parfaitement où aller, mais qui ne comprenait rien au langage naturel ni à la "réflexion" complexe.

Pour faire fonctionner une voiture, il fallait donc assembler ces deux cerveaux séparés, ce qui créait une machine lourde, lente et parfois confuse, comme un chef cuisinier qui doit crier ses instructions à un assistant qui ne parle pas sa langue.

Voici la solution proposée par le papier "OneDrive" :

1. L'Idée Géniale : Un Seul Cerveau Polyvalent

Les auteurs de OneDrive ont eu une idée brillante : pourquoi ne pas utiliser le même cerveau pour tout faire ?

Imaginez que vous avez un chef cuisinier (le modèle pré-entraîné) qui est un expert pour lire des recettes et décrire des plats. Au lieu de lui donner un assistant séparé pour couper les légumes, vous lui apprenez simplement à utiliser ses couteaux (les "queries" structurées) pour faire la cuisine en même temps qu'il décrit le plat.

Dans le monde de la voiture, cela signifie que le modèle utilise un seul et même transformateur (le cœur du cerveau) pour :

  • Voir la route (perception).
  • Penser à la trajectoire à suivre (planification).
  • Parler et expliquer ce qu'il fait (génération de texte).

2. Comment ça marche ? (L'Analogie du Train)

Pour comprendre la technique, imaginez un train qui transporte différents types de passagers dans le même wagon :

  • Les passagers "Images" : Ce sont les caméras de la voiture.
  • Les passagers "Questions" : Ce sont des questions comme "Où est le piéton ?", "Quelle est la ligne de la route ?" ou "Où dois-je aller dans 5 secondes ?".
  • Les passagers "Texte" : Ce sont les mots pour décrire la scène.

Dans les anciennes voitures, ces passagers étaient dans des wagons séparés et devaient se passer des notes à travers des fenêtres fermées. Dans OneDrive, tout le monde est dans le même wagon, assis côte à côte.

Le "chef de train" (l'attention causale du modèle) regarde tout le monde. Grâce à la magie de l'intelligence artificielle pré-entraînée, le passager "Question" peut naturellement regarder le passager "Image" pour comprendre la scène, sans avoir besoin d'un traducteur spécial. C'est comme si le cerveau de la voiture utilisait la même logique pour comprendre un mot et pour calculer une trajectoire.

3. Le Problème Résolu : La "Cuisine" vs La "Conduite"

Le papier explique un détail technique important :

  • Le cerveau des langues est entraîné à écrire mot par mot (séquentiellement).
  • La conduite doit souvent calculer tout en même temps (parallèlement) : où sont les voitures, les piétons, les lignes, etc.

Habituellement, ces deux façons de penser sont incompatibles. OneDrive a trouvé une astuce : il garde la logique de lecture du cerveau des langues (qui est très puissante) mais il ajoute de petits "outils" spécifiques pour les tâches de conduite. C'est comme si vous gardiez la même main pour écrire et pour conduire, mais vous utilisiez un stylo spécial pour écrire et un volant spécial pour conduire, tout en gardant la même dextérité.

4. Les Résultats : Plus Rapide et Plus Sûr

Grâce à cette unification, la voiture devient :

  • Plus rapide : Comme elle n'a pas besoin de faire passer les informations d'un cerveau à l'autre, elle réfléchit environ 40 % plus vite. C'est la différence entre un réflexe instantané et une hésitation dangereuse.
  • Plus sûre : Sur les tests réels (comme sur la base de données nuScenes), la voiture fait moins d'erreurs de trajectoire et a beaucoup moins d'accidents (collision rate de 0,18 %).
  • Plus intelligente : Elle peut non seulement conduire, mais aussi vous expliquer pourquoi elle freine ou tourne, comme un copilote humain.

En Résumé

OneDrive, c'est comme avoir un pilote unique qui est à la fois un expert en vision, un mathématicien de la trajectoire et un communicateur clair. Au lieu de faire travailler trois personnes différentes qui se parlent mal, on a une seule personne qui maîtrise tout, ce qui rend la voiture plus sûre, plus rapide et capable de comprendre le monde comme un humain le ferait.

C'est une étape majeure vers des voitures autonomes qui ne sont pas seulement des robots qui suivent des règles, mais des entités capables de raisonner, de voir et d'agir de manière cohérente.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →