← Derniers articles
🤖 machine learning

Building The Ph(ysical)AI Layer Of Machine Intelligence

Ce document propose un modèle de fondation fondé sur des principes, entraîné exclusivement sur des données de radiofréquence à l'aide de principes de la théorie du signal, qui parvient à un transfert transmodal zéro-shot efficace vers divers domaines tels que l'audio, l'image et le texte sans ajustement fin, démontrant ainsi que l'encodage des lois physiques permet une généralisation efficace tout en distinguant la compréhension physique de la compréhension sémantique.

Auteurs originaux : Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

Publié 2026-06-04
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot comment comprendre le monde.

La plupart des robots dotés d'une IA moderne apprennent en mémorisant des exemples. On leur montre des millions d'images de chats, de chiens et de voitures, et ils apprennent à les reconnaître en repérant des motifs statistiques. Si vous leur montrez ensuite une image d'un « chat » qu'ils n'ont jamais vu, ils pourraient être confus car le motif ne correspond pas parfaitement à leur mémoire. Ils sont excellents pour reconnaître ce qu'ils ont déjà vu, mais mauvais pour comprendre les règles de fonctionnement des choses.

Les chercheurs de ce document (du MIT Lincoln Laboratory) ont tenté une approche différente. Au lieu de mémoriser des exemples, ils ont enseigné à leur robot les lois fondamentales de la physique qui régissent tous les signaux.

Voici la décomposition simple de ce qu'ils ont fait et de ce qu'ils ont trouvé :

1. L'idée du « Traducteur Universel »

Considérez toutes les données du monde — la musique, la parole, les images, les ondes radio, les tremblements de terre — comme différents types de musique.

  • La parole est une chanson chantée par un humain.
  • Les ondes radio sont une chanson jouée par une machine.
  • Les tremblements de terre sont une chanson jouée par le sol.

Même si ces « chansons » sonnent différemment, elles suivent toutes les mêmes règles mathématiques de la physique. Elles ont toutes un rythme (temps), une hauteur (fréquence) et un volume (énergie).

Les chercheurs ont émis l'hypothèse que si on enseignait à une IA à comprendre ces règles musicales universelles, peu importerait l'instrument qui joue la chanson. L'IA devrait être capable de comprendre la « musique » d'une onde radio et d'utiliser ce savoir pour comprendre la « musique » d'une voix humaine ou d'une image, sans jamais avoir vu d'image ou entendu de voix auparavant.

2. L'entraînement : Apprendre sur de la « Statique Radio »

Pour tester cela, ils n'ont pas montré d'images de chats ou de livres à l'IA. Ils l'ont entraînée exclusivement sur des données de Radiofréquences (RF).

  • Pourquoi la radio ? Les signaux radio sont incroyablement complexes. Ils rebondissent sur les bâtiments, changent de vitesse et deviennent bruyants. C'est comme entraîner un musicien en lui faisant écouter une station de radio chaotique et bruyante pendant des heures. S'il peut apprendre à extraire la mélodie de ce désordre, c'est un très bon musicien.
  • Le résultat : L'IA a appris à décomposer ces signaux radio en leurs éléments de construction de base (fréquence, temps, énergie) en utilisant des règles mathématiques strictes (comme la Transformée de Fourier, qui est simplement une façon sophistiquée de dire « décomposer un son complexe en notes simples »).

3. Le tour de magie : Le transfert « Zero-Shot »

Une fois l'IA entraînée sur les ondes radio, les chercheurs ont gelé son cerveau. Ils ne l'ont pas laissée apprendre de nouvelles choses. Ils lui ont ensuite demandé d'accomplir des tâches qu'elle n'avait jamais vues auparavant :

  • Reconnaître des locuteurs (Est-ce une voix masculine ou féminine ?).
  • Identifier des instruments de musique (Est-ce une guitare ou un piano ?).
  • Classer des images (Est-ce un chat ou un chien ?).
  • Détecter des séismes (Est-ce une secousse ou un camion qui passe ?).

La surprise : Même si l'IA n'avait jamais vu d'image ou entendu de voix humaine pendant son entraînement, elle a obtenu des résultats étonnamment bons.

  • Elle était excellente pour les tâches basées sur la structure physique (comme reconnaître un émetteur radio spécifique ou un tremblement de terre spécifique). Elle a atteint environ 84,5 % de précision.
  • Elle était bonne, mais pas parfaite, pour les tâches basées sur le sens humain (comme deviner le genre d'une chanson ou le sujet d'un texte). Elle a atteint environ 70 % de précision.

4. La grande découverte : La frontière entre le « Physique » et le « Sens »

Le document souligne un point crucial sur la raison pour laquelle l'IA a bien réussi certaines tâches et moins bien d'autres.

  • Tâches physiques (Le « Comment ») : L'IA a appris la physique du signal. Elle sait qu'un certain type de tremblement de terre crée un certain motif de vibration, tout comme un certain type de radio crée un certain motif de signal. Comme les lois de la physique sont les mêmes partout, l'IA a pu transférer ce savoir parfaitement.
  • Tâches sémantiques (Le « Quoi ») : L'IA a eu du mal avec les choses qui nécessitent un contexte humain. Par exemple, savoir qu'une chanson est du « Jazz » n'est pas seulement une question d'ondes sonores ; c'est une question de culture et d'histoire humaines. L'IA a appris la forme du son, mais pas l' histoire qui se cache derrière.

L'analogie :
Imaginez que l'IA soit un architecte chevronné.

  • Si vous lui montrez le plan d'une maison (données radio), elle apprend les règles de la gravité, des poutres et des fondations.
  • Si vous lui montrez ensuite le plan d'un pont (données de séisme) ou d'un barrage (sismologie), elle pourra instantanément comprendre comment le construire car la physique est la même.
  • Cependant, si vous lui demandez de concevoir une maison au style « victorien » ou « moderne », elle pourrait éprouver des difficultés. Elle sait comment construire la structure, mais elle ne comprend pas le style ou la signification culturelle de ces mots.

5. Pourquoi c'est important

Les chercheurs ont construit un nouveau type d'IA appelé PlanFormer.

  • Efficacité : Il est minuscule comparé aux autres modèles d'IA célèbres (comme CLIP). Il possède 76 fois moins de paramètres (cellules cérébrales) mais affiche des performances tout aussi bonnes sur les tâches physiques.
  • La « Couche Physique » : Ils proposent de construire l'IA par couches. D'abord, construire une « Couche Physique » qui comprend les lois de l'univers (énergie, symétrie, ondes). Ensuite, construire une « Couche Sémantique » par-dessus pour comprendre le sens humain.

Résumé

Le document affirme que vous n'avez pas besoin de montrer des millions d'images à une IA pour lui apprendre à voir. Si vous lui enseignez les lois mathématiques du fonctionnement des signaux (en utilisant les ondes radio comme terrain d'entraînement), elle peut naturellement comprendre la structure physique des images, des sons et des vibrations.

C'est comme apprendre à quelqu'un à nager en le faisant pratiquer dans une piscine avec des courants spécifiques. Une fois qu'il maîtrise la physique de l'eau, il peut nager dans l'océan, un lac ou une rivière, même s'il n'a jamais vu ces étendues d'eau auparavant. Il aura juste besoin d'un peu d'aide supplémentaire pour apprendre la « culture » de l'océan (la sémantique), mais la natation (la physique) vient naturellement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →