← Derniers articles
🤖 machine learning

Improving Relative Representations with Learned Anchors and Whitened Inner Products

Cet article propose un cadre robuste pour la communication entre modèles qui améliore les représentations relatives traditionnelles en apprenant des prototypes d'ancres sémantiques et en employant une métrique de similitude sensible à la géométrie, permettant ainsi un transfert d'informations stable et quasi sans perte entre des architectures neuronales hétérogènes.

Auteurs originaux : Oscar Thorsted Svendsen, Nikolaj Holst Jakobsen, Fabian Mager, Hiba Nassar

Publié 2026-06-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Oscar Thorsted Svendsen, Nikolaj Holst Jakobsen, Fabian Mager, Hiba Nassar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez deux traducteurs différents qui parlent la même langue mais utilisent des dictionnaires et des structures de phrases complètement différents. Un traducteur (Modèle A) décrit un « roi » comme une figure haute et dorée, tandis que l'autre (Modèle B) décrit un « roi » comme une figure courte et bleue. Si vous essayez de donner au Modèle B une note écrite par le Modèle A, il ne la comprendra pas car les coordonnées ne correspondent pas.

C'est le problème que les Représentations Relatives tentent de résoudre. Au lieu de forcer le Modèle A et le Modif B à se mettre d'accord sur les coordonnées exactes d'un « roi », ils s'accordent sur un ensemble de points de repère (ancres). Ils disent : « D'accord, peu importe la façon dont vous dessinez la carte, à quelle distance le "roi" se trouve-t-il de la "reine" et du "château" ? » Si les deux modèles s'accordent sur les distances par rapport à ces points de repère, ils peuvent communiquer, même si leurs cartes internes sont totalement différentes.

Cependant, l'ancienne méthode présentait deux défauts majeurs, que ce papier corrige avec un nouveau système appelé PARAM et WIP.

Le problème de l'ancienne méthode

  1. Points de repère aléatoires : L'ancienne méthode choisissait les points de repère en lançant des fléchettes sur une carte. Parfois, vous choisissiez un groupe de fléchettes qui atterrissaient au même endroit (redondance), ou vous manquiez de larges zones de la carte. Cela signifiait que la « traduction » était souvent floue ou perdait des détails importants.
  2. Le mauvais instrument de mesure : L'ancienne méthode utilisait une règle qui ne mesurait que les angles (direction) mais ignorait la distance (magnitude). Imaginez essayer de mesurer une pièce où le sol est étiré de manière inégale. Si vous ne regardez que l'angle d'un coin, vous pourriez penser qu'une petite pièce étirée est la même qu'une grande pièce normale. Cela faisait que la « traduction » se brisait lorsque les modèles étaient très différents l'un de l'autre (comme un petit modèle de langage parlant à un géant).

La nouvelle solution : PARAM et WIP

1. PARAM : Apprendre les meilleurs points de repère

Au lieu de lancer des fléchettes au hasard, les auteurs apprennent à l'ordinateur à apprendre les points de repère parfaits.

  • L'analogie : Imaginez que vous essayiez de décrire une ville à un ami. Au lieu de choisir des coins de rue au hasard, vous demandez à la ville elle-même : « Où se trouvent les hubs les plus importants et les plus stables qui représentent toute la zone ? »
  • Comment ça marche : Le système crée des points de repère en faisant la moyenne de groupes de points de données. Cela lisse le bruit (comme moyenner quelques photos tremblantes pour obtenir une image claire). Ces nouveaux points de repère sont des « prototypes sémantiques robustes » : ils sont stables, couvrent uniformément toute la carte et ne sont pas confus par les particularités d'un modèle spécifique.

2. WIP : L'instrument de mesure intelligent

Les auteurs ont remplacé l'ancienne règle « uniquement basée sur l'angle » par un Produit Intérieur Blanchi (WIP - Whitened Inner Product).

  • L'analogie : Pensez à l'ancienne règle comme un élastique qui s'étire et se contracte selon la personne qui le tient. Si le Modèle A étire l'espace et que le Modèle B l'écrase, l'élastique donnera une mauvaise réponse.
  • Comment ça marche : La nouvelle règle WIP est « blanchie ». Avant la mesure, elle aplatit mathématiquement l'élastique. Elle corrige l'étirement, l'écrasement et le décalage. Crucialement, elle prête également attention à la force d'un signal (magnitude), et pas seulement à la direction dans laquelle il pointe. Cela permet aux modèles de conserver les détails importants (comme le degré de « confiance » du modèle) que l'ancienne méthode jetait.

Les résultats : Une traduction « sans perte »

Les auteurs ont testé cela en essayant de connecter différents types de modèles d'IA :

  • Vision : Ils ont connecté un CNN (un type de modèle d'image) avec un Transformer (un modèle d'image différent et plus moderne).
  • Langage : Ils ont connecté différents modèles de langage (comme des variantes de BERT qui parlent différentes langues : anglais, allemand, français, etc.).
  • Petit vs Grand : Ils ont même connecté de minuscules modèles de langage à des modèles beaucoup plus grands.

Le résultat :
Par le passé, essayer de recoudre ces modèles ensemble entraînait un désastre (le nouveau modèle devinait de manière aléatoire). Avec PARAM et WIP, les modèles communiquent presque parfaitement.

  • Ils ont obtenu une stitching zero-shot : Vous pouviez entraîner un outil sur les données du Modèle A et l'utiliser immédiatement sur les données du Modèle B sans réentraînement.
  • La performance était presque identique à l'utilisation directe du modèle original. C'était comme si la « traduction » était sans perte — aucune information n'a été perdue dans le processus.

Résumé

Ce papier introduit une nouvelle façon de faire communiquer différents modèles d'IA entre eux.

  1. Arrêtez de deviner les points de repère : Apprenez les points de référence les plus stables et les meilleurs (PARAM).
  2. Utilisez un meilleur instrument de mesure : Utilisez un outil de mesure qui prend en compte l'étirement et la contraction des données (WIP).

Le résultat est un système universel « plug-and-play » où vous pouvez remplacer le cerveau (encodeur) d'une IA par un autre, et le reste du système fonctionne parfaitement sans avoir besoin d'être réentraîné.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →