← Derniers articles
🤖 AI

A Better Spur Should Start From Each Objective

L'article propose l'Optimisation de Préférence Multi-Marginale (MMPO), un cadre de précision qui traite la rareté des récompenses et les conflits d'optimisation dans l'apprentissage par renforcement multi-objectif en conditions réelles en intervenant aux niveaux des données, du gradient et des contraintes afin d'atteindre un alignement stable et de haute performance à travers diverses tâches.

Auteurs originaux : Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Publié 2026-09-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le marché numérique, une page produit est souvent un mur de texte dense, chargé de spécifications techniques et de jargon marketing qui peut submerger un acheteur. Pour combler le fossé entre l'information complexe et la compréhension humaine, l'intelligence artificielle est de plus en plus chargée d'un double travail : identifier les mots les plus importants d'une description de produit, puis rédiger une explication courte et claire pour ceux-ci. Il ne s'agit pas simplement d'un exercice d'édition de texte ; c'est un exercice d'équilibre. Le système doit satisfaire des règles hors ligne strictes, comme s'assurer que les mots extraits sont précis et couvrent toute la gamme des caractéristiques du produit, tout en poursuivant simultanément des objectifs en ligne tels que maximiser les clics des utilisateurs et minimiser les avis négatifs. Ces objectifs tirent souvent dans des directions opposées. Une caractéristique qui génère de nombreux clics peut être trop générique pour être précise, tandis qu'un terme technique hautement précis peut être trop obscur pour intéresser un navigateur occasionnel. Lorsque les programmes informatiques tentent d'optimiser tous ces objectifs conflictuels à la fois, ils trébuchent souvent, oscillant sauvagement ou restant bloqués dans une boucle où l'amélioration d'une métrique provoque l'effondrement d'une autre.

Des chercheurs de l'Institut de technologie de Harbin, de JD.com et de l'Académie chinoise des sciences ont développé une nouvelle méthode pour résoudre ce problème spécifique d'objectifs conflictuels. Ils appellent leur approche l'Optimisation de Préférence Multi-Marginale (Multi-Marginal Preference Optimization), un système conçu pour empêcher l'ordinateur de traiter tous les objectifs comme un seul tas de données désordonnées. Au lieu de forcer le modèle à trouver une seule « meilleure » réponse qui fait compromis sur tout, le nouveau cadre traite chaque objectif comme une voie distincte sur une autoroute. Il nettoie d'abord les données qu'il reçoit, lissant les signaux bruyants et épars provenant du comportement réel des utilisateurs, tels que les clics et les mentions « j'aime », qui peuvent être trompeurs s'ils sont pris au premier degré. En ajustant la façon dont l'ordinateur perçoit ces récompenses, le système garantit que les informations rares mais précieuses ne sont pas ignorées simplement parce qu'elles apparaissent moins souvent que les termes communs.

L'innovation centrale réside dans la manière dont le système gère le processus d'apprentissage lui-même. Lorsque l'ordinateur tente d'améliorer ses performances, il génère des mises à jour mathématiques basées sur ses objectifs. Dans les anciennes méthodes, ces mises à jour étaient simplement additionnées, ce qui faisait souvent que les instructions pour un objectif annulaient ou déformaient les instructions pour un autre. La nouvelle méthode sépare ces mises à jour avant qu'elles ne soient appliquées. Elle identifie quelles parties du signal d'apprentissage sont essentielles pour l'exactitude de base et lesquelles sont spécifiques aux préférences des utilisateurs, puis elle projette les signaux de préférence dans un espace où ils n'interfèrent pas avec les règles fondamentales. Cela permet au modèle d'apprendre à être plus intéressant pour les utilisateurs sans oublier accidentellement comment être précis.

De plus, les chercheurs ont ajouté un mécanisme de sécurité pour empêcher le système de devenir trop agressif lors de la phase finale de son entraînement. À mesure que les modèles s'améliorent, ils peuvent parfois se fixer intensément sur un objectif au point de négliger les autres, entraînant une chute soudaine de la qualité globale. Le nouveau système utilise la capacité du modèle à suivre des instructions pour définir une limite. Il demande au modèle de générer des exemples de comportement parfait dans des conditions idéales et utilise ces exemples pour définir une zone de sécurité pour les mises à jour futures. Si le modèle tente de pousser trop fort dans une direction, ce guide interne le ramène doucement, garantissant que le progrès reste constant et équilibré à travers toutes les métriques.

Les résultats de cette approche ont été testés sur un ensemble de données de produits d'e-commerce réels, impliquant 65 232 produits d'entraînement et 8 879 produits d'évaluation, ainsi que des données de comportement des utilisateurs collectées au cours des trois derniers mois. Le système a été comparé à plusieurs autres méthodes avancées et s'est révélé nettement plus stable et efficace. Lors des tests hors ligne, il a atteint un score de complétude de 94,11 % et une précision de 73,43 %, surpassant largement les méthodes précédentes. Crucialement, il a réussi à atteindre un taux de couverture cible de 22,82 %, ce qui est presque parfait, alors que les autres méthodes soit n'atteignaient pas l'objectif, soit le dépassaient. Ces améliorations n'étaient pas seulement théoriques ; lorsqu'il a été déployé lors d'un test en ligne en direct avec de vrais acheteurs, le système piloté par cette nouvelle méthode a augmenté le nombre de commandes passées de 3,14 % et la valeur totale de ces commandes de 5,07 % par rapport à l'ancien standard.

Le succès de ce cadre s'étend au-delà du shopping en ligne. Les chercheurs l'ont également appliqué à des tâches impliquant l'utilisation d'outils et la génération de code informatique, des domaines où plusieurs contraintes doivent être respectées simultanément. Dans ces tests, la méthode a systématiquement produit de meilleurs résultats que les approches standards, particulièrement en évitant le « effondrement de mode » (mode collapse) où un modèle trouve une solution facile unique et la répète indéfiniment. Au lieu de cela, le nouveau système a maintenu une gamme diversifiée de sorties de haute qualité tout en respectant des règles strictes. En découplant les objectifs conflictuels et en fournissant une manière structurée de les équilibrer, ce travail offre une solution pratique pour rendre l'intelligence artificielle plus fiable dans des environnements réels complexes, où de multiples objectifs concurrents sont la norme.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →