← Derniers articles
🤖 machine learning

A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs

Ce papier introduit un nouvel opérateur de moyenne harmonique modifié pour calculer correctement les taux de récompense moyenne dans les processus semi-markoviens de décision non stationnaires, permettant ainsi des algorithmes d'apprentissage par renforcement sans modèle robustes qui surpassent les limitations des approches basées sur le ratio existantes.

Auteurs originaux : Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka

Publié 2026-05-07
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : le problème du « compteur de vitesse »

Imaginez que vous êtes un livreur essayant de déterminer quel itinéraire est le plus rapide. Vous avez deux options :

  • Itinéraire A : Vous parcourez 10 miles en 10 minutes.
  • Itinéraire B : Vous parcourez 20 miles en 20 minutes.

Les deux semblent prendre le même temps par mile (1 minute par mile). Mais que se passe-t-il si le trafic change ? Que se passe-t-il si l'itinéraire A est rapide le lundi mais se retrouve bloqué dans un embouteillage de 2 heures le mardi, tandis que l'itinéraire B reste constant ?

Dans le monde de l'Intelligence Artificielle (IA), et plus spécifiquement dans l'Apprentissage par Renforcement, les agents (comme les robots ou les bots de trading) doivent apprendre la meilleure « vitesse moyenne » (taux de récompense) sur un voyage long et infini. Le document soutient que les outils actuels utilisés par l'IA pour calculer cette vitesse moyenne sont défectueux lorsque le voyage est imprévisible.

L'ancienne méthode : l'erreur de la « moyenne des moyennes »

Le document examine deux méthodes existantes (appelées SMART et Relaxed-SMART) qui tentent de calculer la meilleure vitesse moyenne.

  • Le défaut : Ces méthodes calculent la vitesse moyenne en prenant la distance totale parcourue et en la divisant par le temps total passé.
    • Analogie : Imaginez que vous avez conduit 100 miles en 10 heures. Ils disent : « D'accord, votre vitesse moyenne est de 10 mph. »
    • Le problème : Cela fonctionne bien si votre vitesse est constante. Mais si votre vitesse varie considérablement (parfois vous êtes coincé dans les embouteillages pendant des heures, parfois vous filez sur l'autoroute), diviser simplement la distance totale par le temps total peut vous donner un chiffre trompeur. Cela traite un trajet de 10 minutes et un trajet de 10 heures comme « deux trajets » sans réaliser que le moment de la récompense compte.

Les auteurs montrent que si vos récompenses (argent gagné) et votre temps (durée d'une action) sont liés (par exemple, vous ne recevez de grosses récompenses que lorsque vous passez beaucoup de temps à attendre), les anciennes méthodes se trompent dans les calculs. Elles supposent que les deux sont sans rapport, comme mélanger des pommes et des oranges, alors qu'en réalité, ils sont souvent liés.

La nouvelle solution : la « moyenne harmonique »

Les auteurs proposent une nouvelle façon de calculer la moyenne, en utilisant un outil mathématique appelé la Moyenne Harmonique.

  • L'analogie : Imaginez conduire vers une destination et revenir.
    • Vous y allez à 20 mph.
    • Vous revenez à 40 mph.
    • Mauvaise mathématique (Moyenne arithmétique) : (20+40)/2=30(20 + 40) / 2 = 30 mph.
    • Bonne mathématique (Moyenne harmonique) : Parce que vous avez passé plus de temps à conduire à la vitesse lente (20 mph), votre vitesse moyenne réelle pour l'ensemble du trajet est plus proche de 20 que de 40. La bonne réponse est d'environ 26,7 mph.

La moyenne harmonique est la bonne façon de moyenner des taux (comme la vitesse ou le profit par minute). Cependant, il y a un piège : la moyenne harmonique standard échoue si vous avez une vitesse de zéro (on ne peut pas diviser par zéro) ou si vous avez des vitesses négatives (conduire en marche arrière). Dans la vie réelle, les agents d'IA obtiennent souvent des récompenses nulles ou perdent de l'argent (récompenses négatives).

L'innovation : la « Moyenne Harmonique Modifiée »

Pour réparer les mathématiques défectueuses, les auteurs ont inventé une Moyenne Harmonique Modifiée.

  • Comment ça marche : Imaginez une calculatrice intelligente qui sépare vos trajets en trois tas :
    1. Trajets positifs (vous avez gagné de l'argent).
    2. Trajets négatifs (vous avez perdu de l'argent).
    3. Trajets nuls (vous avez fait jeu égal).
  • Elle calcule la « moyenne harmonique » pour les trajets positifs et les trajets négatifs séparément. Ensuite, elle les combine, traitant les trajets « nuls » comme neutres.
  • Le résultat : Cette nouvelle calculatrice peut gérer des données désordonnées du monde réel où vous perdez parfois de l'argent, gagnez parfois de l'argent, et attendez parfois sans rien faire. Elle calcule correctement la vraie « vitesse » de vos récompenses, même lorsque l'environnement est chaotique.

Le nouvel algorithme : « Harmonic R-Learning »

En utilisant ces nouvelles mathématiques, les auteurs ont créé un nouvel algorithme d'apprentissage par IA appelé Harmonic R-Learning.

  • Ce qu'il fait : Il apprend à prendre des décisions dans des situations où les actions prennent des durées différentes (comme attendre qu'une action monte en valeur par rapport à la vendre immédiatement).
  • Pourquoi c'est mieux : Il ne se trompe pas lorsque la « récompense » et le « temps » sont liés. Il voit la vraie valeur d'une action, alors que les anciens algorithmes pourraient être trompés en pensant qu'une action lente et risquée est excellente simplement parce que la récompense totale était élevée.

La preuve : deux tests

Les auteurs ont testé leur nouvel algorithme contre les anciens dans deux scénarios :

  1. Le test de trafic « factice » : Ils ont créé une simulation informatique simple où un itinéraire semblait bon au début mais était en réalité un piège, et un autre itinéraire semblait lent mais était en réalité le gagnant sur le long terme.

    • Résultat : Les anciens algorithmes se sont confondus et ont choisi le mauvais itinéraire. Le nouveau Harmonic R-Learning a compris la supercherie et a choisi le bon.
  2. Le test de trading Bitcoin : Ils ont utilisé des données réelles du trading de Bitcoin. Le Bitcoin est sauvage ; les prix montent et descendent en flèche, et parfois vous gardez une position pendant longtemps, parfois pendant une seconde.

    • Résultat : Lorsque le temps passé et l'argent gagné étaient liés (un scénario réel courant), le nouvel algorithme a généré plus de profit que les anciens. Lorsqu'ils n'étaient pas liés, le nouvel algorithme a performé aussi bien que les anciens, prouvant qu'il n'y a pas de risque à l'utiliser.

Résumé

Le document dit : « L'ancienne façon de calculer les récompenses moyennes en IA consiste à moyenner des vitesses sans tenir compte du temps passé à chaque vitesse. Cela échoue lorsque le monde est désordonné. Nous avons inventé une nouvelle calculatrice de « Moyenne Harmonique Modifiée » qui gère les données désordonnées (zéros et négatifs) et donne à l'IA la bonne vitesse moyenne, l'aidant à prendre de meilleures décisions dans des environnements complexes et variables dans le temps. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →