← Derniers articles
💻 computer science

An Inter-variable Relationship-Aware Mixture-of-Experts Model for Stock Closing-Price Prediction

Le papier propose IR-MoE, un Transformer de type Mixture-of-Experts sensible aux relations inter-variables qui modélise explicitement les dépendances dynamiques entre les variables de trading et emploie un routage parcimonieux avec une stratégie d'entraînement mélangée par action afin d'atteindre une précision de prévision supérieure et une généralisation zero-shot à travers divers marchés boursiers mondiaux.

Auteurs originaux : Zhenjiang Chen, Bin Liu, Pei-Gen Ye, Yang Lv, Jun Zheng

Publié 2026-09-23
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhenjiang Chen, Bin Liu, Pei-Gen Ye, Yang Lv, Jun Zheng

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Prédire le prix futur d'une action est l'un des défis les plus persistants de la finance. Le marché est un lieu chaotique, influencé par tout, des nouvelles mondiales et des politiques gouvernementales à l'humeur collective de millions d'investisseurs. Pour cette raison, les cours des actions ne progressent pas selon des lignes simples et droites ; ils sont bruyants, erratiques et en constante mutation. Depuis des décennies, des experts tentent de trouver des modèles dans ce chaos, en examinant souvent un ensemble standard de cinq chiffres quotidiens : le prix à l'ouverture du marché, le point le plus haut atteint, le point le plus bas, le prix à la clôture et le volume total d'actions échangées. La difficulté ne réside pas seulement dans le suivi de ces chiffres au fil du temps, mais dans la compréhension de la manière dont ils communiquent entre eux. Une hausse de prix accompagnée d'un volume d'échanges important raconte une histoire différente d'une hausse avec peu de volume, pourtant de nombreux modèles informatiques traitent ces cinq chiffres comme des flux de données distincts et sans lien entre eux.

La question fondamentale à laquelle les chercheurs sont confrontés est de savoir si un programme informatique unique peut apprendre les règles complexes et changeantes du marché boursier suffisamment bien pour les appliquer à de nouvelles actions inconnues sans avoir besoin d'être réentraîné de zéro. Les méthodes traditionnelles peinent souvent ici, soit en échouant à capturer les relations subtiles entre le prix et le volume, soit en devenant si spécialisées pour une entreprise spécifique qu'elles ne peuvent pas s'adapter à une autre. Cette limitation rend difficile la construction d'un outil universel d'analyse d'investissement capable de fonctionner dans différents pays et conditions de marché.

Dans une étude récente, une équipe de chercheurs de l'Institut de technologie de Pékin a proposé une nouvelle approche pour résoudre ce problème. Ils ont développé un système appelé IR-MoE, qui signifie Inter-variable Relationship-Aware Mixture-of-Experts (Mélange d'experts sensible aux relations inter-variables). Le nom décrit exactement ce que fait le système : il est conçu pour être conscient de la manière dont les différentes variables de trading sont liées les unes aux autres, et il utilise un « mélange d'experts » pour effectuer des prédictions. Au lieu de forcer l'ordinateur à apprendre une règle unique et rigide pour toutes les actions, ce système permet à différentes parties du modèle de se spécialiser dans différentes conditions de marché. Il repose sur l'idée que, bien que chaque action soit unique, la façon dont le prix et le volume interagissent suit souvent des modèles reconnaissables qui peuvent être appris et transférés.

Les chercheurs ont commencé par rassembler une quantité massive de données historiques provenant de quatre marchés financiers distincts : le marché des actions A de Chine, les États-Unis, Hong Kong et le Japon. Ils ont sélectionné des centaines d'actions représentatives de ces régions, couvrant un large éventail d'industries et de comportements de marché. Plutôt que d'entraîner un modèle séparé pour chacune de ces centaines d'actions, ils ont injecté toutes les données dans un système unique et unifié. Cette stratégie d'« entraînement par union » a permis au modèle d'apprendre des dynamiques de marché partagées, telles que le fait qu'une poussée du volume de transactions signale souvent un changement de direction du prix, qu'il s'agisse d'une action basée à Shanghai ou à New York.

Le cœur de leur système est une architecture en deux parties. La première partie se concentre sur la compréhension des relations entre les cinq chiffres quotidiens. Les chercheurs ont traité chaque chiffre — ouverture, plus haut, plus bas, clôture et volume — comme une information distincte, ou « jeton » (token), et ont utilisé un mécanisme inspiré des modèles de langage modernes pour les laisser interagir. Cela a permis au système d'apprendre explicitement, par exemple, que le prix de clôture est fortement influencé par le volume de transactions de la journée. En visualisant ces interactions, les chercheurs ont constaté que le modèle prêtait systématiquement une attention particulière au volume lorsqu'il tentait de comprendre les mouvements de prix. Cette attention n'était pas aléatoire ; elle était plus forte pendant les périodes de haute volatilité, suggérant que le modèle avait appris que le volume devient un indice plus critique lorsque le marché est turbulent.

La seconde partie du système est le « mélange d'experts ». Imaginez une équipe de spécialistes, chacun étant expert dans un type spécifique de comportement de marché, tel qu'une tendance haussière régulière, un krach soudain ou un mouvement latéral calme. Lorsque le système reçoit les données d'une nouvelle action, il ne demande pas à tous les spécialistes de donner leur avis. Au lieu de cela, un mécanisme de routage examine les conditions de marché actuelles et sélectionne uniquement quelques experts les plus pertinents pour effectuer la prédiction. Cela permet au système de s'adapter instantanément à différentes situations. Si le marché se comporte de manière erratique, il peut faire appel à des experts formés sur des modèles de haute volatilité ; si le marché est calme, il peut s'appuyer sur ceux formés sur des tendances stables. Cette flexibilité est ce qui permet au modèle de gérer la nature diverse et changeante des marchés boursiers mondiaux.

Les résultats de l'étude ont été testés sur les quatre marchés, incluant un test rigoureux où le modèle devait prédire les prix d'actions qu'il n'avait jamais vues auparavant, sans entraînement supplémentaire. Dans ces tests « zero-shot » (apprentissage zéro), le nouveau système a surpassé plusieurs méthodes existantes, y compris des modèles complexes qui décomposent les données en morceaux plus petits et d'autres systèmes d'intelligence artificielle avancés conçus pour la prévision de séries temporelles. Sur le marché des actions A chinoises, le modèle a atteint un taux d'erreur de prédiction d'environ 1,10 %, tandis que sur le marché américain, il a atteint un taux d'erreur d'environ 1,32 %. Ces chiffres étaient systématiquement meilleurs que les meilleures alternatives de l'étude.

Plus significativement encore, le modèle a prouvé qu'il pouvait transférer ses connaissances à travers les frontières. Lorsque le système, entraîné sur des données d'actions chinoises, a été appliqué directement à des actions inédites aux États-Unis, à Hong Kong et au Japon, il a maintenu une grande précision. Cela suggère que les relations fondamentales entre le prix et le volume sont suffisamment universelles pour être apprises une fois et appliquées partout. Les chercheurs ont également découvert que le système fonctionnait mieux lorsqu'il était entraîné sur un nombre diversifié mais gérable d'actions. L'ajout de données aidait au début, mais au-delà d'un certain point, les bénéfices diminuaient, indiquant que la clé résidait dans la couverture d'une grande variété de comportements de marché plutôt que dans le simple fait de nourrir le système avec davantage de chiffres.

Pour s'assurer que le système fonctionnait correctement, les chercheurs ont également examiné comment les « experts » étaient utilisés. Ils ont constaté que, sans un mécanisme d'équilibrage spécifique, le système avait tendance à trop compter sur quelques experts, laissant les autres inactifs. En ajoutant une règle qui forçait le système à répartir le travail de manière plus équitable, ils ont garanti que les parties spécialisées du modèle soient toutes actives et en apprentissage. Cette attention aux détails dans le processus d'entraînement a été cruciale pour la stabilité et la performance du système.

L'étude conclut qu'en modélisant explicitement la manière dont les variables de trading interagissent et en utilisant une équipe flexible de prédicteurs spécialisés, il est possible de construire un outil plus robuste et adaptable pour la prévision boursière. Les chercheurs suggèrent que leur approche offre une voie prometteuse pour l'analyse financière, une voie qui s'éloigne des modèles rigides et à usage unique pour tendre vers des systèmes capables de comprendre le langage complexe et changeant du marché. Bien que l'étude ne prétende pas avoir résolu le mystère du marché boursier, elle démontre qu'une compréhension plus profonde des relations entre les données de trading quotidiennes peut mener à des prédictions plus précises et généralisables. Ce travail ouvre la porte à de futures recherches qui pourraient incorporer d'autres types de données, tels que les rapports de presse ou les détails de trading intrajournaliers, afin d'affiner davantage notre capacité à naviguer dans le monde financier.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →