← Derniers articles
💰 quantitative finance

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

Cet article présente UniFinEval, le premier benchmark multimodal unifié couvrant le texte, les images et les vidéos à travers cinq scénarios financiers fondamentaux, lequel révèle que bien que les modèles actuels comme Gemini-3-pro-preview dominent en termes de performance, ils accusent encore un retard significatif par rapport aux experts financiers dans la gestion d'informations à haute densité et de raisonnements complexes.

Auteurs originaux : Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin
Publié 2026-02-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous recrutiez un nouvel assistant pour aider à diriger une immense société d'investissement aux enjeux colossaux. Cet assistant doit être un « super-analyste » capable de lire d'épais rapports financiers, d'interpréter des graphiques complexes, de regarder des heures de vidéos d'analyses de marché, puis de prendre des décisions intelligentes sur l'endroit où placer l'argent.

Pendant longtemps, nous avons testé ces assistants IA avec des quiz simples — comme leur demander de lire un paragraphe unique ou d'identifier un graphique simple. Mais dans le monde réel, la finance est chaotique. C'est comme essayer de naviguer sur un océan déchaîné tout en lisant une carte, en écoutant une diffusion radio et en regardant un flux vidéo en direct, tout cela en même temps. Les anciens tests étaient trop faciles et ne reflétaient pas le chaos du véritable métier.

Entrez dans « UniFinEval » : Le Bootcamp Financier Ultime

Les auteurs de ce document ont créé un nouveau test super exigeant appelé UniFinEval. Voyez cela comme un « cours de survie » pour les modèles d'IA, conçu spécifiquement pour voir s'ils peuvent gérer l'environnement de haute pression et de surcharge d'informations de la finance réelle.

Voici comment ils ont construit ce bootcamp :

1. Les cinq niveaux du bootcamp

Au lieu de poser un seul type de question, le test est divisé en cinq scénarios réalistes, de plus en plus difficiles :

  • Niveau 1 : Le Détective (Audit des états financiers) : Imaginez un détective examinant une scène de crime désordonnée. L'IA doit trouver de minuscules incohérences dans un rapport financier chargé de texte, de graphiques et de mises en page confuses. C'est comme trouver une seule faute de frappe dans un document de 100 pages pendant que quelqu'un vous crie des distractions à l'oreille.
  • Niveau 2 : L'Enquêteur (Raisonnement fondamental de l'entreprise) : Maintenant, l'IA doit déterminer si une entreprise est réellement en bonne santé. Elle doit extraire des chiffres de différents rapports, effectuer des calculs complexes et établir des liens entre une description textuelle et un graphique. C'est comme résoudre un puzzle dont les pièces sont dans des langues différentes.
  • Niveau 3 : Le Détecteur de Tendances (Perspectives de tendances sectorielles) : L'IA prend du recul. Elle ne regarde plus une seule entreprise, mais un secteur entier. Elle doit comparer des dizaines d'entreprises au fil du temps pour repérer de grands schémas. C'est comme regarder un match de football et prédire le vainqueur en se basant sur la performance de chaque joueur sur le terrain, et pas seulement sur la star de l'équipe.
  • Niveau 4 : Le Radar (Détection des risques financiers) : C'est la partie effrayante. L'IA doit regarder une vidéo d'un analyste de marché en train de parler tout en lisant un rapport et en regardant un graphique. Elle doit repérer les dangers cachés (les risques) qui sont enfouis dans le bruit. C'est comme essayer d'entendre un murmure dans un ouragan.
  • Niveau 5 : Le Général (Analyse de l'allocation d'actifs) : Le niveau du boss final. L'IA doit prendre tout ce qu'elle a appris lors des quatre niveaux précédents pour prendre une décision finale sur la manière d'investir l'argent, en équilibrant tous les risques et toutes les règles. C'est le moment où le Général doit décider où envoyer les troupes.

2. Les règles du jeu

  • Pas de triche : Les questions du test n'ont pas été écrites par d'autres IA (qui peuvent faire des erreurs ou mentir). Elles ont été écrites par de véritables experts humains — des personnes possédant des diplômes avancés et des années d'expérience en finance.
  • Le mélange : Le test utilise ensemble du texte, des images et des vidéos. Vous ne pouvez pas simplement lire la réponse ; vous devez « voir » le graphique et « regarder » la vidéo pour comprendre le contexte.
  • La taille : Ils ont créé près de 4 000 de ces questions difficiles, en anglais et en chinois.

3. Les résultats : Qui a réussi ?

Les chercheurs ont soumis 10 des modèles d'IA les plus intelligents (les « étudiants ») à ce bootcamp. Voici ce qui s'est passé :

  • Le meilleur performeur : Un modèle, Gemini-3-pro-preview, est arrivé en tête. Il a répondu correctement à environ 74 % des questions. Cela semble bien, mais rappelez-vous, c'est un test très difficile.
  • L'écart : Même la meilleure IA a commis beaucoup d'erreurs par rapport à un expert humain, qui a obtenu environ 90-95 % de bonnes réponses. L'IA est douée pour lire le texte, mais elle a du mal lorsqu'elle doit faire le lien entre une vidéo, un graphique et un rapport.
  • Les difficultés :
    • Problèmes de mathématiques : Beaucoup de modèles ont fait des erreurs de calcul simples.
    • Hallucinations : Certains modèles ont inventé des faits qui n'existaient pas (comme un étudiant qui devine la réponse parce qu'il a peur de dire « je ne sais pas »).
    • Le problème de la « vidéo » : Lorsque des vidéos étaient impliquées, la plupart des modèles s'y perdaient. Ils ne parvenaient pas à suivre l'évolution de l'histoire dans le temps.
    • Le Boss Final : Dans le niveau le plus difficile (Allocation d'actifs), la performance de l'IA a chuté de manière significative. Elles pouvaient rassembler l'information, mais elles ne pouvaient pas prendre la décision finale complexe sans se perdre.

4. La grande conclusion

Le document conclut que, bien que l'IA devienne très performante pour lire et comprendre des données financières simples, elle n'est pas encore prête à remplacer les experts financiers humains dans des situations réelles et complexes.

Voyez cela ainsi : l'IA est comme un étudiant brillant capable de mémoriser toute une bibliothèque de manuels scolaires. Mais quand vous le placez dans une véritable salle de commandement avec un flux vidéo en direct, une main qui tremble et un compte à rebours, il commence à paniquer et à commettre des erreurs.

Les auteurs ont créé UniFinEval pour montrer précisément l'IA échoue, afin que les développeurs puissent corriger ces faiblesses spécifiques avant de confier ces modèles à de l'argent réel. Ils n'ont pas dit que l'IA allait bientôt diriger la bourse ; ils ont dit : « Voici une carte des falaises, afin que nous sachions où l'IA est susceptible de tomber. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →