← Derniers articles
💬 NLP

A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding

Cet article présente XMPIE, un nouveau benchmark parallèle multilingue et multimodal de haute qualité contenant plus de 10 000 expressions potentiellement idiomatiques dans 34 langues, conçu pour évaluer et comparer la compréhension des idiomes par les modèles de traitement du langage naturel à travers différentes langues et modalités (texte et image).

Auteurs originaux : Dilara Torunoğlu-Selamet, Dogukan Arslan, Rodrigo Wilkens, Wei He, Doruk Eryiğit, Thomas Pickard, Adriana S. Pagano, Aline Villavicencio, Gülşen Eryiğit, Ágnes Abuczki, Aida Cardoso, Alesia Lazarenka
Publié 2026-02-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dilara Torunoğlu-Selamet, Dogukan Arslan, Rodrigo Wilkens, Wei He, Doruk Eryiğit, Thomas Pickard, Adriana S. Pagano, Aline Villavicencio, Gülşen Eryiğit, Ágnes Abuczki, Aida Cardoso, Alesia Lazarenka, Dina Almassova, Amalia Mendes, Anna Kanellopoulou, Antoni Brosa-Rodríguez, Baiba Saulite, Beata Wojtowicz, Bolette Pedersen, Carlos Manuel Hidalgo-Ternero, Chaya Liebeskind, Danka Jokić, Diego Alves, Eleni Triantafyllidi, Erik Velldal, Fred Philippy, Giedre Valunaite Oleskeviciene, Ieva Rizgeliene, Inguna Skadina, Irina Lobzhanidze, Isabell Stinessen Haugen, Jauza Akbar Krito, Jelena M. Marković, Johanna Monti, Josue Alejandro Sauca, Kaja Dobrovoljc, Kingsley O. Ugwuanyi, Laura Rituma, Lilja Øvrelid, Maha Tufail Agro, Manzura Abjalova, Maria Chatzigrigoriou, María del Mar Sánchez Ramos, Marija Pendevska, Masoumeh Seyyedrezaei, Mehrnoush Shamsfard, Momina Ahsan, Muhammad Ahsan Riaz Khan, Nathalie Carmen Hau Norman, Nilay Erdem Ayyıldız, Nina Hosseini-Kivanani, Noémi Ligeti-Nagy, Numaan Naeem, Olha Kanishcheva, Olha Yatsyshyna, Daniil Orel, Petra Giommarelli, Petya Osenova, Radovan Garabik, Regina E. Semou, Rozane Rebechi, Salsabila Zahirah Pranida, Samia Touileb, Sanni Nimb, Sarfraz Ahmad, Sarvinoz Sharipova, Shahar Golan, Shaoxiong Ji, Sopuruchi Christian Aboh, Srdjan Sucur, Stella Markantonatou, Sussi Olsen, Vahide Tajalli, Veronika Lipp, Voula Giouli, Yelda Yeşildal Eraydın, Zahra Saaberi, Zhuohan Xie

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🌍 Le Grand Défi des Expressions "Cachées"

Imaginez que vous essayez de comprendre une langue étrangère. Si quelqu'un vous dit : "Il a les doigts verts", vous pourriez penser qu'il a la peau verte ou qu'il a manipulé de la chlorophylle. Mais en réalité, cela signifie qu'il est très doué pour le jardinage.

C'est ce qu'on appelle une expression idiomatique (ou un idiome). C'est un mot ou une phrase dont le sens réel est "caché" derrière les mots littéraux. C'est comme un code secret que seule la communauté qui parle cette langue comprend.

Le problème, c'est que les intelligences artificielles (les robots qui parlent) ont beaucoup de mal avec ces codes. Elles sont très fortes pour les faits bruts, mais elles se perdent souvent dans les métaphores, les blagues et les expressions culturelles.

🎨 XMPIE : Le "Musée" des Expressions du Monde

Les auteurs de ce papier ont créé quelque chose d'extraordinaire appelé XMPIE. Pour faire simple, imaginez que c'est un immense musée numérique ou un grand jeu de cartes géant.

Voici ce qui le rend spécial :

  1. C'est multilingue (34 langues) : Au lieu de se limiter à l'anglais ou au français, ce musée contient des expressions de 34 langues différentes, allant du turc au swahili, en passant par le luxembourgeois et le gaélique. C'est comme avoir un guide touristique pour 34 pays différents en même temps.
  2. C'est multimodal (Texte + Images) : C'est là que ça devient magique. Pour chaque expression (comme "avoir les doigts verts"), le projet ne propose pas seulement le texte. Il propose cinq images différentes :
    • Une image qui montre le sens caché (un jardinier heureux).
    • Une image qui montre le sens littéral (quelqu'un avec de la vraie peinture verte sur les doigts).
    • Des images "pièges" qui sont proches mais pas tout à fait justes.
    • Une image totalement au hasard.

L'analogie du test de vision :
Imaginez que vous montrez à un robot une expression comme "Casser du sucre sur le dos de quelqu'un" (dire du mal de quelqu'un).

  • Si le robot voit une image de quelqu'un qui casse du sucre, il va dire : "Ah, c'est ça !" (C'est le sens littéral).
  • Si le robot voit une image de deux personnes qui chuchotent méchamment, il devrait dire : "Ah, c'est ça !" (C'est le sens idiomatique).
  • Le but de XMPIE est de voir si le robot peut faire la différence entre les deux, et ce, dans 34 langues différentes.

🧩 Comment ont-ils fait ? (La recette de cuisine)

Au lieu de demander à des ordinateurs de deviner, ils ont fait appel à 89 experts humains (des locuteurs natifs de chaque langue).

  1. La graine : Ils ont commencé avec des expressions anglaises (les "graines").
  2. La traduction créative : Les experts ont cherché l'équivalent dans leur langue. Parfois, c'est identique (comme "pomme pourrie" en turc pour "bad apple"). Parfois, c'est totalement différent (en turc, on dit "mouton pourri" pour la même idée !).
  3. La peinture numérique : Ils ont utilisé une IA génératrice d'images (Midjourney) pour créer les illustrations, mais avec des instructions très précises écrites par les humains pour s'assurer que l'image correspondait exactement au sens voulu.

🤖 Ce que les robots ont appris (et où ils échouent)

Les chercheurs ont testé un robot très intelligent (un modèle de vision par ordinateur) sur ce jeu de cartes. Voici ce qu'ils ont découvert, et c'est assez drôle :

  • Le robot est un littéraliste borné : Quand on lui montre l'expression "pomme pourrie", il regarde l'image d'une pomme pourrie et dit : "Oui, c'est ça !". Il adore le sens littéral.
  • Il rate le sens caché : Il a beaucoup de mal à comprendre que "pomme pourrie" signifie "une personne mauvaise". Il obtient un score très bas pour le sens idiomatique.
  • Le paradoxe : Même si le robot est très bon pour classer les images (il met les bonnes images en haut de la liste), il ne sait pas pourquoi elles sont bonnes. Il manque de "culture" et de contexte.

🚀 Pourquoi c'est important ?

Ce papier nous dit une chose cruciale : Pour qu'une intelligence artificielle comprenne vraiment les humains, elle ne doit pas seulement lire des mots ou voir des images. Elle doit comprendre la culture.

XMPIE est comme un terrain d'entraînement pour les robots. En leur montrant comment les humains utilisent les images et les mots pour dire des choses qui ne sont pas littérales, on espère un jour créer des IA qui ne se tromperont plus quand on leur dira "Il pleut des cordes" (au lieu de penser qu'il y a de vraies cordes qui tombent du ciel).

En résumé : C'est un projet géant qui utilise des images et 34 langues pour apprendre aux ordinateurs à ne pas prendre les métaphores au premier degré, un peu comme un enfant qui apprend à comprendre les blagues de ses parents.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →