← Derniers articles
💻 computer science

SciClaimSeekers at CheckThat! 2026: Retrieving Scientific Sources for Social Media Claims with LLM Reranking

Le système SciClaimSeekers présenté dans cet article répond au défi de la vérification des affirmations scientifiques sur les réseaux sociaux en employant un pipeline de recherche hybride combinant BM25 et E5 multilingue avec la fusion de rangs réciproques (Reciprocal Rank Fusion), suivi d'un reclassement par Qwen2.5-14B-Instruct, lequel a atteint un MRR@5 de 64,39 % sur l'ensemble de test de la tâche 1 de CLEF-2026 CheckThat! et a démontré que de tels pipelines soigneusement construits peuvent rivaliser avec les approches de fine-tuning.

Auteurs originaux : Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

Publié 2026-07-29
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez l'internet comme une bibliothèque géante et chaotique où n'importe qui peut crier un « fait » depuis le sommet d'une tour. Parfois, ces cris sont vrais, mais souvent, ce ne sont que des rumeurs ou des malentendus de la science réelle. Le problème est que lorsque les gens partagent ces idées scientifiques sur les réseaux sociaux, ils apportent rarement avec eux le livre original ou le rapport de l'expert. C'est comme si quelqu'un disait : « J'ai lu que manger du brocoli donne une force surhumaine », mais refusait de vous dire dans quel livre il l'a lu. Cela rend difficile la vérification de savoir si l'histoire est vraie ou s'il s'agit d'un mythe inventé. Les scientifiques et les vérificateurs de faits ont besoin d'un moyen de trouver le « code source » original de ces affirmations — le véritable article de recherche caché dans la vaste bibliothèque de l'écriture académique. C'est le défi de la « recherche de source » : prendre un post de réseau social désordonné et informel et trouver le papier scientifique formel et spécifique dont il essayait de parler.

Le document que vous allez lire, intitulé « SciClaimSeekers at CheckThat! 2026 », décrit un nouveau système ingénieux conçu pour résoudre ce puzzle exact. Les chercheurs ont créé une équipe de détectives numériques appelée SciClaimSeekers. Considérez ce système comme un processus en trois étapes pour trouver le bon livre dans une bibliothèque de 10 000 articles scientifiques. Premièrement, il utilise deux différents « moteurs de recherche » simultanément : un qui recherche des correspondances de mots exacts (comme trouver un livre parce que le titre contient le mot « brocoli ») et un autre qui comprend le sens de la phrase (comme trouver un livre parce qu'il parle de « force surhumaine » même si le mot « brocoli » n'y figure pas). Deuxièmement, il combine les listes des deux moteurs de recherche pour créer une liste unique et plus courte des candidats les plus probables. Enfin, et surtout, il utilise un cerveau d'Intelligence Artificielle (IA) puissant pour lire le post des réseaux sociaux et les meilleurs candidats un par un, en demandant : « Est-ce le papier dont ce post parle ? » et en lui attribuant un score.

L'équipe a découvert que cette étape du « cerveau d'IA » était la véritable magie. Tandis que les deux premières étapes ont aidé à réduire le champ des recherches, l'étape de reclassement par l'IA a considérablement augmenté le taux de réussite du système. Sur un ensemble de test de publications de réseaux sociaux, leur système a correctement identifié le bon article scientifique parmi les cinq meilleures suppositions dans 64,39 % des cas. Ce fut un bond énorme — environ 13,6 points de pourcentage de mieux qu'en utilisant simplement le moteur de recherche de correspondance de mots simple. Les résultats suggèrent que l'utilisation de ces grands modèles d'IA pré-entraînés dans un pipeline soigneux et par étapes est un moyen très solide de vérifier les affirmations scientifiques, même sans avoir besoin d'entraîner une IA personnalisée à partir de zéro. Le système est si efficace qu'il s'est classé 11e sur 37 équipes lors d'une compétition internationale majeure, prouvant que ce mélange de recherche simple et de lecture intelligente par l'IA fonctionne bien pour connecter le bruit des réseaux sociaux à la vérité scientifique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →