DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA
Ce document présente la soumission de DS@GT ARC pour le CLEF 2026 LongEval, qui soutient que si les modèles de pointe excellent dans la fluidité, un pipeline correctif combinant un filtrage pré-génération et des vérifications d'implication post-génération est nécessaire pour améliorer la fidélité des citations et l'ancrage des réponses dans le domaine du questionnement scientifique, soulignant la nécessité de mesures d'évaluation qui privilégient un ancrage strict plutôt que les scores de pertinence traditionnels.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : DS@GT ARC à LongEval
Énoncé du Problème
La connaissance scientifique est dynamique, évoluant à travers la recherche et les publications continues. Cette dérive temporelle pose des défis importants pour les systèmes de Génération Augmentée par Récupération (RAG), qui risquent de récupérer des informations obsolètes ou non pertinentes, de manquer de preuves ou de générer des réponses qui ne sont pas factuellement ancrées dans les documents sources fournis. Bien que le RAG soit théoriquement idéal pour le questionnement scientifique (QA) en exploitant des documents externes, les systèmes actuels souffrent souvent d'« erreurs liées à la récupération », incluant l'inclusion de documents distracteurs et la génération d'affirmations non fondées. Un fossé critique existe entre les métriques d'évaluation traditionnelles du langage naturel (qui favorisent la fluidité et le chevauchement lexical) et l'exigence d'une intégrité stricte des citations et d'un ancrage factuel dans les domaines scientifiques.
Méthodologie
L'équipe DS@GT ARC a participé à la tâche 4 de CLEF 2026 LongEval, qui utilisait le corpus de littérature scientifique CORE. La tâche fournissait une requête et un ensemble fixe de dix documents pré-récupérés, exigeant des participants qu'ils génèrent des réponses en langage naturel soutenues par des citations spécifiques de cet ensemble. L'équipe a évalué trois approches architecturales distinctes :
- Base Hybride DS@GT : Une implémentation RAG standard utilisant un récupérateur hybride (BM25 + plongements denses BGE) pour classer les segments sémantiques chevauchants. Les meilleurs segments ont été injectés directement dans un modèle Gemma-4-31B ajusté pour l'instruction afin de synthétiser la réponse.
- Pipeline RAG Correctif (CRAG) + CiteFix : Une architecture corrective à deux étapes conçue pour imposer l'ancrage :
- Pré-Génération : Un encodeur croisé léger (CRAG) évalue les segments récupérés par rapport à la requête, éliminant ceux qui ne respectent pas un seuil d'implication pour filtrer les distracteurs avant la génération.
- Post-Génération : CiteFix analyse les affirmations générées par rapport aux segments de documents cités. Les citations qui manquent d'implication pour soutenir les affirmations spécifiques sont élaguées, imposant une attribution stricte.
- Benchmarks de Modèles Frontières : Deux exécutions manuellement préparées utilisant des modèles de pointe (GPT-5.5 Thinking et Claude Opus 4.7 Thinking) qui contournent le découpage en segments et le scoring, synthétisant les réponses directement à partir du texte brut des dix documents candidats.
Stratégie d'Évaluation
L'équipe a employé un cadre de double évaluation :
- Métriques Officielles de la Tâche : Métriques standards incluant ROUGE et BERT pour la similitude lexicale/sémantique par rapport à un ensemble de référence caché, la Précision des Citations et la Couverture des Nuggets.
- Diagnostics RAGAs sans Référence : Une configuration de type LLM-as-judge (utilisant Claude Sonnet 4.6) pour mesurer la Fidélité Globale (ancrage des affirmations par rapport à l'ensemble du contexte des 10 documents), la Fidélité des Citations (ancrage des affirmations strictement par rapport aux documents cités) et la Pertinence de la Réponse.
Résultats Clés
L'évaluation a révélé une divergence significative entre les métriques de performance traditionnelles et l'ancrage factuel :
- Modèles Frontières : GPT-5.5 et Claude Opus 4.7 ont obtenu les scores les plus élevés sur les métriques officielles (ROUCE, BERT, Pertinence de la Réponse) et la Précision des Citations. Cependant, les diagnostics RAGAs ont exposé un mode de défaillance critique : ces modèles génèrent fréquemment des réponses hautement pertinentes en s'appuyant sur leur mémoire paramétrique plutôt que sur le contexte fourni. Par conséquent, ils présentent une faible Fidélité des Citations (par exemple, GPT-5.5 a obtenu 0,417), indiquant qu'ils hallucinent souvent des citations ou échouent à ancrer des détails spécifiques dans les documents récupérés.
- Pipeline Correctif : Le pipeline CRAG+CiteFix a obtenu la Fidélité Globale (0,784) et la Fidélité des Citations (0,758) les plus élevées parmi toutes les soumissions. Cependant, cette adhésion stricte à l'ancrage a entraîné des scores ROUGE et BERT plus faibles par rapport à la Base Hybride. Cette baisse est attribuée au comportement d'« abstention » du pipeline, où le système refuse de générer des réponses lorsque le contexte récupéré manque de preuves suffisantes, plutôt que de halluciner à partir de la mémoire paramétrique.
- Signification Statistique : Un test de Wilcoxon signé-rang sur les scores RAGAs a indiqué que les améliorations de la fidélité apportées par les interventions correctives n'étaient pas statistiquement significatives sur les 47 requêtes de test, suggérant des limitations potentielles des modèles NLI utilisés pour la vérification ou le réglage spécifique des interventions.
Signification et Conclusions
L'article soutient que l'évaluation des systèmes de QA RAG dignes de confiance nécessite un changement dans la conception des métriques. Les résultats démontrent que les modèles frontières peuvent maximiser la pertinence et la fluidité des réponses tout en échouant à utiliser le contexte fourni, un mode de défaillance que les métriques traditionnelles (ROUGE/BERT) ne parviennent pas à pénaliser. Inversement, les pipelines qui imposent un ancrage strict peuvent paraître moins performants sur les métriques de chevauchement lexical en raison de comportements d'abstention plus prudents.
Les auteurs concluent que sécuriser les pipelines de QA RAG dans les domaines scientifiques nécessite des métriques d'évaluation qui récompensent la sécurité structurelle et les modes de défaillance appropriés (tels que l'abstention) plutôt que la fluidité conversationnelle qui repose sur la mémoire paramétrique. Ils proposent que les futurs benchmarks doivent prioriser des métriques qui imposent un ancrage strict des réponses pour garantir que les affirmations scientifiques sont empiriquement soutenues par les documents de recherche cités.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.