Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks
Cette étude introduit le jeu de données UzHistQA et démontre que, bien que la génération augmentée par la recherche réduise considérablement les hallucinations dans le domaine des questions-réponses sur l'histoire ouzbèke, l'imposition de mécanismes de citation et d'abstention est nécessaire pour éliminer complètement les réponses fabriquées, soulignant la nécessité d'évaluer séparément la qualité de la recherche et la fidélité de la génération dans les langues à faibles ressources.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans la salle de classe moderne, les élèves se tournent de plus en plus vers l'intelligence artificielle pour expliquer des concepts difficiles, résumer des chapitres ou préparer des examens. Ces assistants numériques sont basés sur des modèles de langage de grande taille, des systèmes entraînés sur de vastes quantités de textes capables de générer des réponses fluides, convaincantes et souvent assurées. Cependant, un risque distinct émerge lorsqu'un élève pose une question dont il ne connaît pas encore la réponse : il manque de connaissances pour vérifier la réponse reçue. Si le système invente un fait, l'erreur passe inaperçue et l'élève apprend quelque chose de faux. Pour remédier à cela, des chercheurs ont développé une méthode appelée génération augmentée par récupération. Au lieu de s'appuyer uniquement sur la mémoire interne du modèle, le système recherche d'abord un document de confiance spécifique — comme un manuel scolaire — pour trouver le passage pertinent avant de répondre. Cela permet de maintenir la réponse ancrée dans la réalité, mais cela ne garantit pas la perfection. Le système peut encore échouer à trouver le bon passage, ou il peut trouver le bon passage et l'ignorer, ou bien il peut mal interpréter ce qu'il a trouvé.
Cette incertitude est particulièrement aiguë en ouzbek, une langue parlée par des millions de personnes mais considérée comme étant à « faibles ressources » dans le monde de l'intelligence artificielle. Contrairement à l'anglais, qui domine les données utilisées pour entraîner ces modèles, l'ouzbek dispose de moins de textes numériques disponibles. De plus, l'ouzbek est une langue agglutinante, ce qui signifie qu'une seule racine peut être modifiée par de nombreuses terminaisons différentes pour créer une vaste gamme de formes de surface. Un élève interrogeant sur l'« indépendance » pourrait utiliser une forme de mot qui semble complètement différente de celle utilisée dans le manuel, provoquant l'échec total du système de recherche. Jusqu'à présent, il n'existait aucune méthode standard pour tester l'efficacité de ces systèmes pour l'histoire ouzbeke ou pour mesurer la fréquence de leurs inventions.
Une étude récente menée par le chercheur indépendant Ruzimboy Kholmurotov comble cette lacune en construisant un ensemble de tests spécifique appelé UzHistQA, basé sur un manuel officiel d'histoire de la classe de troisième couvrant les années 1917 à 1991. Le chercheur a analysé le manuel et a identifié un obstacle linguistique majeur : sur près de 31 000 mots dans le livre, plus de la moitié des formes de mots uniques n'apparaissaient qu'une seule fois. Cette variété extrême signifie qu'une simple recherche de correspondances exactes de mots est susceptible d'échouer. Pour tester comment surmonter cela, l'étude a créé 56 questions, incluant certaines auxquelles le manuel ne pouvait tout simplement pas répondre, afin de voir si le système admettrait son ignorance ou inventerait une réponse. Le cherchenaire a ensuite comparé quatre façons différentes de faire fonctionner le système : une qui reposait uniquement sur sa mémoire interne, une qui cherchait dans le manuel via une recherche sémantique standard, une qui combinait cela avec une recherche par mots-clés, et une version finale qui était strictement instruite de citer sa source et de refuser de répondre si les preuves manquaient.
Les résultats furent frappants. Lorsque le système se reposait uniquement sur sa mémoire interne sans consulter le manuel, il formulait des affirmations non étayées ou inventées dans 91 % de ses réponses. Il fabriquait avec assurance des dates, des noms et des listes pour des questions que le manuel ne couvrait pas. Lorsque le système était contraint de consulter le manuel en premier, le taux de ces affirmations non étayées chutait de manière spectaculaire pour atteindre seulement 9 %. Cela a confirmé que l'ancrage des réponses dans le texte réel est essentiel pour la fiabilité. Cependant, l'étude a également révélé une complication surprenante. La version utilisant la méthode de recherche la plus sophistiquée, qui combinait la compréhension sémantique et la correspondance par mots-clés, trouvait en fait les passages corrects plus souvent que la recherche plus simple. Pourtant, malgré la découverte de meilleures preuves, ce système avancé produisait plus d'affirmations non étayées que le plus simple. Il semble que lorsque le système récupère un ensemble de passages plus large et plus diversifié, l'information supplémentaire confonde le modèle, le menant à faire des inférences ou des calculs incorrects même lorsque les faits sont présents.
La configuration la plus efficace pour la sécurité fut celle qui imposait des règles strictes : le système devait citer la page spécifique pour chaque affirmation et recevait l'instruction de dire « Je ne sais pas » si le manuel ne contenait pas la réponse. Cette approche a éliminé toutes les réponses fabriquées pour les questions auxquelles le manuel ne pouvait pas répondre. Le revers de la médaille fut que le système a refusé de répondre à 14 % des questions qu'il aurait pu traiter, parfois même lorsque la réponse était présente dans le texte récupéré. Le chercheur conclut que, dans un cadre éducatif, ce refus est une caractéristique nécessaire. Un élève qui reçoit un « Je ne sais pas » peut demander de l'aide à un enseignant, mais un élève qui reçoit une réponse fabriquée avec assurance apprend une erreur et n'a aucun moyen de savoir qu'elle est fausse. L'étude établit que si la génération augmentée par récupération rend ces systèmes viables pour l'éducation en ouzbek, elle nécessite une conception minutieuse pour empêcher le système d'halluciner, et elle souligne que trouver la bonne information et rédiger une réponse correcte sont deux défis distincts qui doivent être mesurés indépendamment.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.