Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
Cet article met en évidence une lacune critique dans les benchmarks de raisonnement à long contexte en démontrant que les évaluations courantes ne contrôlent pas la position des tâches, ce qui entraîne une baisse significative des performances lorsque celles-ci sont placées au milieu de contextes longs en raison d'interférences de remplissage, et propose le cadre d'évaluation Context Rot (CRE) pour combler cette angle mort structurel.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La Grande Idée : Le Problème du « Siège du Milieu »
Imaginez que vous demandiez à un étudiant très intelligent de résoudre un problème de mathématiques. Vous lui donnez un manuel massif (le « contexte ») de 64 000 pages.
- L'Ancienne Méthode : Si vous placez le problème de mathématiques à la toute dernière page du livre, l'étudiant le résout correctement presque à chaque fois.
- La Nouvelle Découverte : Ce document révèle que si vous déplacez ce même problème de mathématiques au milieu du livre, l'étudiant oublie soudainement comment le résoudre. Ses performances peuvent chuter de 96 % de justesse à seulement 8 %.
Les auteurs appellent cela l'« Échec Positionnel ». Ils soutiennent que, bien que nous disposions d'excellents tests pour vérifier si un étudiant peut trouver un fait spécifique dans un livre (comme l'aiguille dans une botte de foin), nous n'avons pas testé s'il peut raisonner à travers un problème lorsqu'il est enfoui au milieu d'un long texte.
L'Enquête : Audit des Tests
Les chercheurs ont agi comme des détectives et examiné 11 tests « long contexte » populaires utilisés pour noter les modèles d'IA.
- La Découverte : Aucun de ces tests ne contrôle l'emplacement de la question. Ils utilisent simplement des documents naturels où la question se trouve par hasard au début, au milieu ou à la fin.
- La Vérification des Vendeurs : Ils ont également examiné les « bulletins » officiels (fiches de modèle) de quatre grandes entreprises d'IA (DeepSeek, MiMo, Kimi, GLM).
- Le Résultat : Ces entreprises affichent fièrement leurs scores sur les tâches de codage et d'agents (comme « pouvez-vous écrire un programme ?») dans de grands tableaux en gras.
- Le Point Aveugle : Elles ne montrent presque jamais leurs scores pour le « raisonnement contrôlé par la position ». Elles cachent le fait que leurs modèles pourraient échouer lamentablement lorsqu'une question se trouve au milieu d'un long document.
L'Expérience : Le Test « Pourriture du Contexte »
Pour prouver qu'il ne s'agissait pas d'un simple hasard, les auteurs ont créé un nouveau test appelé CRE (Évaluation de la Pourriture du Contexte). Imaginez cela comme un test de résistance de la capacité d'attention de l'IA.
Ils ont pris deux types de questions :
- Des problèmes de mathématiques (GSM8K)
- Des choix multiples scientifiques (ARC-Challenge)
Ils ont ensuite créé trois scénarios différents de « bruit de fond » (contenu de remplissage) pour voir ce qui distrait l'IA :
- Le « Aide-devoirs » (with_solutions) : Le texte de fond contenait d'autres problèmes de mathématiques avec leurs réponses écrites.
- Les « Questions sans réponse » (questions_only_v2) : Le texte de fond contenait d'autres problèmes de mathématiques sans réponses.
- Le « Bruit Aléatoire » (neutral_text) : Le texte de fond était composé d'articles aléatoires de Wikipédia sur les chats et l'histoire.
Ils ont testé 9 modèles d'IA différents à trois différentes « longueurs de livre » : 8K, 32K et 64K jetons.
Les Résultats Choc
Les résultats ont montré que certains modèles sont incroyablement fragiles, tandis que d'autres sont résistants.
1. L'Effondrement du « Siège du Milieu »
Pour certains modèles (comme MiMo-v2-Flash), déplacer la question de la fin du livre au milieu a provoqué une chute massive des performances.
- À une longueur de 64K avec le bruit « Aide-devoirs », le modèle a chuté de 88 points de pourcentage. Il est passé d'un génie (96 % de précision) à une réussite à peine suffisante (8 % de précision) simplement parce que la question a été déplacée au milieu.
- Pourquoi ? Le document a révélé que lorsque le modèle échouait au milieu, il copiait souvent la mauvaise réponse du bruit de fond. C'était comme si l'étudiant se confondait avec les autres problèmes de devoirs placés à côté de la question principale.
2. Les Modèles « Immuns »
Tous les modèles n'ont pas échoué. DeepSeek-V3.2 était presque immunisé contre ce problème lorsque le bruit était « Aide-devoirs ». Il a répondu correctement à la question, qu'elle soit à la fin ou au milieu. Cependant, lorsque le bruit était « Questions sans réponse », même ce modèle puissant a commencé à avoir du mal.
3. Les Modèles « Plus Récents »
Les auteurs ont testé quatre modèles entièrement nouveaux et améliorés des mêmes entreprises.
- Bonne Nouvelle : Ils sont légèrement meilleurs pour gérer le bruit « Aide-devoirs » au milieu.
- Mauvaise Nouvelle : Ils continuent de lutter fortement avec les « Questions sans réponse » au milieu. Le problème n'est pas résolu ; il a simplement changé de forme.
Le Diagnostic « Tour de Magie »
Pour prouver qu'il s'agissait vraiment de la position et non simplement du modèle étant « stupide », les chercheurs ont effectué un tour de passe-passe.
- Ils ont placé le problème de mathématiques au milieu (là où le modèle échoue habituellement).
- Ensuite, ils ont copié et collé le même problème exact tout à la fin du livre.
- Résultat : Soudain, le modèle a donné la bonne réponse !
Cela prouve que le modèle sait résoudre le problème. Il ne peut tout simplement pas le trouver ou se concentrer dessus lorsqu'il est enfoui au milieu. C'est comme une personne qui peut résoudre un puzzle s'il est sur son bureau, mais si vous le cachez sous une pile de papiers, elle oublie qu'elle l'a.
La Conclusion
Le document conclut que la façon actuelle dont nous testons l'IA est brisée.
- Le Vide : Nous ne testons l'IA que sur les « bords » des longs documents (là où ils performent bien). Nous ignorons le « milieu », où ils échouent souvent.
- Le Risque : Si une entreprise dit : « Notre IA est précise à 95 % sur les longs documents », mais qu'ils n'ont testé les questions qu'à la toute fin, ce chiffre est trompeur. L'IA pourrait être inutile pour des tâches réelles où les informations importantes sont enfouies au milieu.
En bref : Le fait qu'une IA puisse lire un long livre ne signifie pas qu'elle peut trouver la réponse au milieu. Nous devons commencer à tester le « milieu » pour avoir une image vraie de l'intelligence réelle de ces modèles.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.