← Derniers articles
💬 NLP

TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding

Cet article introduit VES-Bench, un nouveau benchmark pour auditer si les méthodes de compréhension de vidéos longues décodent des images couvrant toutes les preuves nécessaires, et propose TRACE, un agent sans entraînement qui construit de manière itérative des ensembles de preuves pour atteindre une précision de réponse supérieure avec des coûts de trames nettement inférieurs par rapport au décodage uniforme.

Auteurs originaux : Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

Publié 2026-08-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Regarder une vidéo longue pour répondre à une question spécifique est une tâche qui semble simple pour un humain, mais qui reste étonnamment difficile pour l'intelligence artificielle. Lorsqu'une personne regarde un film, elle ne se contente pas de voir un flux d'images ; elle construit une carte mentale des événements, se souvenant qu'un personnage a ramassé une clé dans le premier acte et que cette clé a été utilisée pour ouvrir une porte dans la scène finale. Les systèmes informatiques actuels, cependant, éprouvent souvent des difficultés avec ce genre de compréhension à long terme. Ils peuvent regarder quelques instantanés de la vidéo et deviner la réponse, ou ils peuvent essayer de lire un résumé textuel de l'intrigue et passer totalement à côté des détails visuels. Le problème central est que de nombreuses questions sur de longues vidéos dépendent de preuves éparpillées à travers différents moments du temps. Si un système manque ne serait-ce qu'un seul de ces moments éparpillés, il ne peut pas connaître la vérité, pourtant il peut tout de même produire une réponse qui semble correcte et convaincante par simple supposition. Ce fossé entre ce qu'un système prétend savoir et ce qu'il a réellement vu est le défi central que les chercheurs tentent de résoudre.

Une équipe de chercheurs a introduit une nouvelle approche appelée TRACE, conçue pour forcer l'intelligence artificielle à regarder les bonnes parties d'une vidéo avant de répondre. Au lieu de s'appuyer sur des résumés textuels ou de deviner en se basant sur quelques images aléatoires, TRACE agit comme un observateur attentif qui construit sa réponse pièce par pièce. Il commence par scanner la vidéo pour trouver de petits clips spécifiques, ou « ancres », qui semblent pertinents pour la question. Il regroupe ensuite ces clips et demande au système de répondre à la question en se basant uniquement sur ce qu'il a vu jusqu'à présent. Le système ne s'arrête pas là. Il continue d'ajouter de nouveaux clips à sa collection et de reposer la question. Le processus se poursuit uniquement jusqu'à ce que la réponse cesse de changer, indiquant que le système a rassemblé suffisamment de preuves visuelles pour être certain. Crucialement, le système vérifie son propre travail en rejouant l'ensemble final de clips une dernière fois pour s'assurer que la réponse tient la route. Cette méthode garantit que la réponse finale n'est pas une supposition basée sur une vue partielle, mais une conclusion fondée sur un ensemble complet de faits visuels.

Pour tester si cette méthode fonctionne réellement, les chercheurs ont créé un nouveau terrain d'essai appelé VES-Bench. Il s'agit d'une collection de 600 questions tirées de 348 vidéos publiques, couvrant des tâches telles que déterminer l'ordre dans lequel les événements se sont produits ou compter combien de fois une action spécifique s'est produite. Contrairement aux tests précédents qui vérifiaient seulement si la réponse finale était juste ou fausse, VES-Bench audite le processus lui-même. Il suit précisément quelles images de la vidéo le système a regardées avant de prendre sa décision. Le test vérifie si le système a réellement vu chaque moment requis pour répondre correctement à la question. Si un système obtient la bonne réponse mais a manqué une scène cruciale, l'audit le marque comme un échec, car la réponse n'était pas véritablement soutenue par les preuves. Cette évaluation stricte révèle que de nombreuses méthodes existantes réussissent souvent par chance, répondant correctement sans avoir vu toutes les parties nécessaires de la vidéo.

Lorsque les chercheurs ont appliqué TRACE à ce test rigoureux, les résultats ont montré un avantage clair. Utilisant la même technologie de base que d'autres systèmes avancés, TRACE a répondu correctement à 50,7 % des questions tout en garantissant qu'il avait vu au moins deux images distinctes de chaque scène requise. En comparaison, d'autres méthodes qui regardaient un nombre similaire d'images échouaient souvent à couvrir toutes les scènes nécessaires, ou devaient regarder plus de deux fois plus d'images pour atteindre le même niveau de certitude. TRACE a atteint ce haut niveau de précision tout en utilisant moins de 100 images par question en moyenne, une fraction du coût requis par les systèmes qui scannent simplement la vidéo à un rythme uniforme. L'étude a révélé que la clé du succès n'était pas seulement de regarder plus de données, mais de savoir quand arrêter de regarder. En attendant que la réponse se stabilise et en revérifiant les preuves visuelles brutes, TRACE a évité le piège de la supposition basée sur des informations incomplètes.

Les chercheurs ont également découvert que le simple fait d'augmenter le nombre d'images qu'un système regarde ne conduit pas toujours à de meilleures réponses. Lorsqu'ils ont testé des systèmes standards qui regardaient de plus en plus d'images, la précision s'améliorait jusqu'à un certain point, après quoi l'ajout d'images n'aidait plus. Cela suggère que le problème n'est pas un manque de données, mais un manque de stratégie pour savoir quelles données sont importantes. TRACE a résolu cela en utilisant une « trajectoire » de preuves, où le système apprend à reconnaître quand il a rassemblé suffisamment d'informations pour être sûr. L'étude confirme que pour les vidéos longues, la capacité à localiser et à intégrer des moments visuels spécifiques est plus importante que le simple fait de traiter une quantité massive de vidéo à la fois. En ancrant les réponses dans des clips visuels bruts et en ne s'arrêtant que lorsque les preuves sont complètes, TRACE démontre une manière plus fiable pour les machines de comprendre le monde tel qu'il se déroule dans le temps.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →