← Derniers articles
🤖 machine learning

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV est un cadre de compréhension vidéo en streaming qui répond au défi des requêtes différées en maintenant une empreinte mémoire constante grâce à une approche hybride de mise en cache KV exacte pour la fenêtre proche et d'une mémoire d'état de résumé à capacité fixe pour le contenu historique, améliorant ainsi considérablement la précision par rapport aux bases de référence de rétention de jetons à mesure que les délais de requête augmentent.

Auteurs originaux : Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

Publié 2026-06-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un flux vidéo très long et continu, comme une caméra de surveillance fonctionnant 24 heures sur 24. Votre tâche est de répondre à des questions sur ce qui s'est passé dans cette vidéo. Le problème ? Vous avez un cerveau minuscule (une mémoire informatique limitée) et vous ne pouvez pas mettre la vidéo en pause pour revenir en arrière et tout revoir. Vous devez continuer à regarder tout en attendant que quelqu'un pose une question, ce qui peut arriver des minutes ou même des heures après un événement spécifique.

C'est le défi de la Compréhension Vidéo en Flux (Streaming Video Understanding).

Le Problème : Le Cerveau qui "Oublie"

La plupart des systèmes actuels tentent de résoudre cela en gardant une « fenêtre glissante » des dernières minutes de vidéo dans leur mémoire.

  • L'analogie : Imaginez que vous tenez un seau d'eau (votre mémoire). À mesure que de la nouvelle eau (les images de la vidéo) arrive, vous devez laisser sortir l'ancienne eau pour éviter que le seau ne déborde.
  • La faille : Si un événement crucial se produit (comme un voleur qui dérobe un portefeuille) et que 20 minutes de séquences ennuyeuses suivent avant que quelqu'un ne demande : « Avez-vous vu le voleur ? », l'ancienne eau (le voleur) a déjà été vidée du seau. Le système a oublié la réponse.

D'autres systèmes essaient de conserver une liste de « moments importants » (tokens) qu'ils ont sauvegardés. Mais si la vidéo est longue, ils doivent constamment décider quels moments sauvegardés jeter pour faire de la place aux nouveaux. S'ils jettent le mauvais moment, la réponse est perdue à jamais.

La Solution : ProtoKV (Le "Carnet de Notes Résumé")

Les auteurs proposent un nouveau système appelé ProtoKV. Au lieu d'essayer de sauvegarder chaque image ou seulement quelques moments spécifiques, ProtoKV utilise un système de mémoire en deux parties qui agit comme un carnet de notes intelligent.

1. Le "Passé Récent" (La Fenêtre Exacte)

Pour la partie la plus récente de la vidéo (disons, les dernières minutes), ProtoKV conserve une copie parfaite et en haute définition de tout.

  • L'analogie : C'est comme avoir une photo claire et haute résolution de ce qui s'est passé ces 5 dernières minutes. Si vous posez une question sur ce qui se passe en ce moment, la réponse est là, parfaitement nette.

2. Le "Passé Lointain" (La Banque de Prototypes)

Pour tout ce qui s'est passé avant cette fenêtre récente, ProtoKV arrête de sauvegarder des images individuelles. À la place, il crée des résumés.

  • L'analogie : Imaginez que vous regardez un défilé. Vous ne vous souvenez pas du visage de chaque personne il y a 2 heures. À la place, vous vous souvenez : « Il y avait une fanfare », « Il y avait un char avec un chat géant », et « Il y avait un groupe de personnes en chemises rouges ».
  • Comment ça marche : ProtoKV regroupe les choses similaires ensemble en « Prototypes ».
    • Si une personne marche, ProtoKV crée un résumé « Personne qui marche ».
    • Si cette personne marche pendant 10 minutes, le système ne sauvegarde pas 10 minutes de vidéo. Il met simplement à jour le résumé « Personne qui marche » pour dire : « Cette personne marche depuis longtemps ».
    • Il garde également une note « résiduelle » : « La plupart du temps, la personne marchait normalement, mais occasionnellement, elle a fait un signe de la main ». Cela capture la variété sans sauvegarder chaque pas.

Le Tour de Magie : Le "Token Fantôme"

Lorsqu'une question arrive enfin (par exemple, « Qu'a fait la personne en chemise rouge il y a 30 minutes ? »), le système doit transmettre cette information au modèle d'IA. Mais le modèle attend de voir de vraies images vidéo, pas seulement un résumé.

ProtoKV utilise un tour ingénieux appelé Pseudo-Tokens.

  • L'analogie : Imaginez que vous avez une note de résumé qui dit « Char du Chat Géant ». Pour montrer cela à l'IA, ProtoKV crée quelques images vidéo « fantômes » qui ressemblent au Char du Chat Géant en se basant sur les notes de résumé.
  • Ces fantômes ne sont pas de vraies images ; ce sont des reconstructions mathématiques du résumé. Le modèle d'IA voit ces fantômes et les traite exactement comme de vraies images vidéo.
  • Crucialement, le système compte combien de moments réels ont servi à construire ce résumé. Si le résumé du « Char du Chat Géant » a été construit à partir de 500 secondes de vidéo réelles, le système dit à l'IA : « Ce fantôme représente 500 secondes de preuves », afin que l'IA accorde plus d'attention à celui-ci.

Pourquoi est-ce meilleur ?

L'article affirme que ProtoKV est bien meilleur pour répondre à des questions sur des événements qui se sont produits il y a longtemps (délai élevé) par rapport aux autres méthodes.

  • Ancienne Méthode (Fenêtre Glissante) : Si l'événement s'est produit il y a 30 minutes, le système l'a déjà supprimé. La précision tombe à zéro.
  • Ancienne Méthode (Rétention de Tokens) : Le système essayait de sauvegarder des moments spécifiques, mais il devait en supprimer certains pour faire de la place aux nouveaux. Il aurait pu supprimer l'instant précis où le voleur est apparu.
  • ProtoKV : Il ne supprime jamais le concept de l'événement. Il le compresse simplement en un résumé. Même après 30 minutes de nouvelle vidéo, le résumé du « Voleur » est toujours là, mis à jour avec de nouveaux détails, prêt à être transformé à nouveau en une image « fantôme » pour que l'IA puisse répondre à la question.

Les Résultats

Les auteurs ont testé ce système sur plusieurs benchmarks vidéo. Ils ont constaté que :

  1. Précision : ProtoKV a obtenu des scores nettement plus élevés (jusqu'à 12,5 points de mieux) sur les questions concernant des événements survenus il y a longtemps.
  2. Stabilité : À mesure que l'écart de temps entre l'événement et la question augmentait, la performance de ProtoKV restait stable, tandis que celle des autres méthodes s'effondrait.
  3. Vitesse : Il répond aux questions aussi vite que les autres méthodes car le « résumé » est petit et tient facilement dans la mémoire de l'ordinateur, donc il ne ralentit pas le système.

En résumé, ProtoKV résout le problème de l'« oubli » en cessant de tenter de se souvenir de chaque détail pour se concentrer sur le souvenir de l'histoire de ce qui s'est passé, permettant ainsi de répondre à des questions sur le passé lointain sans nécess avoir besoin de la mémoire d'un supercalculateur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →