← Derniers articles
📄 animal behavior and cognition

FERAL: A Supervised Video-Understanding System for Direct Video-to-Behavior Mapping

FERAL est un système de compréhension vidéo supervisé et open-source qui cartographie directement la vidéo brute en étiquettes comportementales à l'échelle de l'image pour diverses espèces et échelles, contournant les limitations traditionnelles du suivi de points clés tout en surpassant les modèles de référence de l'état de l'art avec nettement moins de données d'entraînement.

Auteurs originaux : Skovorodnikov, P., Razzauti, J., Costelloe, B. R., Buck, F., Chandra, V., Frank, D. D., Kay, T., Koger, B., Snir, O., Zhao, J., Couzin, I. D., Kronauer, D. J. C., Vosshall, L. B.

Publié 2026-07-13
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Skovorodnikov, P., Razzauti, J., Costelloe, B. R., Buck, F., Chandra, V., Frank, D. D., Kay, T., Koger, B., Snir, O., Zhao, J., Couzin, I. D., Kronauer, D. J. C., Vosshall, L. B.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un ordinateur à comprendre un film d'animaux en train de jouer, de se battre ou simplement de passer du temps ensemble. Pendant des années, la méthode standard pour faire cela était comparable à un réalisateur très strict et exigeant. D'abord, vous deviez placer des « autocollants » invisibles (des points clés) sur chaque articulation de chaque corps d'animal dans chaque image. Ensuite, vous nourrissiez l'ordinateur avec ces squelettes de bonshommes bâtons et espériez qu'il puisse deviner ce que l'animal faisait en observant le mouvement des articulations.

Le problème ? Si un animal se cache derrière une feuille, est recouvert par un autre animal, ou si l'éclairage est étrange, ces « autocollants » se décollent. L'ordinateur s'embrouille, et tout le système s'effondre. C'est comme essayer de comprendre une chorégraphie en ne regardant que les fils d'une marionnette ; si les fils s'emmêlent, vous n'avez aucune idée de ce que fait le danseur.

Entrez en scène FERAL (Feature Extraction for Recognition of Animal Locomotion). Considérez FERAL non pas comme un marionnettiste, mais comme un critique de cinéma super intelligent qui ignore totalement le spectacle de marionnettes. Au lieu de regarder des silhouettes de bonshommes bâtons, FERAL regarde directement les pixels bruts de la vidéo. Il observe toute la scène — les couleurs, les formes, le mouvement — et apprend à dire : « Ah, c'est une souris en train de se toiletter », ou « C'est un groupe de fourmis en train de piller pour la nourriture ».

La Grande Découverte
La principale conclusion est que FERAL peut mapper directement les vidéos brutes vers des étiquettes de comportement avec une précision incroyable, battant souvent les meilleurs systèmes de « bonshommes bâtons ». Lors d'un test majeur appelé CalMS21, où des ordinateurs devaient identifier des comportements sociaux chez des souris, FERAL a atteint un score de 94,2 % (mesuré en précision moyenne, mAP). C'est plus élevé que les précédents meilleurs concurrents, y compris un système de Google appelé VideoPrism. Encore plus cool ? FERAL a fait cela en utilisant seulement 25 % des données d'entraînement dont VideoPrism avait besoin. C'est comme un étudiant qui lit un quart du manuel et réussit quand même l'examen mieux que l'élève qui a lu tout le livre.

Ce à quoi FERAL dit « Non »
L'article est très clair sur ce que FERAL n'est pas. Il exclut explicitement l'idée que vous avez besoin de suivre les parties du corps (estimation de la pose) pour comprendre le comportement. Les auteurs soutiennent que chercher les articulations en premier est souvent une impasse, surtout dans des environnements réels et désordonnés. Ils précisent également que FERAL est un outil supervisé, ce qui signifie qu'il apprend uniquement ce que vous lui enseignez explicitement. Il ne peut pas découvrir magiquement de nouveaux comportements inconnus par lui-même. Si vous ne lui dites pas à quoi ressemble le « creusement », il n'inventera pas cette catégorie ; il dira simplement que c'est de l'« arrière-plan » ou quelque chose de similaire. C'est un traducteur, pas un détective.

Sommes-nous sûrs ?
Les auteurs sont très confiants, appuyés par des chiffres concrets issus d'expériences réelles, et non de simples simulations. Ils ont testé FERAL sur une grande variété d'espèces :

  • Souris : Battant les meilleurs modèles existants sur les interactions sociales.
  • Fourmis : Identifiant correctement quand une colonie part en « raid » ou quand un adulte soigne un bébé, même lorsque les fourmis sont entassées et se bloquent mutuellement.
  • Vers et mouches : Suivant avec précision la marche vers l'avant, le recul et les virages.
  • Zèbres sauvages : C'est là que ça devient sauvage. Ils ont utilisé des images de drones de zèbres au Kenya pour repérer la « vigilance » (rester immobile, tête haute). Un système traditionnel basé sur la pose a échoué lamentablement ici (avec un score proche de 0,50, ce qui revient pratiquement à un pile ou face) car la vue du drone par le haut rendait impossible la visualisation de l'angle du cou du zèbre. FERAL, en regardant l'ensemble de la vidéo, a obtenu un score F1 macro de 0,785, prouvant qu'il fonctionne même lorsque l'angle de la caméra est complexe.
  • Chimpanzés et Gorilles : Dans le jeu de données PanAf500, FERAL a atteint une précision top-1 de 90,8 %, battant toutes les autres méthodes testées sur ces primates.

La « Magie » derrière le rideau
FERAL fonctionne en utilisant un « modèle de fondation » (un IA géante pré-entraînée sur plus d'un million d'heures de vidéos internet). Considérez cela comme un étudiant qui a déjà regardé tous les films existants et qui sait comment la lumière, l'ombre et le mouvement fonctionnent de manière générale. Les chercheurs ont ensuite « affiné » (fine-tuned) les 12 couches supérieures des 24 couches du modèle en utilisant des vidéos d'animaux spécifiques. C'est comme prendre un critique de cinéma généraliste et lui donner un cours intensif sur le comportement animal.

Ils ont également découvert que FERAL est étonnamment efficace. Vous n'avez pas besoin d'un supercalculateur pour le faire tourner. Sur une carte graphique grand public haut de gamme standard (comme une RTX 5090), il peut traiter une heure de vidéo en environ 4,6 minutes. C'est plus rapide que le temps réel !

L'essentiel à retenir
FERAL ne fonctionne pas seulement en laboratoire ; il fonctionne dans le monde réel, désordonné et imprévisible. Il gère les scènes encombrées, les éclairages étranges et les animaux qui se cachent. C'est un outil qui permet aux scientifiques de sauter l'étape fastidieuse du dessin de bonshommes bâtons pour passer directement à la compréhension de ce que les animaux font réellement. Ce n'est pas une baguette magique qui résout tous les problèmes (il a toujours besoin d'humains pour étiqueter les comportements d'abord), mais c'est un bond de géant pour rendre la recherche sur le comportement animal plus rapide, moins coûteuse et possible dans des endroits où elle était auparavant impossible.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →