NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning
Le document présente NoRA, un banc d'essai visuel à la première personne comprenant 1 420 clips vidéo annotés qui évalue les systèmes multimodaux sur leur capacité à générer et à justifier des actions raisonnables via des graphes explicites de support fait-raison-action, révélant que les modèles actuels peinent à construire l'espace d'action complet et à lier correctement les actions aux preuves visibles malgré l'identification fréquente d'actions individuelles plausibles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le gros problème : Savoir vs Faire
Imaginez que vous enseigniez à un robot comment marcher dans un parc bondé.
- L'ancienne méthode : Vous présentez au robot une liste de trois options : « A) Marcher à gauche », « B) Marcher à droite » ou « C) S'asseoir ». Le robot choisit « B ». Vous vérifiez si « B » est la « bonne » réponse.
- La critique de l'article : Cela revient à un QCM. Dans la vraie vie, personne ne vous tend un menu de trois options. Vous devez observer la situation, comprendre ce qui se passe, concevoir votre propre liste de mouvements possibles, puis choisir le meilleur.
Les auteurs soutiennent que les modèles d'IA actuels sont bons pour choisir la bonne réponse dans un menu (comme un étudiant qui devine lors d'un examen), mais qu'ils sont mauvais pour déterminer le menu lui-même et expliquer pourquoi ils ont choisi un plat spécifique.
La solution : NORA (La « salle de sport du raisonnement »)
Les auteurs ont créé un nouveau test appelé NORA (Raisonnement normatif en action). Au lieu de demander à une IA : « Que dois-je faire ? » et de vérifier si la réponse correspond à une clé pré-écrite, NORA demande à l'IA de faire trois choses simultanément :
- Voir la scène : Regarder un clip vidéo d'un point de vue à la première personne (comme une caméra GoPro sur la tête de quelqu'un).
- Construire un menu : Générer une liste de choses raisonnables à faire ensuite.
- Justifier le choix : Pour chaque action de la liste, expliquer pourquoi elle fait sens en fonction de ce qui est réellement visible dans la vidéo.
L'analogie : Considérez NORA non pas comme un quiz à choix multiples, mais comme une compétition de cuisine.
- Les anciens tests : Le juge vous donne trois ingrédients et demande : « Lequel est le meilleur ? »
- NORA : Le juge vous montre une cuisine avec un plan de travail encombré et un invité affamé. Vous devez :
- Identifier les ingrédients sur le plan de travail (Les Faits).
- Imaginer différents repas que vous pourriez cuisiner (Les Actions Candidates).
- Expliquer pourquoi « Des pâtes » est un bon choix parce que « L'invité a faim » et « Nous avons des tomates » (Les Raisons).
- Crucialement : Si vous dites « Je vais faire un steak », mais qu'il n'y a pas de viande sur le plan de travail, vous échouez, même si « steak » est une idée délicieuse.
Comment ils mesurent le succès : Le « Graphe de support »
L'article introduit une manière spécifique de noter l'IA appelée Score de vraisemblance ancrée. Ils ne regardent pas seulement la réponse finale ; ils regardent le « graphe de support ».
Imaginez un arbre :
- Les Racines (Faits) : Qu'est-ce qui est réellement visible ? (ex : « Un enfant court », « Le sol est mouillé »).
- Le Tronc (Raisons) : Pourquoi cela importe-t-il ? (ex : « L'enfant pourrait glisser », « Il est dangereux de courir sur l'herbe mouillée »).
- Les Fruits (Actions) : Que devons-nous faire ? (ex : « Arrêter l'enfant », « Se déplacer sur l'herbe sèche »).
Le Score :
- Alignement de l'action : L'IA a-t-elle proposé une bonne liste de fruits ?
- Ancrage factuel : Les racines sont-elles réelles ? (L'IA a-t-elle halluciné un enfant qui n'est pas là ?)
- Liaison de support : Le fruit est-il connecté aux bonnes racines ? (L'IA a-t-elle dit « Arrêter l'enfant » à cause de l'herbe mouillée, ou à cause d'un chien qui n'est pas là ?)
Ce qu'ils ont trouvé : Le piège du « Plausible mais faux »
Les chercheurs ont testé 12 modèles d'IA différents (incluant des noms célèbres comme GPT-5 et Gemini) en utilisant cette nouvelle salle de sport. Voici ce qu'ils ont découvert :
- Ils sont bons pour décrire la pièce : La plupart des IA peuvent identifier correctement les faits visibles (ex : « Il y a une tondeuse à gazon »).
- Ils sont corrects pour choisir un fruit : Ils choisissent souvent une action plausible (ex : « Continuer à tondre »).
- Ils échouent sur le « Menu » et le « Pourquoi » :
- Manque de menu : Ils ont du mal à générer une liste complète d'options raisonnables. Ils passent souvent à côté d'actions alternatives qu'un humain considérerait.
- Connexions lâches : Ils choisissent souvent une bonne action mais l'attachent à la mauvaise raison. Par exemple, ils pourraient dire « Continuer à tondre » parce qu'« Il fait beau », alors que la vraie raison (visible dans la vidéo) est que « L'herbe est longue et doit être coupée ».
La métaphore : Imaginez un étudiant qui lève la main et dit : « La réponse est 42 ! »
- Ancien Test : Si 42 est la bonne réponse, il obtient un A.
- Test NORA : Le professeur demande : « Montre ton travail. » L'étudiant répond : « Parce que 6 fois 7 font 42. »
- Si le problème était en réalité : « Quelle est la racine carrée de 1764 ? », l'étudiant obtient un A pour la réponse, mais échoue au test car il n'a pas montré le bon raisonnement pour ce problème spécifique.
- NORA a découvert que les IA actuelles sont excellentes pour crier « 42 ! », mais terribles pour montrer les calculs qui prouvent pourquoi 42 est le bon mouvement pour cette vidéo précise.
Les trois styles de « Prompt »
Pour tester la façon dont l'IA réfléchit, les chercheurs ont posé les mêmes questions de trois manières différentes (comme changer les règles de la compétition de cuisine) :
- Direct : « Dis-moi juste quoi faire. » (Aucune explication autorisée).
- Délibéré : « Réfléchis à voix haute. Liste quelques options et explique-les, puis choisis-en une. »
- Structuré : « Remplis ce formulaire spécifique : Liste les Faits, Liste les Raisons, Liste les Actions, puis Choisis-en une. »
Le Résultat : L'approche « Structurée » (remplir le formulaire) a aidé les meilleurs modèles d'IA à mieux performer. Cela les a forcés à ralentir et à connecter leurs faits à leurs actions. Cependant, pour certains autres modèles, le fait de les forcer à remplir un formulaire les a rendus moins performants, comme si les règles rigides les avaient confondus.
L'essentiel
L'article conclut que bien que l'IA s'améliore pour « voir » et « choisir », elle éprouve encore des difficultés avec le raisonnement justifié. Elle peut souvent deviner le bon mouvement, mais elle ne peut pas expliquer de manière fiable pourquoi ce mouvement est le bon en se basant uniquement sur ce qu'elle voit dans la vidéo.
NORA est un outil pour mesurer cet écart. Il déplace la question de « L'IA peut-elle choisir la bonne réponse ? » vers « L'IA peut-elle construire un argument logique, visible et défendable pour son action ? ». Actuellement, la réponse est : « Elles y arrivent, mais elles n'ont pas encore une vision complète. »
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.