VideoNorms: Benchmarking Cultural Awareness of Video Language Models
本論文は、人間とAIの協調を通じて作成された、米国のテレビ番組および中国のテレビ番組から得られた3,000件以上の文化的規範のアノテーションを含むデータセットであるVideoNormsを紹介するものであり、これは現在のVideoLLMが中国の文化的文脈や非言語的な証拠に対してより苦戦していることを明らかにしており、文化的に根ざした学習と評価の必要性を強調している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたがロボットに人間の行動を理解させるよう教えている場面を想像してみてください。あなたは、二人の人物が出会っている動画を見せ、「彼らは礼儀正しく振る舞っていますか?」と問いかけます。人工知能の世界において、これは非常に大きな挑戦です。私たちは「ビデオ大規模言語モデル(VideoLLM)」、つまり動画を見てそれについて語ることができる超スマートなコンピュータを構築してきました。しかし、これらのロボットのほとんどは、主に米国という世界の特定の片隅から集められたデータのみで学習されています。猫や車を見つけることは得意ですが、握手をする、謝罪する、別れの挨拶をするといった、私たちが従っている「目に見えない社会的なルール」となると、しばしばつまずいてしまいます。ある国では左手で指をさすことが失礼にあたると知らない観光客のように、これらのAIモデルは、ある文化圏では重大なマナー違反である行為を、正常であると判断してしまうかもしれません。この論文は、極めて重要な問いを投げかけています。ビデオを見るロボットは、異なる社会の文化的な「雰囲気(バイブス)」を理解できるのでしょうか、それとも単に見たものに基づいて推測しているだけなのでしょうか?
これに答えるため、研究チームはVIDEONORMSという新しいテストを作成しました。このデータセットを、巨大なグローバル版「間違い探し」ゲームだと考えてください。ただし、隠れた物体を見つけるのではなく、AIが社会的なルールに従っているか、あるいは破っているかを見つけ出すゲームです。研究者たちは単にAIに推測させたのではありません。彼らは「人間とAIのチーム」を構築しました。まず、超強力なAI(Geminiと呼ばれます)が、米国の人気テレビ番組から数千の15秒間のクリップを視聴し、その社会的なルールがどのようなものかを書き出しました。次に、その特定の文化圏で育った本物の人間である専門家が、エディターとして介入しました。彼らはAIの作業をチェックし、ロボットが見落としたかもしれない身体言語やトーンに関する詳細を修正したり、追加したりしました。このプロセスにより、テレビ番組の登場人物が礼儀正しいか失礼かを判断する、3,000件以上の人間によって検証された判断の膨大なライブラリが完成しました。
研究者たちが7つの異なるオープンソースのビデオAIモデルをこの新しいデータセットでテストしたところ、ロボットの文化的知能における驚くべきギャップが明らかになりました。第一に、モデルは中国の規範よりもアメリカの規範を理解することに長けていました。それはまるで、ロボットが米国文化のテストに向けて猛勉強した一方で、中国については教科書をほとんど開かなかったかのようです。具体的には、モデルは中国の登場人物がルールを「守っている」ときを予測するのに苦労し、その文脈において何が「礼儀正しい」のかについて混乱することがよくありました。第二に、もし手がかりが非言語的なものであった場合、ロボットはその行為がなぜ失礼なのか、あるいは礼儀正しいのかを説明することにMuch(より)苦戦しました。登場人物が腕を組んだり、視線を避けたりした場合、AIはその信号を見逃すことが多かったのですが、「ごめんなさい」や「ありがとう」といった言葉による手がかりを捉えることはるかに得意でした。
この研究では、単にAIを「大きく」したり、より賢くしたりすることで、これらの問題が解決するかどうかもテストしました。彼らは、より大きなモデルを使用したり、より多くのビデオフレームを入力したりしましたが、結果はあまり改善しませんでした。このことは、問題が単にロボットがどれだけのデータを暗記しているかではなく、どのような「種類」のデータを持っているかにあることを示唆しています。また、研究者たちは、シーンを理解するために単に台本(話されている言葉)を読むだけでは不十分であり、実際にビデオを見る必要があることも証明しました。文化的な文脈を正しく理解するためには、視覚的な手がかりが不可欠なのです。
要約すると、この論文は、ビデオを見るAIが世界を見ることには長けてきているものの、異なる文化間で人間がどのように振る舞うかという多様な方法を真に理解できるようになるには、まだ長い道のりがあることを明らかにしています。現在のロボットは、辞書は知っているけれど現地の習慣を学んでいない観光客のようなものであり、単に規模を大きくするだけでは、交通ルールを教えることはできません。真に文化的な意識を持つAIを構築するためには、ハリウッドの物語だけでなく、より幅広い人類の物語を通じて彼らを訓練する必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。