EduArt: An educational-level benchmark for evaluating art history knowledge in large language models
本論文は、多言語かつ多様な形式による871の人間作成の問題で構成される、心理計量学的に堅牢かつ教育レベルのベンチマークであるEduArtを紹介するものであり、大規模言語モデルが美術史の多肢選択式認識には優れている一方で、記述式および誤り特定タスクでは性能が劇的に低下することを示し、認識能力と美術史的知識を確実に展開する能力との間にある決定的な乖離を浮き彫りにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、新入生たちが美術史においてどれほど賢いかをテストしようとしていると想像してください。長い間、標準的なテストは多肢選択式のクイズでした。あなたは彼らに絵を見せ、「これは誰が描きましたか?」と問いかけ、4つの選択肢(A、B、C、D)を提示します。
この論文「EduArt」は、この手法が、シェフの料理の腕前をテストするのに、ハンバーガーの写真だけを指差して「はい、これはハンバーガーです」と言わせるようなものだと主張しています。それは簡単すぎます。最も賢いAIモデル(「学生」)たちは、今やこれらの多肢選択問題でほぼ100%のスコアを獲得しています。彼らは必ずしも芸術を理解しているわけではなく、単にリストの中から正しい文字を当てるのが非常に上手くなっているだけなのです。
新しいテスト:EduArt
研究者たちは、より手強い新しい試験である「EduArt」を作成しました。単なる多肢選択式ではなく、イタリアの高校の教科書や米国の大学入学試験から実際の質問を使用しました。これらの質問をコンピュータで作ったのではなく、本物の人間の教師たちが作成したものです。
EduArtを、AIのための「マルチスキル・障害物競走」と考えてください。AIは単に文字を選ぶだけでなく、以下のことを行う必要があります。
- 穴埋め問題: 「この芸術家は[______]という技法を用いた。」
- 間違い探し: 「この絵画に関する文章の中で、間違っている言葉を見つけなさい。」
- ドラッグ&ドロップ: 「正しい言葉をテキストの適切な場所に配置しなさい。」
- 説明する: 「なぜその答えを選んだのですか?」
判明したこと
研究者たちは、12種類の異なるAIモデル(さまざまな企業の「脳」のようなもの)を、この新しいコースでテストしました。何が起きたのか、簡単な比喩を使って説明します。
「認識」の罠: AIがリストから答えを選ぶだけ(多肢選択)のとき、トップモデルは94%を超えるスコアを出しました。彼らは美術史の天才のように見えました。しかし、答えを「書く」ことや間違いを「見つける」ことを求めると、スコアは急落しました。あるモデルは、答えを選ぶ能力が94%あったにもかかわらず、間違いを見つけるよう求められると6%まで落ち込みました。
- 比喩: これは、クイズ番組で素早くボタンを押して正解を当てることはできるが、同じトピックについてエッセイを書こうとすると完全に失敗してしまう学生のようなものです。彼らは答えを「認識」することはできますが、知識を「使う」ことはできないのです。
「画像」のパラドックス: 画像を見せればAIにとってより簡単になると思うかもしれません。驚くべきことに、画像が含まれていると、AIの成績は実際には悪化しました。
- 比喩: これは、学生に地図とコンパスを与えたものの、地図を見ることに気を取られすぎて、歩き方を忘れてしまうようなものです。AIは、画像そのものを見るよりも、テキストの記憶に頼っているようでした。画像があると混乱し、テキストだけの方がうまく機能しました。
「説明する」効果: 研究者たちは、AIに自分の答えの理由を短く書かせました。
- 比喩: 通常、テストで正解を推測している学生を想像してください。先生が「よし、ではなぜその答えを選んだのか理由を言いなさい」と言ったとき、答えられずに固まってしまう学生もいれば、自信を持って正解できる学生もいます。
- 結果: それは完全に、そのAIがどの「家系」に属しているかによります。ClaudeのようなAIファミリーは、説明を求められることで実際に成績が上がりました。一方で、GoogleのGeminiやOpenAIのGPTのようなAIは、成績が悪化しました。強制的に思考を言語化させることが、時に彼らを躓かせてしまうようです。
大きな教訓
この論文の要点は、「答えを知っていること」と「答えを使えること」は別個のスキルであるということです。
AIを多肢選択式の質問だけでテストしているなら、あなたは誤解を招くほど高いスコアを得ていることになります。それは、車が直進して駐車できるかどうかだけで車の性能を判断し、山を登ったりコーナーを曲がったりできるかどうかを無視しているようなものです。
絵画を分析したり解説を書いたりするためにAIを活用したいと考えている美術史の専門家に対し、この論文は警告しています。「多肢選択式のスコアを信じてはいけません」。AIが絵画の名前を正しく選べるからといって、その絵について正しい段落を書けたり、偽物を見抜いたりできるとは限らないのです。AIに本当に何ができるのかを知るためには、現実の学者が直面するような、複雑でオープンエンドな課題でテストする必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。