CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
この論文は、ブラジル文学の文脈を用いて自動検証可能な指示遵守タスクを定義し、18 の大規模言語モデルの性能を評価する新たなベンチマーク「CAPITU」を提案し、推論モデルの高性能とポルトガル語特化モデルのコスト効率の良さを示したものです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文は、**「ブラジル・ポルトガル語で、AI が指示をどれだけ正確に守れるか」**を測る新しいテスト「CAPITU(カピトゥ)」を紹介するものです。
まるで、AI に「料理のレシピ」を渡して、その通りに作れるか試すようなものですが、今回は「ブラジルの文学」という特別な食材を使っています。
以下に、難しい専門用語を避け、身近な例え話を使って解説します。
📚 1. このテストの正体:「文学」を舞台にした「指示従順テスト」
これまでの AI のテストは、英語が中心で、少し抽象的な指示(「要約して」「箇条書きで書いて」など)が多かったです。
しかし、CAPITU は**「ブラジルの有名な小説(ドス・カスマロやマクラナイマなど)」**を舞台にしています。
- 例え話:
普通のテストが「白い壁に絵を描いて」という指示なら、CAPITU は**「『ドス・カスマロ』という古い小説の登場人物になりきって、特定のルールを守りながら物語を続けなさい」**というテストです。
これにより、単なる翻訳ではなく、ブラジル人の文化や言葉のニュアンス(「〜っぽい」という意味の接尾辞や、動詞の形など)を正しく扱えるかが試されます。
🎯 2. テストのルール:「自動採点」ができる魔法のチェックリスト
このテストの最大の特徴は、**「人間の採点者がいなくても、コンピュータが自動で正解・不正解を判定できる」**ことです。
どうやって判定するの?
AI が書いた文章を、プログラムが「厳密に」チェックします。- 「単語数が 100 語以上か?」
- 「『-inho(〜っぽい)』で終わる単語が 3 つ入っているか?」
- 「『-mente(〜的に)』で終わる単語は使っていないか?」
- 「文の頭が特定の文字で始まっているか?」
これらは、人間の主観(「上手い文章だ」とか「雰囲気がある」)ではなく、**「文字列が一致したか」**という機械的なルールでジャッジされます。
なぜ重要?
以前は「AI が作った文章を、別の AI が評価する」ことが多かったですが、それだと「評価する AI の気分」で結果が変わったり、コストがかかったりします。CAPITU は**「ルールの厳密さ」**に焦点を当てているので、誰がやっても同じ結果が出る「公平なテスト」です。
🧪 3. 実験の結果:誰が勝った?
18 種類の最新の AI モデルにこのテストをやらせました。結果は以下のようになりました。
- 🏆 最強の選手:GPT-5.2(推論機能付き)
指示を厳密に守る能力が圧倒的で、**98.5%**の正解率を達成しました。まるで、どんな複雑なルールでも完璧に守る「天才的な料理人」のようです。 - 💰 コスパの王様:Sabiá-4(ブラジル特化モデル)
ブラジルに特化した AI は、巨大なモデルに負けない実力を見せました。特に**「Sabiá-4」**は、コストが非常に安く(1 回 0.13 ドル)、Claude のモデルの 8 倍以上安いのに、高い性能を発揮しました。「安くて美味しい、ブラジル料理の専門店」のような存在です。 - 📉 苦手な分野:「数え」と「構造」
どの AI も、**「正確な単語数」や「頭文字で言葉を作る(アクロスティック)」といった指示には苦戦しました。特に会話が続く(3 回やり取りする)と、最初のルールを忘れ始めるモデルが多く、「約束を忘れる」**という弱点が浮き彫りになりました。
🌟 4. この研究の意義:なぜ「ポルトガル語」なの?
英語のテストをただ翻訳しただけでは、ポルトガル語の「豊かさ」は測れません。
ポルトガル語には、**「-inho(小さくて可愛い)」や「-mente(〜的に)」**といった、英語にはない独特な言葉の形があります。
- 例え話:
英語のテストで「赤い服を着て」と指示しても、ポルトガル語の文化では「青い服に赤いボタン」が正解になるかもしれません。
CAPITU は、**「ポルトガル語ならではの言葉の遊び」**をテストに組み込むことで、AI が本当にその言語の文化を理解しているか、表面的な翻訳だけではないかを見極めようとしています。
💡 まとめ
この論文は、**「ブラジル・ポルトガル語を話す AI が、複雑なルールを守れるか」を、「ブラジルの文学」という楽しい舞台で、「自動採点」**という公平な方法で検証したものです。
- 結論: 最先端の AI は非常に優秀ですが、まだ「会話中にルールを忘れる」ことや「ポルトガル語特有の言葉の形」には苦戦しています。
- 未来: このテスト(CAPITU)は公開されているので、これからブラジル語の AI をもっと賢く、文化に根ざした存在にするための「道しるべ」となるでしょう。
まるで、AI に「ブラジルの名作小説の世界で、ルールを守りながら踊ってごらん」と言っているような、面白くて重要な研究なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。