← 最新の論文
💬 NLP

Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models

この論文は、Cards Against Humanity を用いたベンチマークを通じて、最先端の言語モデルが人間のユーモア感覚と十分に一致しておらず、むしろモデル間で高い一致を示す傾向があることを明らかにし、その判断が真の好みではなく構造的なバイアスに起因する可能性を指摘しています。

原著者: Yousra Fettach, Guillaume Bied, Hannu Toivonen, Tijl De Bie

公開日 2026-04-13
📖 1 分で読めます☕ さくっと読める

原著者: Yousra Fettach, Guillaume Bied, Hannu Toivonen, Tijl De Bie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI がお笑い芸人になれるか?」**という面白い問いに答えた研究です。

タイトルは『Cards Against LLMs(LLM 対抗カード)』。
これは、人気のあるパーティゲーム『Cards Against Humanity(CAH)』を使って、最新の AI 5 種類と人間が同じゲームをして、**「誰が面白い答えを選べるか」**を比べた実験レポートです。

わかりやすく、3 つのポイントと面白い例え話で解説します。


1. 実験の仕組み:AI 対 人間、お笑いバトル

想像してみてください。
テーブルに「黒いカード(質問)」が一枚あります。
例:「大学を 4 年出ても、まだ〇〇ができません。」

そして、その横に「白いカード(答え)」が 10 枚並んでいます。
例:「女性と話すこと」「自分の税金を申告すること」「おばあちゃんの失望」など。

プレイヤーは、この中から**「一番面白い答え」**を 1 枚選びます。

  • 人間プレイヤー:実際にゲームをした 4,947 人の人間が選んだ答え。
  • AI プレイヤー:GPT-5.2 や Claude などの最新 AI 5 体が、同じカードを見て選んだ答え。

AI は「人間が何を選んで笑うか」を予測できるのでしょうか?

2. 驚きの結果:AI は「人間」より「AI 同士」の方が気が合う!

実験の結果、いくつかの面白いことがわかりました。

① AI の「お笑いセンス」は、人間にはあまり通じない

AI は完全にランダムに選ぶよりはずっと上手でしたが、人間が「面白い!」と選んだ答えと一致する確率は、たったの 13%〜18% 程度でした。
つまり、AI が「これだ!面白い!」と選んだ答えは、人間にとっては「ふーん、まあそうかもね」程度で、爆笑はしないことが多いのです。

② 最大の特徴:AI 同士は「仲良し」すぎる

ここが最も衝撃的な発見です。
AI が人間と一致する確率(13〜18%)よりも、AI 同士が一致する確率(20〜40% 以上)の方が圧倒的に高いのです。

例え話:
10 人の人間と、5 人の「ロボット」が同じお笑い大会に出たとします。
人間たちは、それぞれ「このネタが最高!」とバラバラに選んでしまいます。
しかし、5 人のロボットは、「人間が選ぶネタ」よりも、お互いが選ぶネタの方が似ているのです。
「ロボット界には、人間にはわからない『ロボット流の笑い』が存在する」と言えます。

3. なぜ AI は同じ答えを選ぶのか?(秘密の理由)

AI がなぜ人間と違う「共通の笑い」を持っているのか、研究者は 2 つの理由を見つけました。

① 「位置」に依存しすぎている(位置バイアス)

AI は、カードの「どこに並んでいるか」で答えを決めてしまう傾向があります。

  • DeepSeek という AI は、**「3 番目のカード」**を選ぶのが異常に多い。
  • Grok という AI は、**「最後の 10 番目のカード」**を選ぶのが多い。
  • Claude は、**「最初の数枚」**を好む。

例え話:
10 人の候補者が並んでいる選挙で、AI は「中身」を見て投票するのではなく、「3 番目の候補者だから投票しよう」「10 番目だから投票しよう」と、席順だけで決めているようなものです。

② 「特定のネタ」が好きすぎる(内容バイアス)

AI が選ぶネタには偏りがありました。

  • AI が好きなネタ: 「体の話(排泄物や生理など)」や「性的なネタ」。人間が選ぶ割合より、AI はこれらをもっと多く選びました。
  • AI が嫌いなネタ: 「政治」や「アイデンティティ(人種や性別など)」の話。人間はこれらをよく選びますが、AI は避ける傾向があります。

例え話:
AI は、人間が「社会的な問題」を笑いのネタにするのが少し苦手(あるいは安全のために避けている)ようで、代わりに「下品で直接的なネタ」に走ってしまう傾向があります。まるで、**「安全装置が効きすぎて、人間のような『鋭い皮肉』は出せないが、『下ネタ』だけは無意識に選んでしまう」**ような状態です。


結論:AI は「本当の理解」ではなく「パターン」で笑っている?

この研究の結論はこうです。

  1. AI はまだ人間のお笑いを完全には理解していない。
    人間が「面白い」と思う瞬間と、AI が「面白い」と思う瞬間は、まだ合っていない。
  2. AI には「AI 流の笑い」がある。
    AI 同士は、人間よりもお互いのセンスが似ている。それは、AI が「人間の文化」を深く理解しているからではなく、**「訓練データやアルゴリズムの癖(位置バイアスや特定のテーマへの偏り)」**によって、似たような答えを出しているからかもしれない。

まとめのメタファー:
AI は、お笑い大会で「正解」を当てようとして必死に勉強した優等生ですが、「人間の心」ではなく「テストの傾向(出題形式や正解の癖)」を覚えてしまった状態です。そのため、人間とは違う「AI 特有の正解」を出してしまい、人間には「なぜこれが面白いの?」と首を傾げさせてしまうのです。

この研究は、AI が「人間らしく」振る舞うためには、単に知識を増やすだけでなく、**「文脈や文化の微妙なニュアンス」**をどう捉えるかが、次の大きな課題であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →