lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation
本論文は、ユーモアの観客依存的な性質に対処するために、「多数生成し、最良を選択する」戦略を採用したSemEval-2026 Task 1 (MWAHAHA) の優勝システムを提示するものであり、そこでは多様な候補のプールが、絶対的な面白さのスコアではなく、人間のペアワイズ比較に基づく好みのモデルによってランク付けされる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、今夜のショーで最も面白いジョークを選ぼうとしているコメディクラブのオーナーだと想像してください。あなたの手元には、超高速ロボットが書いた1,000個のジョークがありますが、ある人にとって面白いものが、別の人にとっては「やれやれ」と目を回させるものになるかもしれないということを、あなたは知っています。あなたが読んでいる紙は、SemEval-2026 Task 1(愛称:MWAHAHA)と呼ばれるコンピュータサイエンスのコンペティションのために、著者たちがまさにこの問題を解決するシステムをどのように構築したかについてのレポートです。
以下は、彼らがどのように行ったかの物語を、分かりやすくステップごとに分解したものです。
1. 問題点:「面白い」は見る人の目の中にあり
著者たちは、コンピュータに「面白い」ことを教えるのが難しい理由は、コンピュータが言葉を書けないからではなく、「面白い」という感覚が主観的だからであると指摘しています。
- 観客の問題: ベルリンで爆笑を誘うジョークが、北京ではスベってしまうかもしれません。人間でさえ、何が面白いかについて合意を得ることは困難です。もし10人にジョークの評価を求めたとしたら、彼らは10通りの異なるスコアを出すでしょう。
- ロボットの問題: コンピュータは暗記が得意です。もしロボットにジョークを言わせようとすると、彼らは単に自分が暗記している25個のジョークを、決まり文句を繰り返すオウムのように、何度も繰り返すだけになってしまいます。彼らは、本当に新しい何かを生み出すことが苦手なのです。
2. 戦略:「ダーツを投げ、その後にブルズアイ(中心)を選ぶ」
完璧なジョークを一度に書こうとする代わりに、著者たちは2段階の戦略、すなわち**「大量に生成し、その中から最良のものを選ぶ」**という手法を用いました。
ステップ1:「ジョーク工場」(生成)
彼らは、1つのプロンプトに対して50種類の異なるジョークを量産する工場を設置しました。彼らは、さまざまなAIモデル(異なるコメディアンのチームのようなもの)を組み合わせ、ロボットが同じ古いジョークをコピー&ペーストするのを防ぐために、創造性を強制しました。また、特定の単語を含める、あるいは一定の長さに収めるといったルールに従うようにしました。- 比喩: 50人の異なるシェフにハンバーガーを作らせる場面を想像してください。あるシェフはスパイシーに、あるシェフは甘く、またあるシェフは奇妙に作るでしょう。これで、あなたは巨大なバーガーの山を手に入れたことになります。
ステップ2:「テイスター」(選択)
さて、その50個のジョークの山から勝者を選び出す方法が必要です。人間はリアルタイムですべてのジョークを判断できないため、彼らは「選好モデル(Preference Model)」**を構築しました。- 「これは面白いですか?」とコンピュータに聞く(これは曖昧で混乱を招きます)のではなく、「ジョークAとジョークBの間で、どちらの方が優れていますか?」と尋ねました。
- 彼らは、人々が2つのジョークを比較して勝者を選ぶという、約2,500件の人間による投票に基づいて、このモデルを訓練しました。これは、審判に何千もの「A対B」の対戦を見せることで、審判に観客の好みを学習させるようなものです。
3. 秘伝のソース:「ユーモアのレシピ本」
彼らの「テイスター」をより賢く、理解しやすくするために、彼らは単にコンピュータに推測させたのではありません。彼らは**「ユーモアの基盤(Humor Basis)」**、つまり17種類の具体的な「風味」からなる短いリストを作成しました。
- これはスパイスラックのようなものです。風味には「ブラックユーモア」「言葉遊び」「誇張」「予期せぬ展開」などが含まれます。
- コンピュータがジョークを見る時、単に「良い」か「悪い」と言うのではありません。コンピュータはスパイスラックに対して照らし合わせます。「これはパンチラインが強いか? 言葉遊びを使っているか? ダークすぎるか?」
- これにより、システムは「解釈可能(interpretable)」になります。つまり、人間が結果を見たときに、なぜコンピュータが特定のジョークを選んだのか(例:「少し短かったが、素晴らしい展開があったからこれを選んだ」など)を理解できるのです。
4. 結果:コンペティションでの勝利
彼らは、3つの異なる種類のデータ(Redditのジョーク、プロのジョーク、そして彼ら自身の新しいデータセット)を用いてこのシステムをテストしました。
- 勝者: 彼らの「2つのジョークを比較する」手法は、単に一つのジョークにスコアをつける方法よりもはるかに優れた結果を示しました。また、他の手法よりも異なる言語や文化を扱うことに長けていました。
- トロフィー: 実際のコンペティション(MWAHAHA)において、彼らのシステムは英語と中国語で1位、スペイン語で2位を獲得しました。
5. 大きな教訓
論文は、コンピュータのユーモアの未来は、ロボットにゼロから「より良い」ジョークを書かせることではないと結論づけています。ロボットはすでに「多くの」ジョークを書くことには長けています。真の課題は、**「正しいものを選ぶ」**ことです。
著者らは、もしコンピュータを面白くしたいのであれば、ユーモアを単一の数字として測定しようとするのではなく、オプションを比較することを通じて、特定の観客が何を好むかという**「選好(好み)」**に焦点を当てるべきだと主張しています。それは、私たちがどの映画を見るか、あるいはどの曲を流すかを決める時に行うことと同じです。
要約すると: 彼らは、膨大なジョークのビュッフェを生成し、スマートに訓練された「テイスター」を使って、観客が最も愛してくれる可能性が高い一皿を選ぶシステムを構築しました。そして、ユーモアとはジョークそのものではなく、観客の好みに関するものであることを理解することで、コンペティションを制したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。