← 最新の論文
💬 NLP

LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task

NLPerspectivesにおけるLeWiDi共有タスクの第3版は、順序ラベル付けスキームを持つ4つの多様なNLPタスクへとベンチマークを拡張し、新しい指標を伴うソフトラベルおよびパースペクティビスト(視点主義的)評価パラダイムを導入し、さらに新たなリソースと人間の判断の変動のモデリングに関する知見を提供することで、不一致を意識したAIの開発を推進します。

原著者: Elisa Leonardelli, Silvia Casola, Siyao Peng, Giulia Rizzi, Valerio Basile, Elisabetta Fersini, Diego Frassinelli, Hyewon Jang, Maja Pavlovic, Barbara Plank, Massimo Poesio

公開日 2026-02-09
📖 1 分で読めます☕ さくっと読める

原著者: Elisa Leonardelli, Silvia Casola, Siyao Peng, Giulia Rizzi, Valerio Basile, Elisabetta Fersini, Diego Frassinelli, Hyewon Jang, Maja Pavlovic, Barbara Plank, Massimo Poesio

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに人間の言語を理解させる方法を教えていると想像してください。長い間、私たちは「2 + 2 = 4」のように、誰もが答えに同意する例を見せることでロボットを教えてきました。しかし、現実の世界では、人間はしばしば意見を食い違わせます。ある人はジョークを爆笑しながら、別の人はそれを不快だと感じるかもしれません。ある人はある文章を「嘘」だと考え、別の人は「無害な意見」だと見るかもしれません。

この論文は、AIモデルに対して、不一致が存在しないふりをするのではなく、その不一致をどのように扱うかを教えるために設計された「コンテスト(LeWiDi-2025と呼ばれる)」の第3回目について記述しています。

以下は、日常的な例えを用いた、彼らが何を行ったかの簡単な解説です。

1. 目標:群衆の声を聞くことをAIに教える

AIにただ一つの「正解」を選ばせるのではなく、主催者はAIが人間による意見の全体像を理解できるかどうかを知りたいと考えました。

  • 従来の方法: 10人が映画に投票して、6人が「良い」、4人が「悪い」と答えた場合、従来のAIは単に「答えは『良い』である」と教えられます。これでは、残りの4人の存在が無視されてしまいます。
  • 新しい方法: AIには、「全容はこうです:6人が気に入り、4人が気に入りませんでした。あなたの仕事は、なぜ彼らがそのように感じたのかを理解し、意見の混ざり具合を予測することです」と伝えられます。

2. 4つの「ゲーム」(データセット)

コンテストでは、参加者に、人間の不一致の異なる種類を表す4つの異なるパズルの解決策が提示されました。

  • 皮肉ゲーム (CSC): テキストメッセージを読んでいる場面を想像してください。それは誠実な褒め言葉でしょうか、それとも皮肉な嫌みでしょうか? 人々は、それがどの程度「皮肉」であるかを1から6のスケールで評価します。
  • アイロニー(皮肉)ゲーム (MP): 短い投稿とその返信です。返信はアイロニーを含んでいますか? これは9つの異なる言語(英語、スペイン語、アラビア語など)で行われ、皮肉が世界共通の課題であることを示しました。
  • パラフレーズ(言い換え)ゲーム (Par): 2つの質問が投げかけられます。それらは同じことを尋ねていますか? 単なる「はい/いいえ」ではなく、人々はそれらがどの程度似ているかを -5 から 5 のスケールで評価しました。
  • 論理ゲーム (VEN): ある主張と、ある事実です。その事実は主張を証明していますか、矛盾していますか、それとも全く関係ありませんか? ここでも、人々は回答とともに「説明」を記述しました。

3. 2つの遊び方(タスク)

参加者は、AIの理解力を示すための2つの異なる方法から選択しなければなりませんでした。

  • タスクA:「天気予報士」方式 (Soft-Label)
    AIは特定の答えを推測する代わりに、天気予報士のように振る舞います。単に「雨が降ります」と言うのではなく、「降水確率60%、晴れ30%、雪10%です」と言います。AIは、人間がどのように投票するかという分布を予測します。
  • タスクB:「読心術師」方式 (Perspectivist)
    これはより困難です。AIは、特定の人物が何を言うかを推測しなければなりません。もしあなたに「これが人物Xの通常の考え方です」と教えられたら、AIは「人物Xの履歴に基づくと、彼らはこのような回答をする可能性が高い」と予測しなければなりません。これは、あなたの不機嫌な叔父さんがジョークに同意するか、あるいは楽観的な叔母さんが同意するかを予測するようなものです。

4. 新しいスコアカード(指標)

以前、判定員はAIがどれだけ的外れであったかを測定するために、単純な定規を使用していました。しかし、その定規は「皮肉のスケール」や「多言語」にはうまく機能しませんでした。

  • 新しい定規: 彼らは新しい測定方法を考案しました。
    • 「スケール」(1から6など)については、例えば「5」に対して「4」と答えることは、「5」に対して「1」と答えることよりもマシである、ということを理解する指標を使用しました。
    • 「読心術師」タスクについては、AIが個々の人間のバイアスや習慣をどれだけ模倣できたかを測定しました。

5. 結果:誰が勝ったのか?

約15のチームがコンテストに参加しました。そこで判明したことは以下の通りです。

  • 「ビッグ・ブレイン(巨大な脳)」アプローチ: 上位のチームは、エッセイを書いたりチャットしたりできる、同じような超スマートなAIである大規模言語モデル (LLM) を使用していました。これらのモデルは、異なる人々がどのように投票したかの例を見て、そのパターンをコピーすることに非常に長けていました。
  • 「小さくとも強力な」アプローチ: 特化した小型のモデルを使用したチームもありました。これらは、より小さくトリッキーなデータセットにおいて、驚くほど優れた成績を収めました。
  • 隠れた秘訣: 勝ったシステムは、単にテキストを見るだけでなく、誰がそのテキストを書いているかを見ていました。彼らは、より良い推測を行うために、アノテーター(注釈者)の年齢、性別、または過去の投票履歴などの手がかりを利用しました。
  • 「説明」ボーナス: 論理ゲームにおいて、人々が書いた「説明」をAIに読み込ませたチームは、回答(答え)だけを与えられたチームよりも高いパフォーマンスを発揮しました。これは、単に「どのように」投票したかだけでなく、「なぜ」投票したのかを理解することに似ています。

6. 注意点(限界)

著者たちは、自分たちがテストしなかったことについても正直に述べています。

  • 「初対面」の問題: 現実の世界では、見たことがない見知らぬ人に遭遇することがあります。このコンテストでは、AIはトレーニング中にすでに「会ったことのある」人々に対してテストされました。これらのモデルが、全く新しい人物に対しても対応できるかどうかは、まだ分かっていません。
  • テキストのみ: このコンテストは、読み書きに関するものでした。これらの手法が画像、動画、または音声に対して機能するかどうかは不明です。

まとめ

この論文は、AIに「全員が同意している」というふりをするのをやめさせるためのコンテストの成績表です。新しいスコアリング方法を用い、人間の不一致という複雑な現実を重視することで、勝者たちは、最高のAIモデルとは、群衆を見つめ、その中の多様な声を理解し、単一の勝者を選ぶのではなく、意見の混ざり具合を予測できるものであることを示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →