← 最新の論文
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

本論文は、95 言語にわたるネイティブなインターフェースの affordance を維持し、均一なテキストのみのベンチマークを超えた大規模言語モデルのより実態に即した評価を可能にする、142,808 件の実世界のチャットボット会話からなる大規模なマルチプラットフォームデータセット「ShareChat」を紹介する。

原著者: Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがロボットとの会話について研究してきたと想像してください。ただし、あなたはいつも単一の、何もないガラスの窓を通して彼らを見てきました。あなたが目にするのは彼らがタイプする言葉だけですが、彼らがいる部屋固有の特徴——壁にある特定の道具、ロボットが声に出して考える様子、あるいは異なるロボットが助けを提供するために設計されたさまざまな方法——を見逃しています。

これが、この論文の著者たちであるSHARECHATが解決しようとしている問題です。彼らは、5 つの異なる AI チャットボット(ChatGPT、Perplexity、Grok、Gemini、Claude)と人間との間の実際の会話からなる巨大な新しいライブラリを構築しました。それは、どこで AI と話すかが、どのように話すかを決定づけることを示すためです。

以下に、彼らが何を行い、何を発見したのかを簡潔にまとめます。

1. 「ガラスの窓」の問題

これまでのほとんどの研究は、AI の会話を「すべてに通用する」レンズを通して見てきました。彼らは、データを均一に見せるために、各アプリの固有の特徴をすべて取り除いていました。

  • 比喩: 人々が食事を注文する方法を研究する際、ファストフードのドライブスルー、高級な席付きレストラン、フードトラックのいずれにいるかを無視し、単に材料のリストだけを見ていたと想像してください。文脈を見逃しているのです!
  • 解決策: SHARECHAT は、それら 5 つの場所すべてで注文する人々をハイビジョンで録画したようなものです。それは「ドライブスルーのスピーカー」(Grok のソーシャルメディアリンク)、「シェフの特別メモ」(Claude のコードツール)、そして「メニューの引用」(Perplexity のソースリンク)をそのまま残しています。

2. ライブラリには何があるのか?

研究者たちは、オンラインで自発的にチャットリンクを共有した人々から142,808 の会話(66 万を超える往復メッセージ)を収集しました。

  • 規模: 巨大です。他のライブラリが短い、断片的なチャット(短いテキストメッセージのようなもの)を持っていたのに対し、SHARECHAT には、ユーザーがフォローアップ質問を投げかけ、考えを変え、多くのターンにわたって複雑な問題を解決する、長く深遠な会話が含まれています。
  • 多様性: 英語だけでなく、95 の異なる言語を網羅しています。
  • プライバシー: 誰一人として特定できないよう、チャットからすべての名前、メールアドレス、電話番号を削除しました。これは、群衆写真の顔をぼかすようなものです。

3. 3 つの大きな発見(ケーススタディ)

著者たちは、このライブラリを使用して、ロボットがどれほど異なるのかを確認するための 3 つの具体的なテストを行いました。

A. 「理解できたか?」テスト(会話の完全性)
彼らは、AI がユーザーの要求を本当に完了させたかどうかを確認しました。

  • 発見: 一部のロボットは、常に本全体を見つける信頼できる司書のようでした(ChatGPT と Claude)。他のロボットは、素晴らしい最初のページを提供するが、答えを見つける前に止まってしまう可能性のある検索エンジンのようでした(Perplexity と Grok)。現実世界では、多くの会話がユーザーが部分的にしか満足していない状態で終わります。これは、単一の質問だけを見ていた以前の研究では見逃されていたニュアンスです。

B. 「どこを見たか?」テスト(ソースの根拠)
彼らは、検索に特化した 2 つのロボット(Grok と Perplexity)がどのように答えを見つけ出したかを調べました。

  • 発見: 彼らは 2 人の異なる探偵のようでした。
    • Grokソーシャルメディアに執着しています。X(Twitter)の投稿やニュースサイトを主に引用し、リアルタイムのニュース速報のように機能します。
    • Perplexity研究者です。ウィキペディア、学術誌、Reddit などのフォーラムを引用し、アーカイブを掘り起こす司書のようにはたらきます。
    • 教訓: 彼らは単なる「AI」ではなく、異なる仕事のために異なるツールで構築されているのです。

C. 「思考の速度」テスト(タイミング)
彼らは、AI が話した後、ユーザーが返信を入力するまでの時間を測定しました。

  • 発見: 会話のリズムは、ロボットによって異なります。
    • ChatGPT では、チャットが進むにつれてロボットが速くなります(おそらくあなたのスタイルを学習しているか、答えをキャッシュしているためでしょう)。
    • Grok では、チャットが長くなるにつれてロボットが遅くなります(おそらくすべての履歴に圧倒されているためでしょう)。
    • これは、チャットの「性格」が言葉だけにあるのではなく、タイミングと流れにあることを示しています。

4. なぜこれが重要なのか

この論文は、私たちが一般的で剥ぎ取られたレンズを通してのみ AI を研究する場合、最も重要な部分を見逃していることを主張しています。ユーザーの現実です。

  • 現実は厄介です: 人々は単一の質問をして立ち去るだけではありません。彼らは長く、入り組んだ会話を行います。
  • ツールは重要です: ユーザーは異なる AI を異なるツールとして扱います。コーディングには一つ、ニュースにはもう一つ、クリエイティブライティングには別のものを使います。
  • より良いトレーニング: 研究者に、その固有の特徴をすべて保持したままの「現実世界」のデータを与えることで、単に何を言うかを理解するだけでなく、そのアプリが住む特定の文脈においてどのように言うかを理解する、より優れた AI を構築できます。

要約すると: SHARECHAT は、現実世界の AI チャットの大規模で多様なコレクションであり、これらのロボットを真空状態で見ていては理解できないことを証明しています。彼らが実際にどのように機能するかを理解するには、彼らを自然な生息地で見なければならないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →