Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
本研究は、ゼロショット推定と自己申告スキルを比較することで、7 つの大規模言語モデルが Slack の通信ログから個々のドメイン知識を推論する能力を評価し、Gemini 2.5 Flash が最高精度を達成したものの、推論性能はメッセージ量に弱く依存しており、プライバシー保護と構造認識を備えたアプローチの必要性を浮き彫りにした。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で賑やかなオフィスに足を踏み入れたと想像してください。あなたは難しい問題を抱えていますが、誰に聞けばいいか分かりません。一日中コーディングについて話している隅の人物でしょうか?それともプロジェクト管理について何でも知っているように見える人物でしょうか?通常、あなたはあちこち歩き回り、数人に尋ねて、適切な専門家を見つけられることを願うしかありません。この「当てっこゲーム」は時間とお金の浪費です。
この論文は、単純な問いを投げかけます:AI は、すべてのチャット履歴を読み、誰が何を知っているかを瞬時に教えてくれる、非常に観察眼に優れたインターンとして機能できるでしょうか?
以下に、彼らの実験を簡単に解説します。
設定:「チャット探偵」
研究者たちは、企業の Slack アカウントから得られた膨大な量の実際のチャットメッセージ(数年間にわたる 43 人の約 27,000 件のメッセージ)を入手しました。これらを 7 つの異なる「超知能」(GPT、Claude、Gemini などの大規模言語モデル)に読み込ませました。
これらの AI モデルをさまざまなタイプの探偵と考えると分かりやすいでしょう:
- 速いけれど少し表面的なもの(クイックスキャナーのようなもの)。
- 遅いけれど深く考えるもの(本を分析する教授のようなもの)。
- 一般派もいれば、専門家もいます。
AI の役割は、チャットを読み、各人物の「スキルレポート」を作成することでした。例えば、誰かが「Python」や「データサイエンス」について話し続けていれば、AI は「この人は Python を知っている」と推測します。
現実確認:「自己申告」
AI が実際にその任務をうまく果たしているかどうかを確認するため、研究者たちは実際の人間に自己評価を依頼しました。各人が AI が見つけたスキル一覧を見て、「はい、私はこれを知っています」または「いいえ、知りません」と述べるためのシンプルなウェブサイトを作成しました。
その後、研究者たちは AI の推測と人間の実際の回答を比較しました。これは、教師が生徒がテストの答えを推測したものを、実際の正解鍵に対して採点するようなものです。
結果:誰が優勝しましたか?
研究者たちは 7 つの異なる AI モデルをテストしました。その順位は以下の通りです:
- 優勝者:Gemini 2.5 Flash が最良の推測者でした。0〜100 の尺度で約 21 ポイントの誤差でした。(人間が 80% の専門家だと述べた場合、AI は約 59% または 101% と推測しました。)
- 準優勝:Gemini 2.5 Pro がそれに続きました。
- 中位グループ:Claude モデル(Haiku と Sonnet)はまあまあでしたが、Gemini モデルほど鋭くはありませんでした。
- 苦戦者:GPT モデル(非常に有名な GPT-4o や GPT-5 を含む)は最も成績が芳しくありませんでした。平均して約 33 ポイントの誤差がありました。
大きな教訓:最良の AI でさえ完璧ではありませんでした。誰が何を知っているかという全体的なイメージは掴めるものの、専門性の正確なレベルを高い精度で特定することはできませんでした。
意外な展開:テキスト量が多い=良い推測とは限らない
「AI に 1,000 件ではなく 100 万件のメッセージを与えれば、より賢くなるはずです」と考えるかもしれません。
必ずしもそうではありません。 研究者たちは、単にチャット履歴が「多い」だけでは、AI の推測精度が自動的に向上しないことを発見しました。
- なぜか? 多くのチャットメッセージは単に「了解」「受領」「1 時にランチ?」といったもので、誰が何を知っているかは分かりません。
- 限界:AI が作業するための「最低限」のチャット量があれば、それ以上追加してもあまり役立ちません。これは、買い物リストを読んで誰かの好きな映画を推測しようとするようなものです。リストがどれだけ長くても、その人の映画の趣味についてはほとんど分かりません。
結論
この研究は、AI がチャットログを覗き込み、私たちのスキルについてそれなりの推測を行うことができることを証明しています。企業内で「誰が何を知っているか」の概略図を得るための有用なツールです。
しかし、それはまだ魔法の水晶球ではありません。AI はまだ間違いを犯し、この特定のテストでは有名な GPT モデルでさえ第一位にはなりませんでした。研究者たちはまた、これが現実世界で機能するためには、企業がプライバシーに非常に注意を払う必要があると指摘しました。外部の AI サーバーに企業のプライベートなチャットを送信することは、デリケートな問題だからです。
要約すると:AI は場の空気を読む能力を向上させていますが、まだ人の実際の専門性と、単なる日常の雑談を見分ける方法を学ぶ必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。