← 最新论文
💬 NLP

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

本研究通过比较七种大语言模型在 Slack 通信日志中推断个体领域知识的零样本估计值与自我报告技能,评估了其推断能力,发现尽管 Gemini 2.5 Flash 达到了最高准确率,但推断性能仅与消息量呈微弱依赖关系,并凸显了采用隐私保护和结构感知方法的必要性。

原作者: Ko Watanabe, Shoya Ishimaru

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ko Watanabe, Shoya Ishimaru

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你走进一间庞大而繁忙的办公室。你有一个棘手的问题,却不知道该问谁。是角落里整天谈论编程的那个人?还是那个似乎对项目管理的方方面面都了如指掌的人?通常,你不得不四处走动,询问几个人,并希望找到正确的专家。这种“猜谜游戏”浪费了时间和金钱。

这篇论文提出了一个简单的问题:AI 能否充当一名超级敏锐的实习生,阅读每个人的聊天记录,并立即告诉你谁懂什么?

以下是他们实验的简要分解:

设置:“聊天侦探”

研究人员从一家公司的 Slack 账户中获取了一大堆真实的聊天消息(约 27,000 条消息,来自 43 人,跨越数年)。他们将这些消息输入到七种不同的“超级大脑”(大型语言模型,如 GPT、Claude 和 Gemini)中。

将这些 AI 模型想象成不同类型的侦探:

  • 有些速度快但可能略显肤浅(像快速扫描仪)。
  • 有些速度慢但思考深入(像分析书籍的教授)。
  • 有些是通才,而有些是专才。

AI 的任务是阅读聊天记录,并为每个人生成一份“技能报告”。例如,如果某人一直在谈论"Python"和“数据科学”,AI 就会推测:“这个人懂 Python。”

现实检验:“自我报告”

为了验证 AI 是否真的胜任这项工作,研究人员让真实的人类对自己进行评分。他们创建了一个简单的网站,让每个人查看 AI 找到的技能列表,并回答“是的,我懂这个”或“不,我不懂”。

然后,研究人员将 AI 的推测与人类的实际回答进行了对比。这就像老师根据真实答案键来批改学生对考题答案的猜测。

结果:谁赢得了比赛?

研究人员测试了七种不同的 AI 模型。以下是它们的排名:

  1. 冠军Gemini 2.5 Flash 是最佳的猜测者。在 0–100 分的尺度上,它的误差约为 21 分。(如果人类表示自己是 80% 的专家,AI 的猜测大约在 59% 或 101%。)
  2. 亚军Gemini 2.5 Pro 紧随其后。
  3. 中游Claude 系列模型(Haiku 和 Sonnet)表现尚可,但不如 Gemini 系列敏锐。
  4. 挣扎者GPT 系列模型(包括非常著名的 GPT-4o 和 GPT-5)表现最差。它们的平均误差约为 33 分。

核心结论:即使是最好的 AI 也不完美。它能够大致了解谁懂什么,但无法高精度地 pinpoint 确切的专业水平。

令人惊讶的反转:更多文本 ≠ 更好的猜测

你可能会想:“如果我给 AI 一百万条消息而不是一千条,它会变得更聪明,对吧?”

未必如此。 研究人员发现,仅仅拥有更多的聊天记录并不能自动让 AI 的猜测更准确。

  • 为什么? 因为很多聊天消息只是“好的”、“收到了”或“一点吃午饭?”。这些并不能告诉你某人懂什么。
  • 局限性:一旦 AI 拥有了最低限度的聊天记录可供分析,再增加更多消息帮助不大。这就像试图通过阅读某人的购物清单来猜测他们最喜欢的电影;无论清单有多长,它都无法告诉你太多关于他们电影品味的信息。

底线

这项研究证明,AI可以窥探我们的聊天日志,并对我们的技能做出合理的猜测。它是绘制公司内“谁懂什么”粗略地图的有用工具。

然而,它还不是万能的水晶球。AI 仍然会犯错,而且著名的 GPT 模型在这次特定测试中甚至没有获得第一名。研究人员还指出,要在现实生活中实现这一点,公司需要非常谨慎地对待隐私问题,因为将私人公司聊天记录发送到外部 AI 服务器是一个敏感问题。

简而言之:AI 在“读懂气氛”方面越来越擅长,但它仍需学习如何区分一个人的实际专业能力和仅仅是日常闲聊。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →