Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
本研究通过比较七种大语言模型在 Slack 通信日志中推断个体领域知识的零样本估计值与自我报告技能,评估了其推断能力,发现尽管 Gemini 2.5 Flash 达到了最高准确率,但推断性能仅与消息量呈微弱依赖关系,并凸显了采用隐私保护和结构感知方法的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你走进一间庞大而繁忙的办公室。你有一个棘手的问题,却不知道该问谁。是角落里整天谈论编程的那个人?还是那个似乎对项目管理的方方面面都了如指掌的人?通常,你不得不四处走动,询问几个人,并希望找到正确的专家。这种“猜谜游戏”浪费了时间和金钱。
这篇论文提出了一个简单的问题:AI 能否充当一名超级敏锐的实习生,阅读每个人的聊天记录,并立即告诉你谁懂什么?
以下是他们实验的简要分解:
设置:“聊天侦探”
研究人员从一家公司的 Slack 账户中获取了一大堆真实的聊天消息(约 27,000 条消息,来自 43 人,跨越数年)。他们将这些消息输入到七种不同的“超级大脑”(大型语言模型,如 GPT、Claude 和 Gemini)中。
将这些 AI 模型想象成不同类型的侦探:
- 有些速度快但可能略显肤浅(像快速扫描仪)。
- 有些速度慢但思考深入(像分析书籍的教授)。
- 有些是通才,而有些是专才。
AI 的任务是阅读聊天记录,并为每个人生成一份“技能报告”。例如,如果某人一直在谈论"Python"和“数据科学”,AI 就会推测:“这个人懂 Python。”
现实检验:“自我报告”
为了验证 AI 是否真的胜任这项工作,研究人员让真实的人类对自己进行评分。他们创建了一个简单的网站,让每个人查看 AI 找到的技能列表,并回答“是的,我懂这个”或“不,我不懂”。
然后,研究人员将 AI 的推测与人类的实际回答进行了对比。这就像老师根据真实答案键来批改学生对考题答案的猜测。
结果:谁赢得了比赛?
研究人员测试了七种不同的 AI 模型。以下是它们的排名:
- 冠军:Gemini 2.5 Flash 是最佳的猜测者。在 0–100 分的尺度上,它的误差约为 21 分。(如果人类表示自己是 80% 的专家,AI 的猜测大约在 59% 或 101%。)
- 亚军:Gemini 2.5 Pro 紧随其后。
- 中游:Claude 系列模型(Haiku 和 Sonnet)表现尚可,但不如 Gemini 系列敏锐。
- 挣扎者:GPT 系列模型(包括非常著名的 GPT-4o 和 GPT-5)表现最差。它们的平均误差约为 33 分。
核心结论:即使是最好的 AI 也不完美。它能够大致了解谁懂什么,但无法高精度地 pinpoint 确切的专业水平。
令人惊讶的反转:更多文本 ≠ 更好的猜测
你可能会想:“如果我给 AI 一百万条消息而不是一千条,它会变得更聪明,对吧?”
未必如此。 研究人员发现,仅仅拥有更多的聊天记录并不能自动让 AI 的猜测更准确。
- 为什么? 因为很多聊天消息只是“好的”、“收到了”或“一点吃午饭?”。这些并不能告诉你某人懂什么。
- 局限性:一旦 AI 拥有了最低限度的聊天记录可供分析,再增加更多消息帮助不大。这就像试图通过阅读某人的购物清单来猜测他们最喜欢的电影;无论清单有多长,它都无法告诉你太多关于他们电影品味的信息。
底线
这项研究证明,AI可以窥探我们的聊天日志,并对我们的技能做出合理的猜测。它是绘制公司内“谁懂什么”粗略地图的有用工具。
然而,它还不是万能的水晶球。AI 仍然会犯错,而且著名的 GPT 模型在这次特定测试中甚至没有获得第一名。研究人员还指出,要在现实生活中实现这一点,公司需要非常谨慎地对待隐私问题,因为将私人公司聊天记录发送到外部 AI 服务器是一个敏感问题。
简而言之:AI 在“读懂气氛”方面越来越擅长,但它仍需学习如何区分一个人的实际专业能力和仅仅是日常闲聊。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。