Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users
该论文提出并评估了个性化深度研究工具 MyScholarQA,指出仅依赖合成数据和 LLM 评估的现有基准无法全面捕捉真实用户的深层需求,强调唯有通过真实用户参与才能真正推动个性化研究助手的发展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给“人工智能(AI)”做的一次深度体检,主题是:现在的 AI 虽然很聪明,但它其实并不真正“懂”你。
为了让你轻松理解,我们可以把这篇论文的研究过程想象成**开一家“私人定制书店”**的故事。
1. 背景:书太多,人太累
现在的科学家(研究人员)就像是一群超级书迷。他们每天面对成千上万本新书(学术论文),根本看不过来。
于是,他们请来了一个超级智能图书管理员(Deep Research,深度研究系统)。这个管理员能帮你快速找书、总结内容,甚至写出一份详细的读书报告。
但是,问题来了:
这个管理员虽然博学,但他是个“面瘫”。不管你是谁,他都给你看同样的书,用同样的语气说话。
- 如果你是新手,他可能讲得太深奥,你听不懂。
- 如果你是专家,他可能讲得太浅,你觉得他在浪费你的时间。
- 如果你只关心某个特定领域,他可能给你推荐了一堆你不感兴趣的杂书。
2. 解决方案:MyScholarQA(我的专属图书管理员)
为了解决这个问题,作者们开发了一个叫 MyScholarQA (MYSQA) 的新系统。它不像普通的管理员,它想成为你的私人管家。
它的运作流程就像这样:
第一步:建立“人设档案” (Infer a Profile)
- 做法:你不需要写长篇大论的介绍,只需要把你读过或写过的几篇论文扔给它。
- 比喻:就像你给管家看你的旧照片和日记。管家通过看这些,推断出:“哦,原来这位主人喜欢用黑盒子分析模型,不喜欢太基础的术语,而且特别关注科学问答领域。”
- 结果:管家为你生成了一份专属档案,上面写着你的喜好、风格甚至观点。
第二步:提出“行动建议” (Propose Actions)
- 做法:当你问一个问题(比如“怎么构建个性化系统?”)时,管家不会直接丢给你答案,而是先问:“主人,根据我的档案,您是想让我跳过基础定义直接讲干货?还是想让我多举几个代码例子?或者重点对比一下其他方法?”
- 比喻:就像点菜时,服务员问:“您是想要微辣、中辣,还是特辣?要不要把香菜去掉?”它让你掌控报告的风格。
第三步:生成“定制报告” (Synthesize a Report)
- 做法:管家根据你的选择,写出一份报告。它会在报告里高亮显示哪些部分是专门为你定制的(比如:“这里我特意用了您喜欢的比喻”)。
- 比喻:就像一份量身定做的西装,哪里改了、哪里加了扣子,都一目了然。
3. 核心冲突:AI 法官 vs. 真人用户
这是这篇论文最精彩、也最讽刺的部分。
作者们先是用标准的 AI 测试方法来检查这个系统:
- 方法:他们找了一群AI 假人(合成用户),然后让另一个**AI 法官(LLM Judge)**来打分。
- 结果:AI 法官非常满意!它说:“这个系统太棒了,引用准确,动作执行完美,比市面上的其他系统都好!”
- 比喻:就像你让一个机器人去评价另一个机器人做的菜,机器人说:“这菜色香味俱全,完美!”
但是,作者们觉得不对劲。 他们想:“真的完美吗?还是只是机器人骗了机器人?”
于是,他们找了 21 位真正的科学家(真人用户)来试用这个系统,并进行了长达 90 分钟的深度访谈。
真相大白了!
真人用户发现了很多AI 法官完全看不见的毛病:
- 过度吹捧:AI 档案里写着“您是该领域的顶级专家”,但用户其实只是刚入门。
- 比喻:管家把你当成爱因斯坦,结果你只是个刚学物理的高中生,管家还给你讲量子力学,你一脸懵。
- 跑题:AI 建议的行动建议偏离了你的核心问题。
- 比喻:你想吃红烧肉,管家却给你推荐了一堆红烧肉的烹饪历史,完全没给你肉。
- 信息太浅:报告看起来很长,但全是废话,没有干货。
- 比喻:管家给你端上来一盘巨大的泡沫,看着很大,一戳就破,里面啥也没有。
最扎心的发现:
当作者们让那些AI 法官去预测真人用户是否满意时,AI 法官完全失败了。它们的准确率甚至不如随便猜(比如猜“大家都满意”)。
- 结论:AI 根本不知道人类真正想要什么。 它们只能看到表面的数据(比如引用了多少次),却看不懂人类微妙的需求(比如“太啰嗦了”、“太傲慢了”)。
4. 论文的启示:别只信数据,要信人
这篇论文最后告诉我们一个重要的道理:
- 不要只依赖“模拟测试”:在 AI 领域,大家太喜欢用“假人”和"AI 法官”来测试新产品了,觉得这样既快又省钱。
- 必须引入“真人”:就像开餐厅,你不能只让厨师自己尝菜,必须让真正的食客来吃。只有真人用户才能告诉你,这菜是“太咸了”还是“太淡了”,是“太油腻”还是“太干”。
总结来说:
这篇论文就像是一记警钟,敲醒了那些沉迷于“数据指标”的 AI 研究者。它告诉我们:真正的个性化,不是靠算法猜出来的,而是靠真正理解活生生的人。 只有让真人参与进来,AI 才能真正学会“懂你”。
一句话总结:
AI 以为自己很懂你,其实它只是在“自嗨”;只有让真人来试用,才能发现它哪里“没心没肺”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。