← 最新论文
💬 NLP

Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context

该论文通过构建首个数学推理基准,系统揭示了包括 o1 在内的各类大语言模型在模拟“反向表现”(如低水平学生)这一反事实指令遵循任务上存在显著困难,且当叠加种族等身份特征时表现进一步恶化,从而凸显了该领域研究的挑战与必要性。

原作者: Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一场特殊的“演技考试”。

想象一下,现在的 AI 就像是一个超级学霸,它读过世界上几乎所有的书,做数学题几乎从不犯错,而且总是自信满满、逻辑清晰。这是它的“默认设置”。

但是,研究人员想问一个问题:如果要求这个“超级学霸”去扮演一个“数学很差、经常犯错、甚至有点焦虑的普通学生”,它能演得像吗?

这就好比让一个奥运金牌得主,在赛场上故意表现得笨手笨脚、算错数、甚至因为紧张而发抖。这听起来很简单,对吧?但论文发现,AI 真的很难做到这一点。

以下是这篇论文的核心内容,用几个生动的比喻来解释:

1. 核心挑战:让“学霸”装“学渣”

研究人员给 AI 下达了指令:“你现在是一个数学很差的中学生,做题时要犹豫、要犯错、要表现出很困惑的样子。”

  • 理想情况:AI 应该像那个图里的“低分学生”一样,掰着手指头数数,算错 3+3+3=83+3+3=8,然后自我怀疑,最后给出一个错误的答案。
  • 实际情况:大多数 AI(包括最先进的 OpenAI o1 模型)虽然嘴上说着“哎呀我好笨”,但脑子里的算盘还是打得飞快。它们往往会在最后关头“偷偷”把答案算对,或者虽然过程写得磕磕绊绊,但结果依然是 100 分。

比喻:这就像让一个顶级厨师假装不会切菜,他嘴上说“哎呀刀太滑了”,手却在空中比划,最后端上来的菜还是切得整整齐齐。AI 很难真正“忘记”它已经学会的正确答案。

2. 实验发现:AI 的“演技”很尴尬

研究人员测试了各种模型(包括 GPT-4, Claude, Llama 等),发现:

  • 很难“降智”:即使明确要求 AI 犯错,它的正确率依然高得吓人。比如 OpenAI o1,无论让它扮演多笨的学生,它的正确率依然保持在 99%。
  • 只有“皮囊”变了:有些模型虽然算对了题,但它的说话方式变了。它会加上很多“嗯……让我想想”、“我不太确定”、“哎呀我算错了”这样的废话。
    • 比喻:就像一个演员,虽然台词背得一字不差(答案是对的),但他穿着破衣服、走路跌跌撞撞(语气犹豫、逻辑混乱),试图让你觉得他是个新手。
  • 自我反思也没用:研究人员尝试让 AI 先算一遍,然后自己反思“我是不是太聪明了?我要改得笨一点”。结果发现,AI 往往越反思越聪明,或者只是把错误改得更隐蔽,依然无法真正“变笨”。

3. 更难的挑战:加上“种族”标签

研究还做了一个更复杂的实验:让 AI 同时扮演“数学差的学生”和“特定种族(如非裔、白人、拉丁裔)”的角色。

  • 结果更糟糕:当加上种族背景后,AI 更难表现出“数学差”的样子了。原本就难演的“学渣”戏码,现在连“学渣”和“特定种族”的结合体都演不像了。
  • 潜在的偏见:研究发现,AI 对不同种族的反应是不一样的。比如,让它扮演“非裔数学差学生”时,它可能比扮演“白人数学差学生”时更容易算对题。这说明 AI 在模仿不同人群时,可能存在隐形的刻板印象偏见,导致它无法公平地模拟出“大家都一样笨”的状态。

4. 为什么这很重要?(为什么要研究这个?)

你可能会问:“让 AI 装笨有什么大不了的?”

这就好比我们要用 AI 来模拟课堂,让 AI 扮演“差生”来给真人学生当“陪练”。

  • 真实的教学:如果真人学生能看到 AI 扮演的“差生”犯下典型的错误(比如把 3+33+3 算成 $8$),他们就能学会如何纠正这些错误,从而更好地掌握知识(这叫“通过教别人来学习”)。
  • 现在的困境:如果 AI 扮演的“差生”其实是个“伪装者”,最后答案还是对的,那真人学生就学不到东西了,因为 AI 没有展现出真实的挣扎和错误。

总结

这篇论文告诉我们:目前的 AI 太“聪明”了,以至于它们很难真正“装傻”。

它们可以模仿笨拙的语气,但很难在核心逻辑上真正“降智”并保留错误。这就像让一个拥有超级大脑的机器人去假装成一只刚出生的小猫,它可能学得像,但一旦遇到真正的难题,它的“超级大脑”就会不由自主地跳出来解决问题。

这对未来的应用是一个巨大的挑战:如果我们想用 AI 来模拟真实世界中各种能力水平的人(无论是教育、心理咨询还是社会模拟),我们需要先教会 AI 如何真正地、可控地“变笨”,而不仅仅是嘴上说说。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →