💬 NLP
Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
本研究揭示,问题的格式(包括选项数量和具体措辞)会显著影响大语言模型在推理任务上的表现,往往导致推理步骤的准确性与最终答案的正确性之间出现脱节。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,正试图测试一名新学生(人工智能)在解决逻辑谜题方面的聪明程度。你想看看这名学生是否真正理解了数学或逻辑,还是仅仅在猜测正确答案。
这篇论文就像一份成绩单,来自一项研究:研究人员向五名不同的人工智能学生提出了相同的逻辑问题,但他们用三种截然不同的方式提问:
- “论文”风格(简答题): “这里有一个问题。请解决它并告诉我答案。”
- “多项选择”风格: “这里有一个问题。请从这 5 个或 11 个选项中选出正确答案。”
- “对或错”风格: “这里有一个问题和一个特定答案。这个答案是对还是错?”
研究人员想知道:提问的方式是否会改变人工智能的表现?
以下是主要结论,用简单的方式解释:
1. “猜谜游戏”效应
最大的惊喜是,得到正确的最终答案并不总是意味着人工智能做了正确的工作。
- 类比: 想象一名学生参加多项选择题考试。他们可能不知道如何做数学题,但猜了"C"并答对了。如果你只看答题卡,他们得了 100%。但如果你看他们的草稿纸,上面写的全是胡言乱语。
- 发现: 人工智能经常“猜”对了多项选择题中的正确字母,即使其推理步骤是错误的。相反,有时人工智能做了完美的数学计算,却在最后因为被选项搞糊涂而选错了字母。
- 教训: 如果你只检查最终答案,你可能会认为人工智能比它实际更聪明。
2. “菜单”问题(多项选择)
当研究人员给人工智能提供一系列选项供其选择时,选项的数量和使用的词语非常重要。
- 选项太多: 当选项列表从 5 个增加到 11 个时,人工智能的表现往往会下降。这就像提供 5 种冰淇淋口味与提供 50 种口味一样;人工智能感到不知所措,开始更多地猜测。
- “其他”选项: 研究人员添加了一个奇怪的选项,称为“其他”(或“以上都不是”)。
- 如果“其他”是正确答案,即使人工智能算对了数学,它也常常难以选出它。它似乎更喜欢选择一个具体的数字,即使那个数字是错误的。
- 人工智能似乎还有一种“偏爱座位”的偏差。无论选项是否正确,它都会更频繁地选择第一个或最后一个选项。
3. “是/否”陷阱(对或错)
当提出“对或错”问题时,所使用的具体词语会改变结果。
- 对与错: 当答案正确时,人工智能通常更擅长说“对”,而不是在答案错误时说“错”。它似乎倾向于同意。
- 措辞: 将提示从“对或错”改为“是或否”,会使人工智能在某些任务上的表现显著变差。这就像一个人可能会回答“你想去吗?”时说“是”,但在“你想去是真的吗?”这个问题上却犹豫不决。人工智能对这些微小的语言变化非常敏感。
4. “指令”困惑
研究人员试图通过添加指令来帮助人工智能,例如:“先解决问题,然后再判断它是对还是错。”
- 结果: 有时这有帮助,但往往会让人工智能感到困惑,甚至使其表现更差。人工智能有时过于专注于指令,而忘记了问题的实际逻辑。
总结:我们应该学到什么?
该论文得出结论,我们不能仅仅看最终分数来判断人工智能的智能水平。
- 如果你向人工智能提出一个多项选择题,它可能会通过猜测正确的字母来“作弊”,而不理解逻辑。
- 如果你向它提出一个对/错问题,你使用的具体词语可能会诱骗它降低准确性。
- 要真正了解人工智能是否聪明,你必须检查它的“草稿纸”(其推理步骤),而不仅仅是它填写的最终选项。
研究人员建立了一套新的测试(基准),以帮助未来的开发者理解这些怪癖,确保我们在测试人工智能时,不仅仅是在测试它猜测的能力,而是在测试它思考的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。