← 最新论文
💬 NLP

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

本研究通过模型蒸馏方法评估了大语言模型解决静力学问题的能力,结果表明,尽管它们在纯文本问题上表现良好,但当涉及图表和多步推理时,其准确率会显著下降,这是由于在一致性应用视觉信息方面存在挑战,而非图像识别能力的限制。

原作者: Tanner Culleton, Hung-Fu Chang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Tanner Culleton, Hung-Fu Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、博学多才的学生名叫“ChatGPT”,他几乎读遍了图书馆里的每一本书。你想测试这个学生是否真的能解决高难度的工程作业题,特别是在一个叫做静力学(Statics,研究力如何在静止物体上保持平衡,例如桥梁或起重机)的学科中。

以下是研究人员所做的工作,用简单的语言解释如下:

1. “复制粘贴”问题

首先,研究人员尝试了最显而易见的方法:他们直接拿教科书上的题目去问 ChatGPT。

  • 结果: 场面一度非常混乱。这个“学生”感到很困惑,尤其是当题目涉及 3D 图形时。它会搞混方向(比如把“右”说成“上”),并且会让数学计算出错。
  • 类比: 这就像是让一个学生去读一张用他几乎还不精通的语言编写的地图。他认识那些词汇,但却无法理解其中的方向。

2. “逆向工程”技巧(模型蒸馏)

由于教科书的问题太难了,研究人员尝试了一个聪明的技巧,叫做模型蒸馏(Model Distillation)。他们不再要求 ChatGPT 去解决“别人”提出的问题,而是要求它编写自己的问题

  • 逻辑: 他们的想法是:“如果 ChatGPT 能写出一个好的问题,那么它很可能知道那个特定类型问题的答案,因为它从自己的训练数据中‘学习’了它。”
  • 过程: 他们要求 ChatGPT 生成 50 个静力学题目。他们注意到这个“学生”总是反复编写同样的简单、2D(平面)问题。因此,他们挑选了 ChatGPT 似乎理解得最好的 25 个独特的题目。

3. 三个层级的测试

研究人员利用这 25 个问题创建了三场不同的“考试”,以观察这个学生的思维方式:

  • 考试 A(纯文本): 他们要求 ChatGPT 仅使用文字来解决它自己编写的问题。
    • 结果: 满分(100%)。 这个学生知道答案,因为问题就是它自己写的!
  • 考试 B(带图片): 他们针对这些纯文本问题绘制了简单的示意图。
    • 结果: 分数降至 68%。 这个“学生”虽然还能读懂文字,但图片干扰了它。它难以将绘图与数学逻辑联系起来。
  • 考试 C(“新数字”测试): 他们使用了考试 B 中的图表,但更改了所有的数字(例如,将一个力从 10 磅改为 15 磅)。
    • 结果: 分数降至 60%。 这证明该学生并不是在死记硬背答案。它是在尝试重新解决问题,但在中间的过程中不断出错。

4. 他们学到了什么?

研究人员将 ChatGPT 与另一个 AI 学生“Gemini”进行了对比。

  • 重大发现: 问题不在于 AI 看不到图片,而在于它无法进行步骤化思考
  • 类比: 想象一位厨师能完美地阅读食谱(纯文本)。如果你把食材和一道菜的照片递给他(图表),他仍然可以烹饪。但如果你要求他烹饪一顿复杂的、多道菜的盛宴,且要求他在中途调整食谱(多步骤推理),他就会开始掉落食材或忘记下一步要做什么。
  • 结论: AI 非常擅长简单的、单步的数学运算。但当它必须观察一张图片、提取信息,然后将这些信息用于三四个不同的步骤以得到最终答案时,它就迷失了。它遵循了正确的方法,但往往得到了错误的数字

总结

论文得出结论:虽然 AI 在阅读和写作方面变得非常出色,但在视觉推理长且复杂的逻辑链方面仍然显得有些笨拙。它就像一个理论知识完美,但一旦被要求将理论应用于带有变化数字的真实世界图纸时就会不知所措的学生。

注: 研究人员仅测试了这些特定的工程问题。他们并未声称这适用于医疗诊断、法律建议或其他领域,也没有提出未来如何改进 AI 的建议。他们只是报告了 AI 在这组特定的工程谜题中的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →