CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions
本文介绍了 CrowdMath,这是一个包含来自 MIT PRIMES–AoPS 项目的 164 场专家标注的协作研究讨论的数据集,用于基准测试大语言模型对动态数学进展的理解能力,并揭示了虽然模型可以跟随局部的讨论流,但在识别开放问题解决过程中个体贡献的功能性意义方面仍存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观察一群才华横溢的朋友正试图共同解决一个巨大的、未解的谜题。他们并不是在安静的图书馆里工作,而是在一个数字论坛上大声讨论想法。一个人提出了一个路径,另一个人发现了逻辑中的裂缝,第三个人修复了裂缝,最终,经过数十次来回的信息往来,他们终于拼凑出了完整的图景。
这篇论文介绍了 CROWDMATH,这是一个捕捉到了这种混乱且具有协作性的解谜过程的新型数据集。
以下是研究人员所做工作的详细分解,使用了简单的类比:
1. 当前“数学 AI”存在的问题
目前,大多数针对人工智能(AI)在数学方面的测试就像是选择题考试。你给 AI 一个清晰的问题(比如“2+2 等于多少?”)和一个唯一的正确答案。如果 AI 答对了,它就通过了。
作者认为,这就像是通过只要求厨师在食谱已经写好的情况下烤一个蛋糕来测试他们。这无法告诉我们,如果食谱缺失、原料错误或者烤箱坏了,这位厨师是否能够应对。真正的数学研究不是一条直线;它是一条充满死胡同、错误的转向以及随着时间推移而产生的“顿悟时刻”的曲折路径。
2. 新的数据集:数学界的“真人秀”
研究人员从一个名为 CrowdMath 的项目中收集了 164 个真实的“故事弧”(story arcs),在该项目中,高中生和大学生在网上共同解决高难度的数学问题。
可以将这些故事弧想象成侦探剧的剧集:
- 谜团: 一个没有已知答案的数学问题。
- 线索: 人们发布的部分想法、提出问题或发现错误。
- 红鲱鱼(误导信息): 导致无果的错误理论。
- 解决方案: 将所有内容串联成一个证明的最后一条帖子。
团队不仅保存了文本,还为每一条帖子都标注了它在故事中的“角色”。这条帖子是开启了调查?是取得了进展?是发现了某人逻辑中的错误?还是结案了?
3. 测试 AI:“下一集是什么?”的游戏
研究人员让六个目前最智能的 AI 模型使用这个数据集玩两场游戏:
游戏 A:“接下来会发生什么?”(下一贴预测)
他们向 AI 展示一段对话的开头,并让它猜下一条消息是什么。
- 结果: AI 在这方面表现得相当出色(准确率约为 83–88%)。这就像是一个熟悉角色的电视观众,能够猜出:“噢,侦探正准备提问。” AI 理解了对话的流向。
游戏 B:“这个人实际上在做什么?”(角色分类)
他们向 AI 展示一条特定的帖子,并问道:“这个人是在解决问题、犯错,还是仅仅在提问?”
- 结果: AI 在这方面表现得很糟糕(准确率仅约为 42%)。它无法区分一个中间步骤和一个最终解决方案。
- 类比: 这就像是一个可以预判剧情转折,但却分不清一个角色是在尝试开门还是真正打开了门的影评人。AI 看到了文字,但它并不理解这些贡献的权重或重要性。
4. 核心结论
论文得出结论:虽然 AI 在解决有明确“起点”和“终点”的数学问题(如教科书问题)方面变得非常擅长,但在理解数学是如何被真正“发现”的过程中仍然很差。
目前的 AI 模型就像是优秀的优等生,它们可以背诵问题的解法,但却是糟糕的研究伙伴。它们还无法判断一个新想法是一个突破还是一个死胡同,也无法分辨一条评论是一个关键的纠正还是一个随意的提问。
简而言之: AI 可以跟随对话,但它尚未理解发现的旅程。它知道目的地在哪里,但在到达那里的过程中,它会在步骤中迷失方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。