← 最新论文
💻 computer science

Fine-Tuning Large Language Models for Codebook-Guided Coding of Students' Mathematics Metaphor Responses

本研究表明,通过 LoRA 对紧凑型开源权重大型语言模型进行微调,可以显著提升它们在编码学生数学隐喻方面的准确性和可靠性,使其能够超越或媲美专有模型,同时为教育评估提供一种可扩展且注重隐私的替代方案。

原作者: Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解谜题的侦探,但你寻找的不是指纹,而是人们谈论感受的方式中所隐藏的线索。在教育领域,研究人员经常要求学生用自己的语言写下想法——比如,“如果数学是一种食物,它会是什么?”这些开放式回答是了解孩子们对学校感受的宝库,但要逐一阅读它们简直是一场噩梦。阅读并把成千上万个这样的故事分类(例如“快乐”、“沮丧”或“困惑”)需要耗费人类专家大量的时间。这正是人工智能(AI)介入的地方。具体来说,大语言模型(LLM)就像是超级聪明的机器人,能够阅读并理解人类语言。研究人员一直在问一个大问题:我们能否教会这些机器人像人类专家侦探一样工作?如果我们做到了,我们能否让它们在自己的电脑上运行,以保护学生的隐私,而不是将私密数据发送给大型科技公司?

这项研究深入探讨了那个问题。研究人员收集了一组包含 2,265 条真实学生关于数学隐喻的回应,并教会了两个较小的开源 AI 模型像人类专家那样进行编码。他们使用了一种特殊的训练技术,叫做“微调”(fine-tuning),这就像是给机器人进行一场使用人类专家答案库进行的“速成班”训练。结果令人惊喜:经过这种训练,这些体积更小、成本更低的 AI 模型变得如此擅长这项工作,以至于它们经常击败那些公司通常销售的庞大、昂贵且不透明的“黑盒”模型。这项研究表明,通过适当的训练,我们可以拥有强大、私密且准确的 AI 工具,直接在我们的课堂上使用,帮助理解学生对数学的感受,而无需将数据发送到任何地方。

侦探的困境:读懂字里行间

把学生的隐喻看作是一个秘密代码。当一个学生说“数学就像一只狗,因为它是一个忠诚的朋友”时,他们不仅仅是在谈论宠物;他们是在告诉我们他们在数学中感到安全和快乐。但如果他们说“数学就像一只蚊子,因为它缠着我不放”,那么他们是在表达数学很烦人且挥之不去。这些是包裹在简单文字下的复杂情感。

几十年来,研究人员一直依赖人类专家来解码这些信息。这有点像有一支翻译团队在尝试手工翻译一座图书馆的书籍。这既缓慢、昂贵,又难以规模化。如果你有 100 名学生,人类可以完成;如果你有 100,000 名,人类会感到疲惫,整个过程就会停滞。

大语言模型(LLM)登场了。你可以把 LLM 看作是一个读遍了几乎整个互联网的机器人。它非常擅长预测句子中接下来的内容并理解语境。但是,就像一个还没上过你正在教的那门特定课程的聪明学生一样,通用的机器人可能并不完全知道你究竟希望它如何对这些隐喻进行分类。它可能会在你想要“中性”时猜成“快乐”,或者它可能会错过“具有挑战性”与“具有威胁性”之间的微妙区别。

此外,还有一个隐私问题。大多数超强大的机器人(比如来自大型科技公司的那些)都住在它们的服务器上。要使用它们,你必须将学生私密的写作内容发送给它们。对于学校来说,这就像是把一本写满秘密的日记交给一个陌生人。研究人员想知道,他们是否可以构建一个住在自己电脑上的机器人,经过专门的任务训练,并保护秘密的安全。

实验:教机器人规则

研究人员设置了一场比赛。在其中一边,是“大厂”冠军:两个强大的、专有的模型(GPT-4o mini 和 GPT-5 mini),它们是以“原样”使用的。它们被给予了一套规则(代码本)并被要求对学生隐喻进行分类。它们没有接受任何特殊训练;它们只需要根据指令自行理解。

在另一边,是两个“开源权重”模型(DeepSeek-R1 1.5B 和 Mistral 7B)。这些是更小、更便宜的模型,任何人都可以下载并在自己的服务器上运行。研究人员拿这些开源模型,并使用一种基于 LoRA 的监督微调技术给了它们一个“速成班”。

想象一下你在教一只狗去捡球。“仅提示”(prompt-only)的方法就像只是不断地对狗说:“去把球捡回来!”而“微调”(fine-tuning)方法则像是带着狗参加训练营,你向它展示如何精准地抓取球、带回来并把它放在你的手里,过程中使用了成千上万个人类完美操作的例子。研究人员向开源模型输入了 2,265 个已经被人类专家正确分类的学生隐喻示例。模型学会了模仿人类专家的决策。

任务分为两个部分:

  1. 效价-强度编码(Valence-Intensity Coding): 情感有多强烈?是非常负面(1)、中性(3)还是非常正面(5)?
  2. 主题编码(Thematic Coding): 故事是什么?数学是一个“工具”、“威胁”、“旅程”还是一项“枯燥的差事”?

结果:弱势者获胜

比赛的结果是清晰且令人兴奋的。在训练之前,这些较小的开源模型表现得很糟糕,它们在胡乱猜测。但在经历了“速成班”(微调)之后,它们发生了蜕变。

性能飞跃:
微调后的模型不仅变得更好,而且变得好得多

  • 对于“食物”隐喻,DeepSeek 模型的准确率从 0.369 跳升至 0.787
  • Mistral 模型在食物隐喻上的准确率从 0.207 提升至 0.778
  • 在“动物”隐喻方面,Mistral 模型从 0.267 提高到了 0.766

在 AI 世界中,这些数字是非常巨大的。这意味着经过训练的机器人现在与人类专家的契合程度,几乎达到了两个人类专家彼此之间达成一致的水平。

击败巨人:
转折点在于:经过训练的小型模型实际上在许多类别中击败了那些昂贵的、仅靠提示的“大厂”模型。

  • 微调后的 Mistral 7B 模型在食物和动物隐喻的几乎所有指标上都优于 GPT-4o mini 和 GPT-5 mini。
  • 只有在极少数特定的、罕见的主题上,小型模型仍表现得有些吃力,大模型才赢得了胜利,但即便如此,差距也很小。

“稳定性”测试:
AI 的一个大问题是,如果你问它同一个问题两次,它可能会给你两个不同的答案。这对科学研究是不利的。研究人员通过运行三次模型进行了测试。

  • 未经训练的 DeepSeek 模型表现得非常不稳定,稳定性得分仅为 0.592
  • 但经过训练后,它的稳定性飙升至 0.992
  • 微调后的 Mistral 模型表现完美,得分达到了 1.000
  • 甚至连那些大型商业模型也不如经过训练的开源模型稳定(GPT-5 mini 在主题稳定性上得分为 0.644)。

这表明,针对特定示例对模型进行训练,不仅能让它变得更聪明,还能让它变得更一致、更可靠。

这对未来意味着什么

这项研究表明,我们不需要依赖庞大、昂贵且存在隐私风险的 AI 系统来分析学生的感受。通过利用较小的开源模型并用人类示例对其进行训练,我们可以创造出具备以下特性的工具:

  1. 准确: 它们能匹配人类专家。
  2. 私密: 它们可以在学校自己的电脑上运行,保护学生数据安全。
  3. 可扩展: 它们可以在几秒钟内处理数千条回应。

然而,研究人员也谨慎地指出,这并不是解决一切问题的万灵药。模型在处理非常罕见的主题(如对数学的具体社会观点)时仍然有些吃力,这表明如果一个话题非常罕见,机器人可能需要更多的示例来进行学习。此外,这项研究仅观察了谈论食物和动物的 6 至 8 年级学生,因此我们尚不清楚它是否适用于谈论代数的初中生或谈论微积分的大学生。

但主要的结论是充满希望的:我们可以构建属于自己的“侦探机器人”,它们既聪明又安全,并且准备好帮助教师理解学生言语中隐藏的情感。教育测评的未来可能不在云端,而是在学校自己的服务器上,由最了解学生的专家亲自训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →