← 最新论文
💬 NLP

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

本文证明了使用边界框裁剪手写学生回答,能显著提高小语言模型在基于视觉的教育评估任务中的评分准确度与计算效率。

原作者: Lachlan McGinness

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Lachlan McGinness

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机可以阅读你的手写字迹、理解你的想法,甚至为你批改作业的世界。这就是人工智能在教育领域的前沿阵地,在这里,“小语言模型”(SLMs)成为了新的英雄。可以将这些模型想象成聪明且紧凑的数字大脑,它们可以在普通的笔记本电脑或学校服务器上运行,从而保护学生数据的隐私,并比依赖大规模云端超级计算机的方式更节省成本。然而,这里有一个问题:虽然这些“小脑袋”擅长阅读文本,但当面对整页杂乱的手写笔记时,它们有时会感到不知所措。这就像是要求一名侦探在一间堆满了数千件无关物品的房间里寻找一个特定的线索;这种巨大的视觉“噪声”会让它们感到困惑,导致它们错过答案,或者在试图理清头绪时浪费大量精力。

来自澳大利亚国立大学的拉赫兰·麦金尼斯(Lachlan McGinness)的这篇论文正是针对这一问题展开研究的。作者提出了一个简单而强大的问题:如果我们只把页面中包含答案的具体部分展示给计算机,而不是展示整个杂乱的页面,情况会怎样?为了测试这一点,研究团队使用了 2025 年澳大利亚物理奥林匹克竞赛的扫描试卷,学生们需要针对一个关于行走的问题写下一个单词答案(“摩擦力”)。他们测试了八种不同的 AI 模型,其规模从拥有 40 亿参数的微型“小狗”到拥有 720 亿参数的“巨人”,并给了它们两种类型的指令:一些被告知要“一步步思考”(一种被称为“思维链”的技术),而另一些则仅被要求给出答案。至关重要的是,他们测试了两种视觉设置:一种是 AI 看到整个双页考试扫描件,另一种是 AI 只看到围绕特定问题和答案区域的裁剪“边界框”。

结果证明,“裁剪”法取得了压倒性胜利。研究发现,当 AI 模型仅看到相关的边界框时,无论模型大小如何,它们在批改答案时的准确率都显著提高。事实上,展示全页往往会干扰模型,导致评分降低。有趣的是,“一步步思考”的指令并没有起到太大作用;模型在直接给出答案时表现得同样出色(有时甚至更好)。最令人惊喜的胜利在于效率:通过裁剪图像,模型需要处理的“视觉标记”(图像的数字构建块)大幅减少,这使计算成本降低了一半以上。例如,查看全页时的平均标记数约为 1,500 个,而查看裁剪后的方框时则降至不足 700 个,这使得每份试卷批改所需的能量从 45 万亿次运算降至约 17 万亿次运算。

该论文明确反对仅仅通过让 AI “思考得更努力”(使用思维链)来解决这些错误的观点;数据表明,对于这项特定任务,清理视觉输入比改变思考过程更为有效。他们指出,虽然实际的考试问题是关于人类行走的,但提供给模型的提示文本明确将问题描述为关于“蜗牛”的(这可能是由于页面上有一个巨大的蜗牛图解),并且模型被指示在这种语境下寻找答案。他们总结道,对于希望使用这些经济、私密的 AI 工具来批改手写试卷的学校来说,秘诀并不一定是更大的模型或更聪明的提示词,而是一个简单的预处理步骤:将图像裁剪以去除杂乱内容。这一小小的改变让即使是最微小、最具能效的模型也能表现得像冠军一样,使自动化批改成为未来教育中一个更加现实且实用的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →