在教育领域,准确了解一名学生掌握了什么知识,远比仅仅给出一个分数要复杂得多。为了真正诊断学习者的优势与不足,教育工作者依赖于一种被称为 Q 矩阵(Q-matrix)的专门化图谱。这张图谱充当了一座桥梁,将具体的测试题目与解决这些题目所需的精确认知技能联系起来。例如,一道关于分数加法的题目不仅仅是一个数学问题;它是对特定认知能力(如寻找公分母)的测试。传统上,创建这些图谱是一个缓慢且昂贵的过程,仅限于由人类专家进行,他们必须对每一个题目和技能进行极其繁琐的分析。这种人工工作如此耗时,以至于往往限制了学校根据个体需求调整教学的速度。此外,现代利用人工智能来加速这一过程的趋势也引入了新的担忧。如今许多最强大的 AI 工具都是庞大的、封闭的系统,需要将敏感的学生数据通过互联网发送到遥远的服务器,这引发了对隐私和安全的严重质疑。
维尔纽斯大学(Vilnius University)的西马斯·斯托库斯(Simas Stočkus)开展的一项新研究探索了一条不同的路径,即探讨是否可以在标准的笔记本电脑上直接运行更小、更精简的人工智能模型,并同样出色地完成这种映射任务。研究人员测试了多种这类本地模型,这些模型旨在足够紧凑,可以在消费级硬件上运行,而无需将数据发送到设备之外。其目标是观察这些较小的模型是否能在保持学生信息私密性并避免云端计算高昂成本的同时,准确地将测试题目与所衡量的技能联系起来。该研究侧重于一种向 AI 提问的特定方法:研究人员并没有要求模型针对每个问题逐一决定一项技能,而是要求模型观察一个问题并在一份完整的答案中列出所有必要的技能。这种方法模仿了人类教师在扫视一个问题时,能够瞬间识别出其中涉及的全套概念,而不是逐一进行核对。
研究还强调了以往测试某些 AI 系统时存在的一个关键缺陷。当模型被要求孤立地评估每项技能时,它们经常会出现“幻觉”(即虚构不存在的联系),导致生成的图谱不准确。然而,当模型被允许同时看到整个技能列表并针对整个问题做出单一决策时,它们的准确性显著提高了。这种方法的转变证明,当模型不被强迫以碎片化的方式工作时,它们能更好地理解问题的语境。该研究明确否定了“只有大规模、基于云端的超级计算机才能胜任此项任务”的观点。相反,它表明开源模型(即可以下载并在个人电脑上运行的模型)是一种实用且安全的隐私保护替代方案。这些本地模型不需要与商业 AI 服务相关的庞大数据中心或昂贵的订阅费用,使得先进的教育分析对于那些负担不起企业级基础设施的学校和研究人员而言也变得触手可及。
最终,这项工作表明,自动化教育评估的未来并不一定取决于构建规模越来越大的人工智能系统。通过优化我们向模型提问的方式,并利用更小、更本地化的版本,我们完全可以创造出既准确又尊重学生隐私,且能在日常硬件上高效运行的诊断工具。该研究为希望在不牺牲数据安全或造成沉重经济负担的前提下实现认知诊断的教育工作者和开发者提供了一份清晰的路线图。虽然研究重点在于特定的数据集和模型类型,但其发现为未来的工作奠定了坚实的基础,包括对这些模型进行特定学科的微调,以及在 AI 从未见过的真实课堂评估中对其进行测试。证据表明,我们现在可以构建出既聪明到足以理解学生学习,又足够小巧以确保学习过程安全的智能系统。
项目向量法(Item-Vector / Single-Pass Generation): LLM 同时接收所有 K 个属性定义,并在单次通过中为每个题目输出一个完整的 K 维二元向量。这种方法保留了属性间的感知能力,符合教育数据典型的稀疏性特征(通常每道题对应 1–3 个技能),并将推理工作量降低了 K 倍。