Million Tutoring Moves (MTM): An Open Multimodal Dataset for the Science of Tutoring
本文介绍了“百万辅导动作”(MTM)项目及其初始版本 MTM v1,这是一个包含 4,654 份数学辅导对话记录的多模态开放数据集,旨在通过提供大规模、可复用的交互数据以服务于研究、实践和人工智能开发,从而推动辅导科学的发展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教朋友骑自行车。你可能会说:“踩快一点”、“向前看”或者“别怕摔倒”。这些就是辅导行为——教师为了帮助学生学而采取的具体言行。
几十年来,研究人员一直知道一对一辅导是最佳的学习方式之一。但存在一个大问题:我们没有庞大的教学时刻库可供研究。现有的大多数记录要么规模太小,要么由演员(而非真实学生)扮演,要么因隐私规定而被封存。这就像试图仅通过阅读几份用秘密代码写成的食谱,或观看一部厨师从未真正下厨的电影来学习烹饪。
于是,百万辅导行为(MTM) 项目应运而生。你可以将其视为由国家辅导观察站构建的庞大、开放获取的“教学食谱书”。
以下是这篇论文关于该新项目的具体阐述,已简化分解:
1. 宏大目标:教学的“黑箱”
作者希望建立一个巨大、安全且开放的真实辅导互动数据库。他们称之为“多模态”,这是一种 fancy 的说法,意指他们最终希望不仅包含文本,还包括音频、视频和绘图(例如数字白板上的内容)。
然而,该库的第一个版本,称为 MTM v1,就像主菜前的“开胃菜”。它严格专注于文本转录(对话的书面记录)。
2. MTM v1 中包含什么?
- 来源:数据来自美国一家真实的非营利在线辅导服务,该服务免费为低收入的中学生和高中生提供帮助。
- 规模:包含 4,654 次真实的辅导课程。
- 内容:这些全是数学课程,涵盖从六年级数学一直到微积分的所有内容。
- 体量:代表了超过 4,000 小时 的对话,其中学生和辅导者说了近 30 万个句子。
3. 隐私的“魔术”(安全且隐蔽)
因为这些是与真实儿童的真实对话,你不能在保护学生身份的情况下直接发布它们。团队并没有简单地划掉姓名和地址(这会让句子听起来支离破碎且怪异)。
相反,他们采用了一种称为**“大隐于市”**的策略。
- 类比:想象一部侦探小说,反派的姓名是“约翰·史密斯”。如果你只是划掉它,句子读起来就是:“约翰·史密斯去了商店。”这看起来很可疑。
- MTM 的方式:他们用符合语境的占位符(如“学生”)替换“约翰·史密斯”。句子现在读作:“学生去了商店。”
- 为何重要:这保持了对话的自然流畅,使研究人员能够研究辅导者如何交谈,而无需知道学生是谁。他们利用先进的人工智能以高精度查找并替换了私人信息(如姓名、地址和电话号码)。
4. 为何这很重要
该论文认为,要改进教学并构建更好的人工智能辅导者,我们需要看到“真实”的东西。
- 对于研究人员:这为他们提供了一个庞大的数据集,用于研究教师如何实际帮助学生解决问题、克服困惑并摆脱困境。
- 对于人工智能:它提供了所需的“训练数据”,基于真实的人类互动而非虚假脚本,来教导计算机如何成为有用的辅导者。
- 对于未来:这仅仅是第一步。最终目标是将该库扩展到包含跨多个学科的数百万次互动,并最终添加视频和音频以捕捉学习的全貌。
总结
百万辅导行为项目旨在打开辅导的“黑箱”。通过发布大量安全且匿名的真实数学辅导对话集合,他们为科学家和开发者提供了一种新工具,以理解学习是如何发生的,以及如何构建更好的工具来帮助学生取得成功。这是旨在容纳数百万个教学时刻的墙壁上的第一块砖。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。