BEAGLE: Behavior-Enforced Agent for Grounded Learner Emulation
BEAGLE 是一个神经符号框架,它将自我调节学习理论与半马尔可夫模型、注入缺陷的贝叶斯知识追踪以及解耦的智能体设计相融合,以模拟开放性问题解决中真实且易出错的学生学习行为,从而在真实学生数据面前有效通过了人类图灵测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位教师,正试图设计一种新方法,帮助学生学会编程。为了测试你的新教学方法,你需要观察它在那些挣扎、困惑且不断犯错的学生身上如何运作。但你不能仅仅要求真实的孩子反复失败;这既昂贵又耗时,还会引发隐私担忧。
因此,你想要构建一个数字机器人学生,其行为与真实的人类学习者完全一致。
问题在于,当前的人工智能(大语言模型)过于聪明。如果你让它们“假装成一个困惑的初学者”,它们通常还是会完美地解决问题。它们就像一位天才演员,忘记了台词,却即兴发挥出一个完美的结局,而不是在场景中跌跌撞撞。
本文介绍了BEAGLE,一种新型人工智能,旨在刻意成为一个“糟糕”的学生。它不仅仅是假装;它内置了一个特殊的内部引擎,迫使它挣扎、陷入困境,并以艰难的方式学习,就像真实的人类一样。
以下是 BEAGLE 的工作原理,分解为简单的部分:
1. “大脑”与“双手”(架构师)
大多数人工智能试图同时思考和编写代码。BEAGLE 将这项工作分为两个截然不同的角色:
- 策略者(大脑): 这部分决定学生“正在思考什么”。它说:“我很困惑”,或者“我认为重力计算有误”,或者“我只是在瞎猜”。它设定了情绪和目标。
- 执行者(双手): 这部分实际编写代码。关键在于,如果“大脑”指示它犯特定错误,它不允许自行修正错误。如果策略者说“我忘了添加重力部分”,执行者必须编写忘记重力的代码,即使人工智能知道正确答案。这防止了人工智能通过默默自我修正来“作弊”。
2. “交通警”(符号控制)
真实的学生并非按直线工作。他们构建一点,陷入困境,尝试修复,变得更加困惑,然后休息一下,再试一次。
BEAGLE 使用一个交通警(半马尔可夫模型)来控制流程。它决定:
- “好的,接下来的 5 分钟,你必须处于调试状态(卡在错误上)。”
- “现在,切换到规划状态,持续 2 分钟。”
- “现在,你处于执行状态(只是盲目打字,没有思考)。”
这确保人工智能不会仅仅用 6 个完美的步骤解决问题。它迫使人工智能花费时间在真实学生所陷入的混乱、迭代的循环中。
3. “眼罩”(知识追踪与缺陷注入)
真实的初学者遭受“无能诅咒”:他们不仅会犯错,甚至不知道自己不知道什么。他们可能会尝试使用从未听说过的数学工具。
BEAGLE 使用一个眼罩系统:
- 它追踪学生“知道”什么(像一张知识地图)。
- 如果学生被设定为在“三角学”方面是初学者,BEAGLE 会阻止人工智能使用任何相关的数学库。
- 人工智能无法使用正确的工具,而必须即兴发挥。它可能会尝试猜测答案,或者编写一个虚假、破碎的数学函数版本。这创造了“未知的未知”——即因学生 genuinely 缺乏概念而产生的错误,而非因为打错了字。
4. “图灵测试”(它奏效了吗?)
研究人员通过向真实的人(学生、教师和专家)展示真实学生代码和 BEAGLE 代码的混合体来测试 BEAGLE。他们问道:“哪一个是人类?”
结果令人震惊:人类无法区分。
- 猜测的准确率约为53%,基本上等同于抛硬币。
- 即使是拥有多年经验的专家也无法识破人工智能。
- 人工智能的代码看起来杂乱无章,充满情感(“唉,为什么这不起作用?”),并且充满了真实学生常犯的那些重复性错误。
为什么这很重要
BEAGLE 不仅仅是一个有趣的技巧;它是教育研究的安全沙盒。
- 压力测试: 教师可以使用 BEAGLE 来测试新的辅导软件。他们可以观察他们的应用程序是否有助于“困惑的机器人学生”学习,而无需冒险让真实儿童的教育受到影响。
- 隐私: 你不需要收集真实儿童的私人数据来训练这些系统。
- 理解挣扎: 它有助于研究人员研究学生为何陷入困境,因为 BEAGLE 陷入困境的原因是正确的(缺乏知识),而不仅仅是因为人工智能在随机行事。
简而言之,BEAGLE 是第一款成功学会如何成为一个挣扎的学生的人工智能,它是通过被迫遵循人类困惑的规则,而不仅仅是被告知“假装困惑”来实现的。它证明,要模拟人类学习者,你不能仅仅要求一个聪明的人工智能去假装;你必须构建一个系统,迫使它变得不完美。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。