Framing, Judging, Steering: An Assessable Competency Model for Teach-ing Students to Reason With Generative AI
本文介绍了 CoRe-3,这是一个通过将任务构建(Framing tasks)、输出评判(Judging outputs)和模型引导(Steering models)这三种截然不同的技能进行分离,从而评估学生有效使用生成式人工智能能力的胜任力模型,并通过一个展示这三种技能的解离度与收敛效度的开放平台验证了该框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是该论文的通俗易懂版解释,通过类比使概念清晰明了。
核心问题:陷入“神奇答案”的陷阱
想象你拥有一个神奇的精灵(生成式 AI),它可以瞬间帮你写完作业、解决数学难题或起草邮件。这篇论文指出,目前的学校仍在测试学生在没有这个精灵的情况下完成这些任务的能力。但在现实世界中,精灵始终都在身边。
危险不在于使用精灵,而在于不加批判地使用它。如果你只是向精灵索要答案并直接复制,你并没有在学习。你只是把大脑的工作“外包”给了机器。你得到了正确的答案,但你的思维水平却原地踏步。
作者认为,我们需要教导和测试的真正技能不是“如何获得答案”,而是**“如何与精灵协作”**。
解决方案:FJS 模型 (CoRe-3)
作者提出了一种衡量人类如何与 AI 协作的新方法。他们称之为 CoRe-3(协同推理)。他们将这一过程分解为三种截然不同的技能,并将其缩写为 FJS:
构思 (Framing) —— 建筑师
- 定义: 在你向精灵寻求帮助之前,你必须先弄清楚你到底要解决什么问题。
- 类比: 想象你雇佣了一位承包商来盖房子。如果你只说“给我盖个房子”,你会得到一团糟。你需要说:“在这一块特定的土地上,预算 20 万美元以内,建造一栋带太阳能屋顶的三居室住宅。”
- 技能: 在 AI 开始工作之前,将模糊、混乱的问题转化为清晰、具体的指令。
评判 (Judging) —— 检查员
- 定义: 精灵给了你一个答案。你的任务是观察它并判断:“这真的对吗?”
- 类比: 承包商把蓝图交给你。你不能只是点头说“太棒了!”,你要检查:“等等,你把洗手间放在屋顶上了?这不对。而且你用木头做地基?这错了。”
- 技能: 敏锐地发现 AI 输出中的错误、缺失的细节或隐藏的假设。
引导 (Steering) —— 飞行员
- 定义: 一旦你发现了错误,你必须告诉精灵如何修复它们。
- 类比: 你不能只说“修一下”。你要说:“把洗手间移到二楼,并将地基换成混凝土。另外,确保厨房朝南。”
- 技能: 提供具体的、纠正性的反馈,以引导 AI 走向更好的结果。
核心观点:为什么要将它们分开?
以往测试 AI 技能的方法只是给学生一个统一的“提示词工程(Prompting)”分数。作者认为,这就像是在不检查厨师是否买对了食材(构思)、是否尝了汤的味道(评判)或是否调整了盐分(引导)的情况下,仅凭“烹饪”一项来给厨师评分。
- 构思 (Framing) 发生在 AI 发声之前。
- 评判 (Judging) 发生在 AI 发声之后。
- 引导 (Steering) 发生在你评判之后。
论文的核心主张是:这些是三种不同的技能。你可以擅长构思(提出好问题),但在评判方面表现糟糕(漏掉 AI 的错误)。或者你可以擅长引导(修正问题),但最初的计划却很糟糕。作者证明了这些技能是可以被分别衡量的。
他们是如何测试的(“机器人学生”实验)
为了证明这些技能是独立的,作者构建了一个名为 CoReasoningLab 的数字实验室。
- 设置: 他们创建了 80 个“模拟学生”(模拟人类行为的计算机程序)。他们将一些程序设定为擅长构思,一些擅长评判,一些擅长引导,并将这些技能进行排列组合。
- 测试: 他们给这些机器人学生布置了一系列挑战。
- 结果: 评分系统完美运作。
- 当一个机器人被设定为“不擅长”构思时,它的构思分数下降了,但它的评判分数保持不变。
- 当一个机器人“不擅长”引导时,它的引导分数下降了,但它的构思分数依然很高。
- 结论: 该系统成功证明了这些技能是相互独立的。你可以精通其中一项,却在另一项上表现不佳。它们不仅仅是一个笼统的“AI 技能”。
为什么这很重要
论文认为,随着 AI 变得越来越聪明,人类的工作性质正在发生变化。我们不需要亲自承担繁重的体力活(AI 会去做),相反,我们需要成为建筑师、检查员和飞行员。
- 旧式教育: “你能独自解出这道数学题吗?”
- 新式教育 (CoRe-3): “你能定义问题、发现 AI 的错误,并引导它得出正确答案吗?”
作者已经发布了他们的工具和“实验室”,以便教师们现在就可以开始测试和教授这三种具体的技能。他们并不是在说 AI 有害,而是说,为了更好地使用 AI,我们不能再把它仅仅看作一个“神奇答案机”,而应该把它看作一个需要清晰指令和持续监督的合作伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。