Human–AI collaboration in deductive coding of classroom dialogue: prompt engineering and collaboration patterns
本研究采用基于设计的研究方法,旨在证明当定制化 GPT 编程助手与结构化提示词及以人为本的协作工作流相结合时,能有效支持课堂对话的演绎编码,同时强调成功的机人协作取决于提示词架构、工作流排序以及研究者对人工智能态度的动态相互作用。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一种在教室里使用的秘密语言。老师和学生正在进行一场深刻、复杂的对话,而你的任务是将每一个句子归类到特定的类别中,比如“推理”(Reasoning)、“启发思考”(Invitation to think)或“认同”(Agreement)。如果手工完成这项工作,就像是在用消防栓喝水一样:既疲惫不堪,又极其耗时,而且你的大脑会感到精疲力竭。
由此,**定制化 GPT 编程助手(CGCA)**登场了。不要把这个 AI 仅仅看作一个无所不知的魔术机器人,而要把它看作一个非常聪明、非常快速的实习生,它被赋予了一本特定的规则手册(即剑桥对话分析方案)以及一些用于学习的样本句子。剑桥大学的研究人员想要观察的是:我们能否训练这个实习生来承担繁重的工作?以及我们如何在不让实习生接管一切或让真人感到厌烦的情况下进行协作?
以下是他们的发现,为了保持清晰,我们使用了几个比喻来进行呈现。
1. “实习生”需要正确的指令(提示词工程)
起初,研究人员只是把整本规则手册交给 AI 并说:“开始吧!”结果如何?AI 糊涂了。这就像是给一名新员工一本 500 页的手册,然后指望他们第一天就能知道该做什么一样。AI 的准确率很低,在某些类别中甚至低至 6.7%。
研究人员意识到,AI 的“大脑”运作方式与人类不同。如果你一次性给它太多文本,它会感到不知所措。因此,他们开始进行提示词工程(Prompt Engineering)。这就像是在重写给实习生的指令。他们不再使用巨大的文本墙,而是:
- 将规则分解为“决策树”(如果发生 X,则执行 Y)。
- 给 AI 提供更少但更优质的示例(大约 5–15 个精心挑选的示例,而不是成百上千个)。
- 使指令变得循序渐进。
结果: 经过这些调整,AI 的准确率跃升至 64.9%。虽然这并不完美(人类之间的共识率通常在 70–75% 之间),但作为一名得力的助手已经足够好了。论文指出,仅仅将人类的培训手册粘贴到计算机提示词中是行不通的;你必须根据 AI 的思维方式来重构指令。
2. 谁先开始?“人类优先” vs. “AI 优先”的舞蹈
研究人员测试了两种与这位 AI 实习生协作的方式。他们让 6 名 教育研究人员(包括新手和专家)在 55 轮 课堂对话上尝试了这两种方法。
- 情况 A(人类优先): 人类先对句子进行编码,然后询问 AI:“你觉得呢?”
- 情况 B(AI 优先): 人类先问 AI:“你觉得呢?”然后人类再决定是否同意。
研究结果:
当人类先进行编码时,人类与“金标准”(原始专家编码员)之间的符合度(衡量匹配程度的指标)约为 0.40。
当 AI 先进行编码时,这个数字略微上升到了 0.45。
注:论文指出,由于样本量较小,这一差异在统计学上并未“证明”是一个巨大的胜利,但这一趋势表明,先从 AI 开始可能会帮助人们更好地遵循规则。
此外,在“AI 优先”模式下,人类完成工作的速度更快。然而,研究人员注意到一个微妙之处:在“AI 优先”组中,有些人觉得他们只是在检查 AI 的工作;而在“人类优先”组中,他们觉得自己正被 AI 监督。
3. 秘密配方:你如何对待 AI
这是最有趣的部分。研究人员发现,人类对 AI 的感受比操作顺序更为重要。他们观察到了两种截然不同的处理 AI 的“人格”:
“对话式”伙伴(协作型)
大约一半的团队成员(参与者 C、D 和 E)将 AI 视为一位批判性的朋友或辩论对手。
- 比喻: 想象你在和一位网球搭档打球,对方把球回传给你,以便你可以回击得更有力。他们并没有盲目信任 AI,而是利用 AI 的建议来测试自己的思考。“嗯,AI 说这是‘推理’。为什么?哦,我明白了,因为它用了‘因为’这个词。好吧,我同意。”
- 结果: 尽管其中一些人是编码新手,但他们的进步却是最大的。他们将 AI 视为帮助自己学习和完善决策的工具。
“监督式”看门狗(怀疑型)
另一半成员(参与者 A、B 和 F)将 AI 视为一个嫌疑对象或一台需要不断检查的机器。
- 比喻: 想象一名保安认为监控摄像头坏了,并不断试图证明它是错的。他们会说类似“我正在检查 ChatGPT”或“我不认为它是一个同事”之类的话。他们保持距离,拒绝与这个工具进行“对话”。
- 结果: 这些人的进步并不明显。他们的编码准确率保持在较低水平,并且花在参与 AI 推理过程上的时间较少。他们过于专注于“验证”AI,以至于错失了“协作”的机会。
4. 论文排除了哪些可能性
了解这项研究没有实现什么非常重要:
- 它不是“万灵药”: 你不能直接把一大堆数据和一份标准规则书丢给 AI,然后指望它完美运行。论文明确指出,“直接将人类的训练代码本转移到提示词中是不够的。”
- 它不是技能的替代品: 研究并未声称 AI 能让人们瞬间成为专家。事实上,有一位参与者(参与者 E)最初因为缺乏信心而屈从于 AI,直到后来才学会了如何批判性地判断 AI 的工作。论文认为这可能是一种暂时的信心提升,而非必然的独立技能飞跃。
- 它不是“一刀切”的解决方案: 论文认为不存在一种完美的通用方法。对“对话式”伙伴有效的方法,对于“监督式”看门狗可能并不适用。
5. 我们有多大的把握?
研究人员在措辞上非常谨慎。他们表示其发现表明,一种“对话式”方法(将 AI 视为伙伴)能带来更好的结果。他们表明,先从 AI 开始(AI-first)可能会有助于提高一致性。
- 置信水平: 这是一项只有 6 名 受试者的“小规模”探索研究。作者承认,由于样本量如此之小,他们无法确定“AI 优先”的方法是否绝对更好;他们只能说数据呈现出了这种趋势。
- 准确率: AI 达到了 64.9% 的精确度。论文指出,这正在“接近”人类的共识水平(70–75%),但尚未达到。它是一个“结构化的决策支持工具”,而不是最终答案。
大局观
这项研究描绘了人类与 AI 协作的图景——这并非简单的“人类 vs. 机器”或“机器代劳”的情景,而是一场动态的舞蹈。
这场舞蹈的成功取决于三个要素的协同作用:
- 舞步(AI 设计): 指令必须简单、循序渐进,并符合 AI 的思维方式(例如使用决策树)。
- 音乐(语境): 操作顺序(谁先开始)改变了节奏。
- 舞者的心态(人类): 如果你将 AI 视为学习的伙伴,你会跳得更好;如果你将其视为需要检查的敌人,你就会踉跄。
论文总结道,AI 在研究领域是一个社会技术过程(socio-technical process)。它不仅仅关乎代码,更关乎人类的感觉、思考以及如何与工具互动。对于一个好奇的青少年来说,核心启示是:工具的优劣取决于你与其建立的关系。 如果你把它当作聪明的队友,它会帮助你成长;如果你把它当作可疑的陌生人,它就只会坐在那里等着被检查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。