← 最新论文
💻 computer science

BoilerSketch: A TA-Supervised, Diagram-First GenAI Practice for Structured Diagrams in CS1/Early CS2

BoilerSketch 是一个由助教监督、以图表为核心的生成式人工智能(GenAI)界面,专为 CS1/早期 CS2 课程设计,通过受限的 Mermaid 图表生成和人类在环(human-in-the-loop)监督机制来解决支持瓶颈,在提供结构化视觉解释的同时防止代码生成并确保学术诚信。

原作者: Ethan Dickey, Vivan Tiwari, Anvit Sinha, Andres Bejarano

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ethan Dickey, Vivan Tiwari, Anvit Sinha, Andres Bejarano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:BoilerSketch

问题陈述
大型入门级计算机课程(CS1 和早期 CS2)在实验课和办公时间面临支持瓶颈。虽然学生需要及时、个性化的帮助,但他们的许多问题——特别是涉及递归追踪、树遍历、指针别名和动态规划表的问题——通过视觉图表而非文本进行解答效果更好。现有的计算教育 AI 辅导工具主要以文本或代码为中心;它们生成练习、解释代码或通过对话进行调试,但缺乏生成准确且具有教学用途的视觉效果的能力。相反,经典的程序可视化系统提供了强大的视觉表示,但很少是对话式的、多模态的,或嵌入在受监督的辅助工作流中的。这在可视化程序行为的系统与讨论程序行为的系统之间创造了一个空白,从而产生了一种对“以图表为先”的 AI 支持工具的需求,该工具必须明确约束于概念解释并置于人类监督之下。

方法论与系统设计
作者提出了 BoilerSketch,一种为早期计算支持设计的、由助教(TA)监督的、以图表为先的生成式 AI 实践。该系统不是一个自主的导师,而是一个由四个核心组件构成的受限教学实践:

  1. 双窗格平板界面: 学生通过支持自然语言聊天和带笔触的白板的平板电脑进行交互。学生可以提交文本问题、绘制结构或追踪过程,或上传手绘图表的图像。系统支持迭代的、双向的视觉-文本对话。
  2. 提示词即策略架构(Prompt-as-Policy Architecture): 系统采用两层提示策略来执行教学边界。
    • 基础教学提示词: 将模型的角色定义为简洁的助教,禁止生成可执行代码、直接调试或对课程进行抱怨。它要求侧重于概念拆解和独立解决问题。
    • 可视化子提示词: 仅在需要视觉解释时调用,该提示词约束模型生成结构化的 Mermaid 图表语法,而非自由形式的图像。
  3. 结构化渲染流水线: 为了确保可靠性和可检查性,系统不生成原始图像。相反,它从模型的响应中提取 Mermaid 代码块,对其进行验证,并在展示给学生之前在服务器端进行渲染。这确保了输出是稳定、可预测且易于教职人员审查的。
  4. 人类在环监督(Human-in-the-Loop Supervision): 助教充当负责任的监督者。他们监控多个会话,并在响应需要纠正、深度探测或升级到人工帮助时进行干预。AI 提供“初步生成”的产物,由助教决定接受、扩展或拒绝。

评估方法
论文报告了对普渡大学 CS251(数据结构与算法)21 名教学人员(助教和一名教学专家)进行的专家评估,该评估于 2025 年春季进行。

  • 流程: 参与者使用带有 BoilerSketch 的 Android 平板电脑进行 45 分钟的动手实践环节。他们模拟学生进行交互,提交具有代表性的概念性提示(例如,递归追踪、图遍历)和自生成的提问。
  • 指标: 会话结束后,参与者完成了一项使用定序量表进行的后测调查,对系统的感知帮助程度(针对概念理解)及其在典型支持任务中的有用性进行了评分。同时还收集了定性反馈和说明性交互,以识别边界条件。

结果
评估结果在感知效用方面呈现出虽有起伏但总体积极的结果:

  • 帮助程度: 66.7% (14/21) 的教职人员认为该系统在概念理解方面至少具有“中度帮助”。14.3% 认为其“中度无帮助”,19.0% 持中立态度。
  • 有用程度: 66.7% (14/21) 的教职人员认为该系统在典型支持任务中至少具有“中度有用”。
  • 最佳适用场景: 教职人员指出,该系统最强的价值在于常规的、以图表为中心的解释(例如,可视化树遍历、动态规划表和 Dijkstra 等图算法)。
  • 局限性: 教职人员指出,系统在处理需要深度理解的高级主题,或诊断可能被宽泛且看似合理的 AI 响应所掩盖的特定、微妙的学生误解方面,存在显著局限。33.3% 的参与者认为在某些场景下系统是中立或无帮助/无用的,这凸显了 AI 可能会错过学生困惑根源的风险。

核心贡献与主张
该论文作为一篇“创新实践”论文,提出了三个主要贡献:

  1. 教学实践: 它提出了一个可复制的框架,用于早期计算课程中受监督的、以图表为中心的 AI 支持,超越了以文本为先的 AI 交互。
  2. 设计模式: 它阐述了一种可部署的设计模式,其中提示词层级的护栏、结构化图表渲染(Mermaid)和助教升级规则共同将 AI 辅助限制在概念解释而非答案生成上。
  3. 专家验证: 它提供了专家评估数据,识别了“最佳适用”用途(常规概念可视化)和边界条件(细微诊断、高级主题)。

重要性与谦逊的主张
作者将 BoilerSketch 定位为而非替代人类教学,而是作为处理常规、易于图表化的问题的可靠第一响应层。其意义在于证明,当 AI 支持满足以下条件时,在早期计算领域会更具教学可信度:

  • 范围狭窄,仅限于概念解释。
  • 结构受限,通过结构化输出(Mermaid)而非自由生成。
  • 嵌入在清晰的人类教职人员升级协议中。

论文明确且谦逊地声明,它并不建立学生的学习增益、涵盖所有主题的全面正确性或减少办公时间的等待时间。相反,它提供了一个具体的模型,用于在保持教学控制和学术诚信的同时,扩展概念支持。作者认为,“提示词即策略”的方法允许将课程价值观(如学术诚信和概念聚焦)直接转化为系统行为,使提示词本身成为一种教学设计产物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →