← 最新论文
💻 computer science

A Semi-Automated System for Generating Dialogue-Based TTS Lessons Using Large Language Models: An Exploratory Study of Educational Potential

这项探索性研究表明,一种利用大语言模型生成专家-新手对话式文本转语音课程的半自动化系统,与单发言人文本转语音相比,显著提升了学生的理解能力和认知参与度,尽管在音频自然度方面存在权衡,但它为传统的教师语音提供了一种可行的、由教育者增强的替代方案。

原作者: Gendo Kumoi, Fumie Watanabe, Tota Suko, Takashi Ishida, Yuko Kuma, Manabu Kobayashi, Shigeichi Hirasawa

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Gendo Kumoi, Fumie Watanabe, Tota Suko, Takashi Ishida, Yuko Kuma, Manabu Kobayashi, Shigeichi Hirasawa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:利用大语言模型(LLM)半自动化生成基于对话的语音合成(TTS)课程

问题陈述
高质量教育内容的制作,特别是针对翻转课堂模式,对教育者提出了极高的时间和专业技能要求,从而形成了较高的准入门槛。虽然利用生成式人工智能(Generative AI)和文本转语音(TTS)技术实现全自动内容生成已成为可能,但这些解决方案往往缺乏教学上的细微差别、事实准确性以及针对“可听性”(listenability)的优化。此外,LLM 生成的内容存在幻觉风险,因此需要人工监督。现有的自动化系统通常侧重于技术评估或简单的朗读,未能验证在实际课堂环境中的教学有效性,也未能充分利用 TTS 在对话式教学中的独特能力。

研究方法
本研究提出并验证了一种半自动化的“人机协同”(human-in-the-loop)系统,旨在增强而非取代教育者。该系统通过三个阶段的工作流运行:

  1. 结构化幻灯片生成: 利用 LLM(Claude 3.5 Sonnet)处理非结构化文本(如教科书)以生成 Marp 格式的幻灯片。教育者会对这些幻灯片进行审查,以确保事实准确性、教学流程及视觉优化。
  2. TTS 优化的旁白生成: LLM 生成针对 TTS “可听性”进行优化的旁白脚本。本研究引入了一种受认知学徒制理论启发的创新 “专家-新手”对话模式。在这种模式下,LLM 创建一个脚本,其中“专家”提供知识,而“新手”则进行提问、重述概念并确认理解。这种结构旨在搭建学习支架并诱发自我解释效应。教育者需对这些脚本进行准确性和清晰度的审查。
  3. 语音合成与集成: 使用 Gemini TTS API 对脚本进行语音合成。系统支持两种模式:单发言人(教师型)和对话式(专家与新手)。音频与幻灯片图像(通过 Selenium 渲染)进行同步,并使用 MoviePy 将其集成到最终的视频文件中。

实证验证
该系统的教育潜力通过一项涉及 245 名日本高一学生的准实验进行了评估。参与者依次体验了三种教学格式:

  1. 教师真人配音视频(对照组)。
  2. 单发言人 TTS 课程。
  3. 对话式 TTS 课程(专家-×-新手)。

注:由于采用了固定顺序且不同环节内容不同的设计,研究承认在区分格式效应与内容效应及顺序效应方面存在局限性。

数据收集包括回顾性组内比较(比较所有三种格式)和重复的横向组间比较(单 TTS vs. 对话式 TTS)。评估指标基于 ARCS 模型(动机)、认知负荷理论(外在负荷与相关负荷)以及学习投入理论

核心结果

  • RQ1:TTS 是否会降低学习体验?
    对核心指标(理解力、专注度、整体评价)进行的组内分析显示,真人配音、单发言人 TTS 与对话式 TTS 之间不存在显著差异。TOST 等效性检验(边界 Δ=±0.5\Delta = \pm 0.5)证实,所有指标均处于等效范围内。这表明,与真人声音相比,TTS 音频并不会削弱基本的学习体验。

  • RQ2:对话格式是否在教学上更优越?
    对比单 TTS 与对话式 TTS 发现了权衡关系:

    • 对话式 TTS 的优势:理解力p=.006p=.006)和认知投入p=.019p=.019)方面得分显著更高。学习者对于自己解释内容的能力感到更加自信。使用比例优势模型(控制先验知识后)进行的补充分析证实,这些优势并非仅仅由于先验知识的不平衡所致。
    • 单 TTS 的优势:音频自然度p<.001p < .001)方面得分显著更高。对话格式引入了较高的外在认知负荷,这可能是由于不同发言人或页面之间的音频质量差异所致。
    • 偏好: 66.9% 的参与者选择对话式 TTS 作为“最愉悦的学习方式”,其表现显著优于其他格式。

主要贡献

  1. 系统架构: 一个实用的三阶段人机协同工作流,平衡了 LLM 的自动化程度与教育者的质量控制,专门用于生成针对 TTS 优化的脚本。
  2. 新颖方法论: 建立了一种受认知学徒制理论启发、专为 TTS 可听性定制的自动化**“专家-×-新手”对话生成法**。
  3. 实证证据: 本研究是首个在实际学习者准实验环境下,将 LLM 自动化、TTS 音频接受度以及对话格式设计相结合的研究。它证明了尽管存在潜在的音频质量权衡,但基于对话的 TTS 可以增强理解力和认知投入。

意义与主张
本文声称为 TTS 音频的教育接受度以及特定 TTS 课程设计原则提供了理论与实证基础

  • 研究表明,TTS 音频本身并不会比真人声音降低学习效果,从而降低了内容制作的门槛。
  • 研究建议,利用 TTS 的灵活性来创建对话式课程可以提高自我评估的理解力和认知投入,前提是需要管理好音频质量的权衡。
  • 作者明确指出,这些发现是基于具有固定顺序和变化内容的准实验得出的。因此,本文并不声称发现了仅由教学格式引起的确定性因果效应,而是提供了观察到的设计启示与模式。作者强调,未来的研究需要通过随机交叉设计和客观学习测试来确认因果关系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →