Modeling turn-taking with distant viewing: investigating silence thresholds in human and AI-generated discourse
本研究通过分析并比较三十部美国情景喜剧和五十一个合成播客中的停顿时长,探讨了人类与人工智能生成话语中的沉默阈值,并考察了基于说话者性别和制作设置的差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正身处一个热闹的派对,每个人都在聊天。你了解一段精彩对话的节奏:有人停止说话,出现了一个微小的、几乎察觉不到的停顿,然后另一个人随即切入。这一切发生得极快,你几乎察觉不到。研究人类如何交谈的科学家们称之为“轮次转换”(turn-taking)。他们花费了几十年的时间来测量这些微小的停顿,以理解人类如何在不互相干扰的情况下协调各自的言语。通常情况下,他们只是听音频,就像收音机听众试图弄清楚谁在说话一样。但如果,你听到的“沉默”其实并不是说话者在停顿呢?如果这段沉默实际上是电影导演按下“剪辑”键,或者是计算机程序决定切换声音的结果呢?这正是一组研究人员提出的问题。他们想看看电视节目和 AI 生成的播客中,说话者之间的微小间隙究竟是真的关于人们说话的节奏,还是仅仅是音频和视频如何剪辑在一起的结果。
研究人员泰勒·阿诺德(Taylor Arnold)、尼古拉斯·巴利尔(Nicolas Ballier)和阿尔特姆·萨洛耶夫(Artem Saloev)决定通过两种截然不同的音频来扮演侦探。首先,他们研究了三十部经典的美国情景喜剧(如《老友记》或《办公室》),这些是人工制作、有剧本且经过大量剪辑的。其次,他们分析了由 Google 的 NotebookLM 工具生成的 51 个合成播客,其中计算机语音在彼此交谈。他们使用一种特殊的计算机程序来聆听音频,并测量一个说话者停止到下一个说话者开始之间的精确沉默长度。但他们并未止步于此。对于这些电视剧集,他们还观察了视频。他们寻找“镜头剪辑”(shot cuts)——即摄像机从一个视角切换到另一个视角的时刻,比如当摄像机从一个人的脸跳转到他朋友的脸时。
以下是他们的发现,这有点像剧情反转。当他们观察这些电视剧时,他们发现,说话者之间的“沉默”并不只是关于演员等待轮到自己说话。很大一部分沉默实际上是剪辑师所为。当沉默恰好发生在摄像机切换到新镜头的瞬间时,停顿要长得多——平均约为 711 毫秒(略小于一秒)。但当沉默发生时,摄像机仍然对着同一个场景(即“中景”间隙),停顿则要短得多,约为 424 毫秒。这之间存在着 287 毫秒 的差距,而在对话的世界里,这是一个巨大的差异。事实证明,一部电视剧的“节奏”往往是由剪辑师剪辑影片而非演员决定何时说话来设定的。摄像机的剪辑增加了一层沉默的“呼吸”,而计算机程序误以为这是说话者在停顿。
AI 播客则讲述了另一个故事。计算机生成的对话中的停顿要短得多,跨性别转换(例如女性声音切换到男性声音)大约发生在 287 到 310 毫秒 之间。这些间隙是统一且机械化的,缺乏人类节目中所见到的多样性。AI 没有负责剪辑视频的剪辑师,也没有负责笑场的现场观众,所以它只是尽可能快地切换声音。它并没有模仿人类那种自然的、协商后的时机,而是将对话扁平化为一个快速的、机器人式的交接。
这项研究表明,如果你只听电视剧的音频,你可能会对人类是如何说话产生误解。你可能会认为说话者在进行长时间的停顿,而实际上是剪辑师切换了摄像机。研究人员指出,他们的研究也有局限性:电视剧和 AI 播客都没有太多的“重叠”(即人们同时说话的情况),而这正是真实、混乱的人类对话中的重要组成部分。但核心结论是明确的:在经过剪辑的媒体中,你听到的“沉默”往往是摄像机和剪辑师的产物,而不是说话者的产物。为了真正理解人类如何轮流说话,我们需要观察那些未经脚本编写、自发的对话,在那里摄像机不会为我们设定节奏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。