Quantifying the perceptual value of lexical and non-lexical channels in speech
本文引入了一种用于量化非词汇性语音通道感知价值的广义范式,证明了尽管非词汇性信息的判别准确度可能较低,但其能够持续增强听者的共识并塑造对即将到来的对话的预期。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图猜测朋友在对话中接下来会说什么。你有两个主要的工具来帮助你做出这种猜测:
- “说了什么”(词汇通道): 他们实际说出的词汇。
- “怎么说的”(非词汇通道): 语调、节奏、停顿以及声音中的情感(韵律)。
通常,我们认为“说了什么”是最重要的部分。如果有人说“我要去商店了”,你就确切地知道他们要去哪里。但如果“说了什么”让人感到困惑、模糊,或者提供的线索不够多呢?那么“怎么说的”会有助于你理解吗?还是它只会让你更加困惑?
爱丁堡大学的这篇论文试图回答这个问题,通过精确测量“怎么说的”为我们的对话理解贡献了多少价值。
实验:一场“猜下一句”的游戏
研究人员设计了一个游戏来测试这一点。他们提取了真实的对话,并向参与者展示了三轮对话(设定场景)。然后,他们给了参与者五个可能的后续选项。
- 设定场景: 参与者看到了前三行文本。
- 任务: 他们需要对五个可能的下一行文本进行评分,看哪一个最可能是真实的那一句。
- 转折点: 研究人员以两种不同的方式运行了这个游戏:
- “仅限文本”组: 他们看到了设定场景和五行可能的下一行文本。他们必须纯粹基于文字来进行猜测。
- “音频”组: 他们看到了作为文本的设定场景,但五行可能的下一行文本是以音频剪辑的形式播放的。他们可以听到语调、停顿和节奏。
为了确保测试公平,他们使用了一个智能计算机程序(语言模型)来生成这些“下一行”。这确保了所有选项在语法上都是正确的且符合逻辑,但它们彼此之间又是不同的。这意味着研究人员可以测试那些仅凭文字无法给出明确答案的情况。
研究结果:何时“怎么说”有帮助,何时它会造成干扰
结果揭示了两个非常有趣且略显令人惊讶的模式:
1. 当文字令人困惑时,声音是救命稻石。
在文字本身具有歧义(难以猜出正确答案)的情况下,听到音频的组表现得好得多。语调、停顿和节奏提供了文本所没有的额外线索。这就像试图通过阅读短信来判断一个人是在开玩笑还是在认真说话(很难),而通过听出他说话时特定的语气来判断(则很容易)。“怎么说的”帮助他们缩小了可能性范围。
2. 当文字很清晰时,声音实际上会成为一种干扰。
这是令人惊讶的部分:在文字本身已经让接下来的内容变得非常显而易见的情况下,听到音频的组表现得反而比仅限文本组更差。
为什么会这样?研究人员认为,当文字很清晰时,加入声音会增加额外的“噪声”或“认知负荷”。这就像是在解一道简单的数学题时,背景里有人在放着大声的音乐。音乐(声音)并不能帮你解开数学题,它只会让你难以集中注意力。参与者被这些额外的信息分散了注意力,从而犯了更多的错误。
“共识”的发现:我们听到的都是一样的
研究人员还研究了所谓的“熵”(entropy),这是一种衡量人们彼此之间“达成一致程度”的专业术语。
- 高熵: 每个人都在进行完全不同的猜测(混乱)。
- 低熵: 每个人都猜向同一个答案(共识)。
他们发现,即使音频组猜错了答案(因为声音分散了他们对清晰文本的注意力),他们得到的也是同一个错误答案。
类比: 想象一群人正在看一幅画。
- 仅限文本: 因为描述很模糊,所以他们看到的景象各不相同。
- 音频: 他们看到的都是一样的东西,因为语调引导了他们的想象力,使其朝着一个特定的方向发展——即便这个方向在技术层面上与事实“不符”。
这证明了“怎么说的”(韵律)是非常强大的。它不仅仅是增加了信息;它还创造了一种共同的预期。即使这种共同的预期导致了错误,小组中的每个人也会一起犯错,因为他们是以完全相同的方式在解读语气。
核心结论
这项研究表明,我们的大脑使用两个不同的通道来预测对话中接下来的内容:
- 如果文字很模糊,我们的大脑会高度依赖声音来弄清楚情况。
- 如果文字很清晰,我们的大脑有时会忽略声音,或者被它搞糊涂。
最重要的是,“声音”通道创造了一种强烈的共识感。即使我们并不总是对事实做到100%准确,我们也往往会以相同的方式解读语气和节奏,这有助于我们保持步调一致。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。