← 最新论文
💬 NLP

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

本文介绍了一个跨语言问答框架,用于研究用户如何建立对语音翻译系统的心理模型,揭示了实践经验和源语言知识有助于用户通过依赖表层线索来更好地预测系统错误。

原作者: HyoJung Han, Nishant Balepur, Jordan Boyd-Graber, Marine Carpuat

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: HyoJung Han, Nishant Balepur, Jordan Boyd-Graber, Marine Carpuat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图使用一个说话语言你并不完全理解的 GPS 在一个外国城市中导航。有时 GPS 会给出完美的指令,但有时它会把你带入死胡同,或者在应该左转时告诉你左转。

这篇论文是关于研究人们如何学习去信任(或不信任)那个 GPS。具体来说,研究人员研究了人们如何了解一个语音翻译工具的“个性”——即理解它何时表现良好,以及何时可能会出错。

以下是他们研究的简易类比拆解:

游戏:“翻译员测验”

研究人员并没有直接问人们“你觉得这个翻译好吗?”,而是创建了一个游戏。

  • 设置: 参与者听一段短小的法语音频(类似于新闻片段),并看到一段由计算机生成的英语翻译。
  • 任务: 他们必须根据这些信息回答一个多项选择题。
  • 陷阱: 计算机的翻译并不总是完美的。如果翻译错了,参与者就会得到错误答案。
  • 选择: 在回答之前,参与者可以选择说:“我觉得这部分不对;让我们请一位人类专家来重新翻译。”但是,每当他们要求人类重新翻译时,他们都会失去分数。
  • 目标: 为了获得最高分,你必须足够聪明,能够准确知道计算机何时在撒谎,何时在说真话,而不会因为不必要的求助而浪费分数。

他们的发现

1. 熟能生巧(但仅限于某些人)
把学习 GPS 比作学习骑自行车。

  • 中级骑手: 懂一点法语(但不是专家)的人学习效果最好。他们起初表现挣扎,但随着游戏的进行,他们很快就能掌握 GPS 的坏习惯,并变得非常擅长发现错误。
  • 专家骑手: 精通法语的人从一开始就做得很好。他们不需要如此多地去“学习”这个系统,因为他们本身就已经理解了这种语言。
  • 初级骑手: 几乎不懂法语的人最吃力。他们无法判断 GPS 是否出错,所以他们要么盲目猜测,要么请求人类帮助过于频繁,从而导致丢分。

2. 人们寻找哪些线索?
在试图识别糟糕的翻译时,人们依赖于特定的“红旗信号”,就像技工通过听引擎里的异响来判断故障一样:

  • “故障”线索(最容易): 如果翻译听起来不完整、很奇怪,或者像机器人在结巴,人们会立刻察觉。这是最明显的麻烦迹象。
  • “口音”线索(容易): 如果原始法语音频有噪音、语速很快或带有重口音,人们会学会对结果产生怀疑。
  • “话题”问题(最难): 如果翻译涉及特定话题(如体育),除非人们是该领域的专家,否则很难判断其是否出错。他们很难判断计算机是因为话题是“体育”还是“科学”而犯错。
  • “名字”线索(混合型): 人们会注意到罕见姓名或单词的错误,但他们似乎从一开始就依赖这种直觉,而不是随着时间的推移才学会。

3. “小抄”实验
研究人员尝试给玩家提供不同类型的提示来辅助学习:

  • “转录”提示: 他们向玩家展示了计算机从法语音频中“听到”的文本内容(即使翻译是错误的)。这就像是向技工展示原始声波一样。这对玩家帮助最大,尤其是“中级”组,因为它提供了一个关于为什么翻译可能出错的线索(例如:“哦,计算机听错了那个词”)。
  • “高亮”提示: 他们高亮显示了翻译中可能出错的具体单词。虽然这能让人们更频繁地得到“正确答案”,但实际上却让他们更难学习系统。这就像是给了某人一张已经圈出了错误转弯处的地图;他们只是跟着圈圈走,而没有学会如何驾驶。他们变得“过度依赖”,从而停止了自己去理解系统。

核心结论

论文得出结论,为了帮助人们有效地使用 AI 翻译工具,我们不应该仅仅告诉他们“这是错的”。相反,我们应该让他们参与到需要他们自己去发现错误的各种游戏中。

  • 练习有帮助: 与工具互动的次数越多,人们预测其错误的能力就越强。
  • 语言很重要: 了解一点源语言有助于你更快地了解工具的局限性。
  • 提示很重要: 展示原始的“听取”过程(转录)有助于人们理解工具的大脑。但仅仅高亮显示错误会让用户变得懒惰和依赖,从而阻碍他们真正理解工具是如何运作的。

简而言之,构建一个良好的 AI “心理模型”的最佳方式,是让用户扮演侦探,利用诸如奇怪的措辞和音频噪音之类的线索,去破解 AI 何时失效的谜团。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →