← 最新论文
💬 NLP

When Readability and Source Retention Diverge: An Evaluability Gap in AI Translation

这项研究表明,虽然可读性高的 AI 翻译往往会产生一种“可评估性差距”,即使用户在原文可见的情况下也无法识别出忠实度的差异,但其信任感和披露个人信息的意愿更多地是由感知的任务表现和拟人化归因驱动,而非由客观的内容保留度所驱动。

原作者: Chenchen Mao, Hanjing Shi, Haiyan Jia, Emily Wegrzyn, Dominic DiFranzo

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenchen Mao, Hanjing Shi, Haiyan Jia, Emily Wegrzyn, Dominic DiFranzo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字生活的静谧角落,我们不断地将自我的一部分交给机器。我们请求翻译工具跨越语言障碍,传递我们的私密信息,信任它们能在使信息易于被他人理解的同时,保持原意的完整。多年来,这些工具的目标仅仅是生成流畅的文本,使其听起来自然且易于阅读。但随着人工智能变得更加强大,一种新的张力出现了。机器现在可以将晦涩难懂的文本进行重写,使其变得更简单、更具可读性,但在这样做时,它可能会在无意中剥离原意或遗漏关键细节。这为工具的使用者制造了一个棘手的局面:他们可以在屏幕上看到原文,却可能无法判断机器的版本是否改变了故事。研究人员现在提出的问题是,仅仅展示原文是否足以帮助我们判断翻译的好坏,还是说在“我们所能看到的”与“我们实际能理解的”之间存在着一道鸿沟。

据莱斯大学(Lehigh University)的一支研究团队致力于通过测试当机器优先考虑易读性或严格准确性时,人们如何判断翻译质量,来探索这一差距。他们构建了一个名为 TransLingo 的简单纯文本界面,其设计旨在看起来像一个标准的实用工具,没有任何可能误导用户认为机器是人类的友好头像或声音。他们邀请了三百多人使用这个工具,并使用了两种不同类型的源文本。第一种类型是简单的日常叙事散文,类似于儿童阅读的故事。第二种类型是复杂的文学哲学著作,选自需要大学水平教育才能完全领悟的古籍。对于每种类型的文本,研究人员都呈现了两个版本的翻译。一个版本是由人工智能生成的,旨在尽可能提高可读性和流畅度,即使这意味着要简化内容。另一个版本则由人类研究人员仔细修订,以尽可能忠实于原词和原意,即便它读起来会稍微困难一些。

研究人员想要观察人们是否能分辨出这两个版本之间的差异,以及他们的判断是否会随着源文本理解难度的增加而改变。当源文本简单时,参与者的观察非常敏锐。他们能清楚地看到,那个保持对原文内容忠实的版本更好。他们认为忠实的翻译质量更高,并且当机器产生这种准确的版本时,他们也觉得这台机器更聪明、更值得信赖。然而,当源文本变得复杂时,结果却出现了令人惊讶的转折。尽管研究人员已经证实,忠实的版本确实保留了更多的原意,但参与者却无法分辨其中的区别。他们认为易读版本和忠实版本同样出色。事实上,对于难度较高的文本,机器生成输出的流畅感似乎蒙蔽了用户,使他们忽视了忠实版本实际上保留了更多源材料的事实。原文就在屏幕上,可以进行对比,但用户的整体判断并未反映出实际保留内容的差异。

这种现象被作者称为“可评价性差距”(evaluating gap),它表明,仅仅向用户展示原文并不足以保证他们能正确评估翻译。当材料很复杂时,对比两份文本所需的精力似乎促使用户转向依赖输出内容的易读程度,而不是去检查意义是否得到了保留。研究还观察了这些判断如何影响信任以及分享个人信息的意愿。研究人员发现,当人们信任机器能够准确执行任务时,他们更愿意表示愿意向机器透露个人细节,如政治观点、财务状况或家庭关系。然而,他们所看到的翻译类型并不会改变他们的分享意愿。无论机器产生的是易读的还是忠实的翻译,参与者对于披露个人信息的表达出的舒适度都是一样的。这表明,判断翻译质量与决定是否将私人数据托付给机器是两个独立的心理过程。

这些发现挑战了这样一种观点,即一个透明的界面(即原文始终可见)可以解决人工智能的信任问题。研究表明,对于复杂的任务,可见性并不等于理解力。用户可能会将原文和输出结果并排观察,但如果输出内容被处理得极其顺滑且易于理解,他们可能会忽略机器已经改变了内容的这一事实。这对我们设计处理个人信息的工具具有重要意义。这表明,我们不能指望用户仅通过查看源文本就能判断机器是否诚实。相反,设计者可能需要提供具体的帮助,例如高亮显示究竟哪些内容被修改或简化了,以弥合“看到文本”与“真正理解机器做了什么”之间的差距。这项研究证实,虽然我们可以制造出读起来很顺畅的机器,但要确保我们也能判断出机器保留了什么,则是更难解决的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →