← 最新论文
📄 social_science

Evaluative Cultural Hallucination in Large Language Model Assessment of Tenor in Scenic Area Public Sign Translations

这项研究揭示了大型语言模型经常表现出“评估性文化幻觉”,即通过显著高估风景区公共标牌翻译在语用和社会文化层面(语旨)的恰当性,往往将表层的正式性或可识别的引用误认为真正的文化适配性。

原作者: Qi Guo, Tengteng Yap

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi Guo, Tengteng Yap

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当你漫步在中国历史悠久的寺庙或神圣的墓地时,那些引导你的标牌不仅仅是方向指示。它们是连接文化的桥梁,不仅翻译着文字,更翻译着在谈论祖先安息或神灵受祭之地时所必需的深厚敬意、历史感与庄严感。这就是公共标识翻译的领域,这项任务要求在清晰度与文化敏感性之间取得微妙的平衡。几十年来,专家们通过考察“语体”(tenor)来评判这些翻译,这是一个描述作者与读者之间关系的术语。它探讨的是语气是否得当:对于神圣遗址来说,语气是否过于随意?对于自然步道来说,是否过于生硬?它是否对历史人物表现出了应有的尊重?随着城市和旅游景区的不断扩大,检查这些标牌的需求已经超过了人类专家全部审核的能力,这使得许多人开始思考人工智能是否可以介入其中提供帮助。

大型语言模型——现代聊天机器人背后的强大计算机系统——已经展示出它们能够以令人印象深刻的流利度进行阅读和写作。它们可以发现语法错误并建议更流畅的措辞。但马来亚大学研究人员的一项新研究提出了一个更难的问题:这些机器能否理解文化中那看不见的重量?具体而言,他们想知道人工智能是否会误判一个翻译:即一个听起来礼貌且正式,但实际上忽略了神圣或历史遗址所需之深层文化内涵的翻译。研究人员收集了来自中国徐州八个主要旅游景点的116块双语标牌,涵盖了从自然导览到古代坟墓及佛教寺庙的描述。他们要求人类专家和一种先进的人工智能模型根据翻译捕捉正确语气和敬意程度的表现进行评分。

结果揭示了人类直觉与机器判断之间的显著差距。虽然人类专家因许多翻译未能捕捉到必要的文化尊重而给出了低分,但人工智能模型却一致给出了高分。在所审查的案例中,近一半的情况下,即便专家认为翻译在文化层面不达标,AI仍将其评为高质量。这一问题在涉及宗教和仪式的标牌上最为严重。对于这些标牌,AI在65%的案例中对翻译质量的判断是错误的。研究人员发现,AI并非在进行随机错误,而是在遵循一种特定的、可预测的误解模式。它将文本的表面特征误认为其深层的文化价值。

当研究人员深入探究为何 AI 会给出这些高分时,他们发现它依赖于四种特定的“捷径”。首先,该模型经常仅仅因为翻译听起来正式或具有机构感(就像你在博物馆里看到的那样)就给予赞赏。它假设如果词汇听起来很官方,那么语气就是正确的,即便具体的文化敬意并不存在。其次,AI 被识别出的名称所迷惑。如果翻译保留了历史人物或宗教物品的名字,模型就会认为任务已完成,而忽略了周围的文字是否以恰当的崇敬之心对待该人物。第三,模型有时会将普遍的礼貌与特定的文化庄严感混淆。它会看到在广义上听起来有礼貌的词汇,便判定翻译完美,从而未能察觉到特定的仪式细微差别已经丢失。最后,AI 对信息的缺失过于宽容。即使翻译删减了关于仪式或历史的重要细节(而这些细节对原意至关重要),只要翻译简洁易读,它也会给出高分。

这项研究表明,这不仅仅是机器出现轻微偏差的问题,而是一种作者所称的“评估性文化幻觉”。这并不意味着机器在捏造事实,而是指它在翻译并不符合文化要求时,却“幻觉”出该翻译是符合文化规范的。它看到了表象特征——正式的词汇、可识别的名字或礼貌的语气——并说服自己深层的文化要求已经得到满足。这在宗教或仪式场所的标牌中尤其危险,因为在这些地方,语气的错误可能被视为不敬甚至冒犯。研究人员发现,AI 在判断关于自然或一般信息类的标牌时表现得更好,因为这类语体的复杂程度较低。但当文本涉及神圣空间、墓地或古代仪式时,机器的自信便成了一种负担。

这项研究并不是说人工智能无法在翻译方面提供帮助。相反,它警告我们不能简单地信任机器的评分,尤其是在涉及文化时。AI 非常擅长检查一个句子是否语法正确或一个名字是否拼写正确,但在理解支配如何谈论神圣事物的隐形规则(如尊重与等级制度)方面,它显得力不从心。研究结论指出,对于旅游区的标牌,特别是涉及历史和宗教的标牌,人类专家必须保持参与。机器可以提供初步的审视,但其推理必须由理解“正式语气并不等同于尊重语气”以及“识别出一个名字并不保证文化准确性”的人类进行核查。在机器能够真正理解文化的重量之前,确保这些标牌能够向其所描述的场所致敬的最可靠方法,是保持人类对航向的掌控。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →