Temporal Reliability of ChatGPT-Generated Bilingual Texts: Implications for AI-Assisted Language Learning and Multilingual Information Access
本研究评估了四个连续版本的 ChatGPT 在金融、技术和公共政策领域的双语翻译中的时间可靠性,结果表明模型更新并不保证在语义准确性或可读性方面实现持续改进,而是呈现出迥异的性能轨迹,这使得针对 AI 辅助语言应用的持续性、特定领域评估变得必要。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明、无所不知的机器人朋友,它会说地球上的每一种语言。你请它翻译一句很难的句子,它给了你一个完美的答案。但如果一个月后,你在机器人进行“软件更新”后问了同样的问题呢?它还会给出相同的答案吗?还是它忘记了某些东西、改变了主意,或者开始以不同的风格说话了?这就是人工智能(AI)和语言领域中一项新研究背后的重大课题。
科学家们将这些超级聪明的机器人称为“大语言模型”(LLMs)。它们就像数字大脑,可以写作、翻译和聊天。通常,当我们购买新的视频游戏或新手机时,我们期望最新版本比旧版本更好。我们假设如果一家公司发布了“5.0版本”和“6.0版本”,第二个版本会更聪明、更快、更准确。但在这些AI机器人身上,事情并不总是这么简单。它们在幕后不断地被微调和更新,有时甚至在我们不知情的情况下改变了它们的思考或说话方式。这项研究提出了一个非常重要的问题:如果你使用AI来帮助你学习一门语言或阅读外语新闻,你能确定“最新”的版本确实是最好的一个吗?或者,即使机器人在某些方面变得更好了,它是否也会在其他方面变差了呢?
实验:测试机器人的记忆力
为了找出答案,一位名叫傅志汉(Zhihan Fu)的研究人员决定玩一场“找不同”的游戏,测试了某流行AI聊天机器人的四个不同版本(命名为 GPT-5.0、GPT-5.4、GPT-5.5 和 GPT-5.6 Sol)。你可以把这些版本想象成同一个人的四张不同时间点的快照。
研究人员不仅仅是让机器人聊天;他给它出了一个非常具体的挑战。他选取了三篇真实的报道——一篇关于金融、一篇关于太阳能技术、以及一篇关于政府政策——并要求每一个版本的机器人将它们从中文翻译成英文。他对每个版本使用了完全相同的指令,并将他们的答案与人类专家的“金标准”翻译进行了对比。
他使用了两种主要方式来评判翻译质量:
- “意义”检查: 他使用了一个名为 COMET 的工具,来观察机器人的意思与人类专家的意思有多接近。它是否保留了所有的事实?
- “可读性”检查: 他测量了文本的易读程度。是太难读了吗?句子是否太长?用词是否得当?
惊喜:机器人的进步并非直线型
结果有点像是在看一部过山车,对于不同的乘客,上升和下降的方向各不相同。最大的惊喜在于,更新的版本并不自动意味着更好。 事实上,机器人的表现会根据它所谈论的主题而发生奇怪且不可预测的变化。
以下是机器人在它访问过的每个“世界”中的表现:
- 政府规则世界(公共政策): 这是唯一一个机器人在保持意义准确性方面稳步提升的地方。随着每个新版本的到来,“意义”得分都在上升,并在最新的 GPT-5.6 Sol 版本达到了最高点。然而,这里有一个陷阱:随着意义变得更加准确,文本变得更难阅读了。较新的版本开始使用更复杂、笨拙的风格,读起来不像是一个流畅的故事,而更像是一份生硬的法律文件。
- 金融世界(财经): 在这里,机器人在一段时间内表现得很稳定,然后在 GPT-5.5 版本达到顶峰,之后在最新的版本中又略有下降。最新的版本在这里并不是冠军。
- 太阳能世界(技术): 这是最疯狂的一次旅程。机器人起步很强,在 GPT-5.4 版本时变得更好,但在那之后的每一次更新中都变差了。到最新的版本(GPT-5.6 Sol)到来时,它保持意义准确的能力甚至跌破了最初的那个版本!然而,最新的版本做了一件有趣的事:它把长而混乱的句子拆成了更短、更有力的句子,这让文本看起来更容易阅读,尽管它实际上丢失了一些重要的技术细节。
核心启示:“更新”并不等于“更好”
这项研究表明,我们不能仅仅假设最新的AI更新就是最适合这项工作的工具。这就像一位厨师换了一个新厨房。也许新烤箱让他的蛋糕味道完美了,但新刀具却让他的切菜速度变慢了。
- 对于政府类文本: 最新的AI是最准确的,但也是最难阅读的。
- 对于技术手册: 最新的AI写出的句子较短(看起来不错),但它实际上比旧版本丢失了更多的意义。
- 对于金融类文本: 中间的版本(GPT-5.5)才是最好的,而不是最新的那个。
研究人员发现,机器人在保持意义正确和易读性方面,往往是朝着相反方向移动的。有时,让文本更准确会使其难以理解。有时,让句子更短、更简单则会降低其准确性。
这对你意味着什么
如果你是一名利用AI来辅助语言学习的学生,或者你正试图阅读来自其他国家的资讯,这项研究就是一个“警告标签”。它告诉我们,不应该直接抓取“最新”版本的AI并假设它是最聪明的。所谓的“最佳”版本完全取决于你想要做什么。
如果你需要理解复杂的政府规则,最新的版本可能会给你正确的实事,但表达方式却很令人困惑。如果你正在阅读一份技术手册,最新的版本可能看起来很简单,但可能遗漏了关键的安全警告。这项研究表明,我们需要针对特定的工作不断地测试这些AI工具,检查它们在特定任务中的表现,因为机器人在每次更新时都会改变它的“个性”。目前还不存在“完美的”AI翻译器;相反,我们面对的是一个不断变化的机器人,我们必须谨慎对待,根据不同的任务来决定信任哪一个版本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。