← 最新论文
💬 NLP

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

本研究表明,大语言模型的选择和对话上下文会显著影响生成回复的语义一致性,这表明目前的提示策略不足以确保在基于对话的评估中,不同模型之间能够产生稳定且具可比性的响应。

原作者: Jiangang Hao

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiangang Hao

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代教育世界中,衡量人们沟通与协作能力的问题长期以来一直是一个棘手的难题。不同于数学测试中一个数字就能证明学生掌握了答案,像协作这样的技能发生在对话中那种混乱、流动且往复的过程之中。为了公平地衡量这些能力,教育工作者需要确保每位学生面对的挑战是相似的,即便对话走向了不同的路径。最近,人工智能提供了一种新的解决方式。通过使用能够交谈和倾听的计算机程序,学校可以为学生创造虚拟伙伴进行练习。这些程序可以适应学生所说的话,创造出自然的对话,从而揭示学生的思维与协作水平。然而,专家们产生了一种隐忧:如果计算机程序发生了变化,对话是否也会随之改变?如果一名学生今天使用一个版本的软件进行测试,而另一名学生明年使用更新的版本,他们是否仍在以同样的方式回答同样的问题?这个问题触及了公平性的核心。如果计算机的回复根据运行它的模型不同而发生剧烈偏移,那么测试可能不再是在衡量学生的能力,而是在衡量软件本身的特性。

一位来自教育测试服务中心(ETS)的研究人员着手调查了这一问题。他们想知道,当底层的软件发生变化时,计算机回复的含义是否保持不变。为了查明真相,他们并没有虚构对话。相反,他们从过去的在线科学项目中提取了真实的对话信息,在这些项目中,两名参与者通过协作来解决问题。他们从这些聊天记录中选择了61个特定的时刻,在这些时刻中,一个人表达了重要的观点,而另一个人给出了清晰且有帮助的回复。研究人员随后要求四个不同版本的“大语言模型”(一种旨在理解并生成人类语言的人工智能类型)对这61条消息进行回复。他们针对每条消息进行了两次实验。在第一次运行中,计算机只看到了它需要回答的那一条消息。在第二次运行中,它看到了该消息以及之前完整的对话历史。对于每一条消息,每个计算机模型都生成了100个不同的回复,以观察答案的差异程度。

结果显示,计算机模型的选择和对话语境都会影响回复的相似性。当研究人员对比单个模型生成的100个回复时,发现这些答案彼此之间非常相似,相似度得分在0.715到0.795之间。但当他们将一个模型的回复与另一个模型的回复进行对比时,相似度显著下降。这仿佛每个模型都有自己独特的嗓音和思维方式。加入对话历史的效果取决于所使用的特定模型;在某些情况下,包含聊天历史能略微提高回复与人类反应的一致性,但它并不总能让模型之间达成更多共识。研究还发现,来自同一软件家族的新模型往往比它们与旧的不同模型相比,表现出更高的答案相似性。这表明,软件的“家族树”在它如何响应特定指令方面起着重要作用。

或许最重要的一点是,研究人员发现,仅仅依靠提示词(prompting)和对话语境,可能不足以在底层大语言模型(LLM)发生变化时确保高度相似的回复行为。即使模型接收到了完全相同的提示词和相同的对话历史,模型的选择仍然会导致回复在语义内容上的显著差异。研究表明,对于高风险测试而言,依赖这些人工智能系统的自然灵活性是具有风险的。如果一项测试依赖于计算机来引导对话不偏离轨道,而计算机每次更新时都改变其风格,那么测试结果可能会变得不可靠。研究人员得出结论,要建立一个持久且公平的测试系统,不能仅仅依靠软件自行完成任务。相反,我们需要在系统中构建额外的控制层——例如规则或模板——以确保无论运行的是哪个版本的软件,计算机的回复都能保持在一个安全、一致的范围内。如果没有这些保障措施,人工智能的快速演进可能会破坏教育测试本应保护的公平性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →