Accuracy and Order Sensitivity Diverge Under Label-Free Strategies
本文表明,虽然在多项选择题回答过程中防止大语言模型看到选项标签可以成功消除位置偏见,但这并不能提高准确率,反而往往会导致性能下降,从而揭示了主要的瓶颈在于对选项的遮蔽而非匹配机制本身。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教室里参加一场多项选择题考试。你知道答案,但老师把页面上的选项顺序打乱了。突然间,你选错了字母,并不是因为你忘了那个知识点,而是因为你的大脑被新的排列方式搞混了。这就是大型语言模型(LLMs)的奇妙世界——这些超级聪明的计算机程序可以像人类一样聊天和写作。科学家们使用多项选择题来测试这些模型到底“知道”多少,但他们发现了一个漏洞:这些模型表现得就像那些对答案在页面上的位置过于敏感的紧张学生。如果选项的顺序是 A、B、C、D,模型可能会答对;但如果把它们打乱成 B、A、D、C,它可能就会答错。这使得测试分数变得不可靠,因为我们无法判断模型是真的聪明,还是仅仅擅长猜测字母的模式。研究人员希望解决这个问题,以便我们能够信任这些人工智能模型所表达的内容。
在这篇论文中,来自贝尔法斯特女王大学的两位科学家 Karl Hanna 和 Chen Feng 决定测试一个修复这个“打乱问题”的聪明想法。他们想:如果我们让模型先用纯英文写出它的答案,而不去看到任何多项选择的选项呢?然后,在第二步中,我们可以让模型将自己写下的答案与正确的字母进行匹配。这就像是要求一名学生先在小纸条上写下答案,然后再把试卷递给他们,让他们稍后圈出正确的选项。他们的希望是通过在思考阶段隐藏选项,使模型不会受到选项顺序的影响。他们还尝试了第二种方法,即让模型一次只看一个选项,且每个选项都是孤立存在的,就像在决定食谱之前先品尝单一的食材一样,希望这能消除由食材顺序引起的任何偏差。
然而,结果却有点令人失望。研究人员在两个主要的题目集(MMLU 和 ARC-Challenge)上对六个不同的 AI 模型测试了这些方法。他们发现,这两种“无标签”策略都没有可靠地让模型变得更聪明。事实上,“先写后匹配”的方法在几乎所有情况下都让模型的正确率变差了。事实证明,隐藏选项才是问题的关键;如果不看选项,模型就无法弄清楚该如何正确地组织语言来表达其答案,从而导致了大量的困惑和错误。唯一表现得与标准测试一样好的版本,是模型在思考时仍能看到选项的版本。
更令人惊讶的是,科学家们发现,让模型降低对答案顺序的敏感度并不一定会自动提高它们的准确性。例如,一个模型对打乱后的字母不再那么困惑了,但它的测试分数仍然下降了。这就像是一个学生不再根据字母顺序进行猜测,但由于对知识掌握得不够好,得分依然没有提高。论文得出结论,仅仅消除“位置偏差”(由答案放置位置引起的困惑)并不保证能获得更高的分数。事实上,传统的通过打乱答案并进行投票(称为循环置换)的方法,实际上比这些花哨的新招式效果更好。主要的启示是,虽然我们可以修复偏差,但这并不意味着模型会变得更聪明,而且有时试图在测试设计上过于聪明,反而会破坏模型回答问题的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。