← 最新论文
💻 computer science

Self-Verification is All You Need To Pass The Japanese Bar Examination

本文介绍了一种在忠实复制日本司法考试真实格式与评分标准的数据集上训练的自我验证模型,证明了该模型在不改变原始考试结构的情况下,能够超过官方合格分数线,并优于复杂的多智能体或基于分解的策略。

原作者: Andrew Shin

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew Shin

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机就像是读过几乎所有书籍的超级聪明学生的的世界。这些“大语言模型”(LLMs)擅长聊天、写故事和解决数学问题。但有一个棘手的部分:聪明并不等同于专业。这就像是一个人知道足球的所有规则,但从未参加过实际比赛;他可能懂得理论,但一旦比赛开始,他可能会被球绊倒。对于高风险的考试,例如日本律师考试,情况尤其如此。这不仅仅是关于了解法律,而是关于遵循一种非常特定且严格的格式,你必须同时判断多个陈述,并选出完全正确的组合。如果你哪怕错了一个微小的部分,整个答案就会失败。研究人员一直在问一个大问题:这些人工智能学生真的能通过这种真实的、未经修改的考试吗?还是说,它们需要通过改变考试来降低难度?

庆应义塾大学的一位研究人员决定查明真相,他们发现了一些令人惊讶的事实:人工智能并不需要简化测试。事实上,简化测试反而会让 AI 在面对真实情况时表现得更差。研究人员并没有像其他研究尝试的那样,将考试题目拆解成微小的、简单的“对或错”谜题,而是教会了他们的 AI 模型以真实考试中出现的原貌来应对问题。他们使用了一个巧妙的技巧,叫做“自我验证”(Self-Verification)。想象一下,你参加了一场考试,写下了你的答案,然后在交卷之前,你扮演一名严格的老师,仔细检查自己的作业。“等等,”模型问自己,“这个答案真的符合规则吗?”如果它发现了错误,它就会进行修正。

结果取得了巨大的成功。在针对 2024 年日本律师考试进行的测试中,他们的 AI 模型得分是 96 分(总分 175 分)。那一年人类学生的官方及格分数线是 93 分。这意味着 AI 在没有人修改题目或评分规则的情况下通过了考试。研究人员尝试了其他高级方法,比如让多个 AI “智能体”像律师团队辩论案件一样协同工作,但这些方法的效果实际上比单个模型进行自我检查的表现还要差。他们还发现,用简化的、拆解后的问题(如流行的 JBE-QA 数据集)来训练 AI 并不能带来帮助;那些模型在面对真实的、复杂的格式时表现得很吃力。

这项研究表明,秘诀不在于让 AI 变得更聪明或给它更多的数据,而在于教会它尊重考试的严格规则,并成为自己的批评者。通过在真实的格式上进行训练并加入自我验证这一额外步骤,该模型学会了在多个法律要点之间保持其推理的一致性。研究人员谨慎地指出,虽然 AI 通过了这一特定的多选题部分,但这并不意味着它已经准备好在法庭上担任真正的律师了;它仍然无法撰写长篇法律论证或处理考试中的简答部分。但对于这个特定的、高压力的测试,传达出的信息非常明确:有时,解决难题的最佳方式不是将其拆解,而是观察全局,检查你的工作,并恪守规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →