← 最新论文
💬 NLP

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

HABIB_TAZ 系统通过采用在合成三段论数据上训练的 mDeBERTa-v3 模型,并结合多目标优化,有效地在多种语言中将形式逻辑与内容偏差解耦,从而在 SemEval-2026 Task 11 中取得了顶尖排名。

原作者: Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何解决逻辑谜题。你给了它一条规则:“如果所有的鸟都会飞,而企鹅是一种鸟,那么企鹅就会飞。”人类可能会停下来说:“等等,企鹅不会飞!这条规则在现实世界中是错误的。”但一个过于依赖“常识”的机器人可能会感到困惑。它可能会想:“哦,企鹅是鸟,而鸟会飞,所以结论一定是正确的,”尽管由于起始规则错误,逻辑本身是有缺陷的。这就是科学家们试图用大语言模型(LLMs)解决的棘手问题。这些模型是聊天机器人和搜索引擎背后的强大 AI 大脑。它们擅长写故事和回答问题,但往往难以区分“逻辑上的真实”与“听起来可信”。它们会被“内容效应”所迷惑,即单词在现实世界中的含义分散了它们对论证实际结构的注意力。这项研究的目标是构建一个像严谨的逻辑学家一样的 AI:它会检查论证的数学结构是否成立,而不论这个故事听起来是荒诞还是合理。

HABIB_TAZ 团队参加了一项名为 SemEval-2026 Task 11 的竞赛,旨在测试这种能力。他们的任务是创建一个系统,能够观察 12 种不同语言中的三段论(一种由两个前提和一个结论组成的逻辑论证),并判断结论是否遵循规则,即使前提是胡言乱语,或者其中掺杂了额外的干扰句子。

为了解决这个问题,研究人员并没有仅仅向他们的 AI 输入更多的现实世界数据。相反,他们建立了一个“合成”训练场。想象一下,他们创建了一个巨大的工厂,利用严格的、虚构的规则和胡言乱语的词汇(而不是真实的动物或物体)来生成数百万个逻辑谜题。这样做是为了防止 AI 基于现实世界的知识学习捷径。然后,他们使用一种特殊的“三部分训练配方”来训练基于强大语言引擎 mDeBERTa-v3 的 AI 模型。首先,他们使用了一种技术,确保模型不会忽略那些更难、更棘手的例子。第二,他们加入了一个“偏差惩罚”,就像一位老师在学生被故事的“合理性”分心时轻轻地责备他们,迫使他们只关注逻辑。第三,他们使用了一项一致性检查,以确保模型理解复杂的句子与简单的句子在逻辑上表达的是同一个意思。

结果呈现出完美得分与有趣挑战并存的局面。在较简单的任务中——仅限英语的谜题、带有干扰项的英语谜题,以及 12 种语言且无干扰项的谜题——他们的系统取得了 100.0 的满分。它完全忽略了“现实世界”的陷阱,每次都正确掌握了逻辑,且偏差为零。然而,最难的任务是“嘈杂的多语言”任务,即 AI 必须同时处理 12 种语言和干扰句子。在这里,该系统排名第 6。它答对了 89.06% 的题目,但仍表现出少量的偏差(2.89%)。

研究人员发现,他们的特殊训练配方在较简单的任务中效果显著,证明了如果你使用合成的、基于规则的数据而非混乱的现实世界文本进行训练,你可以教会 AI 成为一个纯粹的逻辑学家。对于最难的任务,他们注意到模型在处理原始多语言数据时比处理英语翻译数据时更为吃力,这表明模型处理不同语言的方式仍然有些不稳定。他们还发现,添加特定的“一致性”检查(使用 KL 散度)有助于模型在不同语言之间保持稳定,尽管这需要消耗大量的计算资源。最终,论文指出,虽然我们可以构建在纯逻辑方面极其出色的 AI,但使其在每种语言和每种类型的噪声下都保持稳健仍是一个正在进行中的课题。该团队已公开了他们的代码和数据生成工具,希望其他人能利用它们来构建更优秀的、更具逻辑性的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →