Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding
本文介绍了 S-OBI,这是一个通过合成清晰、标准化的句子级甲骨文实例来评估多模态大语言模型的创新基准,研究揭示了当前模型由于过度依赖字符级识别以及视觉感知误差的传播,在理解结构化甲骨文方面存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人阅读中国古代历史。长期以来,研究人员一直在教这些机器人识别单个的古代符号,这有点像在教一个孩子识别孤立的字母“A”或数字“1”。它们可以指向龟甲上的一个雕刻符号并说:“那是一个‘马’字。”
但真正的历史不仅仅是随机字母的堆砌;它充满了句子、故事、日期和特定的含义。这篇题为**《超越单字》(Beyond Single Character)**的论文指出,仅仅让机器人能够识别字母,并不意味着它就能读懂故事。
以下是研究人员所做的工作及其发现的简单拆解:
问题所在:“乐高”与“城堡”
把甲骨文(这种古代文字)想象成一个由乐高积木搭建的城堡。
- 以往的研究只测试机器人能否识别单个的红色积木或蓝色积木。
- 这篇论文则在问:“机器人能否观察整个城堡,并告诉你谁建造了它、为什么要建造它以及背后的故事是什么?”
研究人员发现,目前的 AI 模型(称为多模态大语言模型,或 MLLMs)非常擅长识别单个积木,但在理解整个城堡方面表现糟糕。它们可能知道“马”这个符号长什么样,但却无法判断这个句子是在讲一位国王在狩猎马,还是在讲一匹马正在逃跑。
解决方案:构建一个“干净”的测试(S-OBI)
古代记录古老、有裂纹且脏污(就像一张模糊、破损的照片)。为了公平地测试 AI,研究人员创建了一个新的基准测试,称为 S-OBI。
他们没有使用杂乱的原始照片,而是扮演了数字修复师的角色:
- 他们选取了 95 个由专家已经翻译并理解的古代句子。
- 他们将古代雕刻中模糊、脏乱的部分替换成了那些相同符号的清晰、完美的数字版本。
- 他们保持了句式结构完全不变,但使视觉输入变得“干净”。
这就像是将一封来自 1800 年代、脏乱且破损的信件进行扫描,然后用完美的字体在干净的纸上重新打出来,这样 AI 就不会被污垢分散注意力,从而能够纯粹地专注于理解句子的含义。
测试:三个难度等级
他们设计了三种类型的谜题,以观察 AI 到底有多聪明:
- “大意”测试(语义匹配): “这是一个古代句子。以下四个现代摘要中,哪一个最能描述它?”
- 结果: AI 表现尚可。它能猜出大致的氛围。
- “结构”测试(槽位提取): “这是一个句子。请填写一份包含日期、人物、动作和对象的表格。”
- 结果: AI 遇到了困难。它无法正确组织信息。
- “侦探”测试(上下文推理): “这是一个我们擦除了一个词的句子。根据其他词汇,缺失的词是什么?”或者“这是一个我们打乱了词序的句子。请把它们放回正确的顺序。”
- 结果: AI 失败得很惨。它无法利用周围的线索来推断缺失的部分。
重大发现
最令人惊讶的发现是,AI 仍然停留在“单字”层面。
研究人员发现,如果 AI 在识别一个微小的符号时犯了一个小错,这个错误就会在整个句子中产生连锁反应,导致 AI 对整个故事的理解产生偏差。这就像如果你读错了一个词,你可能会误解整个段落。
即使是经过测试的最智能的 AI 模型(如 GPT-4o 和 Qwen)总分也非常低(正确率仅为 33% 左右)。它们有时能猜出正确的词序(比如知道句子是以日期开头的),但它们实际上无法理解句子所讲述的故事。
结论
论文得出结论:虽然 AI 在识别古代符号方面正在进步,但它尚未学会如何将它们作为一种连贯的语言来“阅读”。这就像是拥有了一本字典,却还不知道如何写诗。要真正理解这些古代记录,AI 需要超越仅仅识别单个积木,转而学习如何构建(并理解)整座城堡。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。