想象你拥有一个由龟甲和兽骨制成的巨大、古老的拼图盒。这些是甲骨文,是中国最古老的文字系统,在几千年前就被刻在了上面。长期以来,专家们一直试图破解这些奇怪图像的含义。到目前为止,他们已经成功破译了约 4,500 多个字符中的 1,600 个,但剩下的部分仍然是一个谜。
直到现在,大多数试图解决这个谜题的计算机程序都像是复印机。你给它们看一张骨头刻痕的照片,它们会尝试猜测:“这是字符‘A’还是‘B’?”它们擅长匹配以前见过的模式,但并不真正“理解”这张图片。它们只是记住了答案。
这篇论文介绍了一种新的 AI,名为 OracleAnalyser。它不再仅仅是一个复印机,而更像是一个侦探或翻译官,能够真正观察线索,并解释为什么它认为某个字符代表某种含义。
以下是他们如何构建这个“侦探”的,使用了简单的类比:
1. 问题:“盲目猜测” vs. “思考”
之前的 AI 模型就像是那些只背诵了答案解析却不懂数学原理的学生。如果它们看到一个没背过的字符,就会直接瞎猜。
- 旧方法: 展示一张刻着人头顶扛着东西的骨头照片。AI 猜:“这是‘天’这个字符。”但它无法解释为什么。
- 新方法 (OracleAnalyser): AI 观察同一张照片并说:“我看到一个人站着。他们的头顶上方有一个圆形的形状,就像是在扛着重物。这看起来像是古代表示‘天’的符号。”它在给出答案之前,会将图像拆解成各个部分。
2. 训练:教导侦探
研究人员不仅仅是喂给 AI 更多的图片,他们还教会了它如何思考,分为三个步骤:
第一步:讲座(监督微调/Supervised Fine-Tuning)
他们选取了一个聪明的 AI(Qwen2.5-VL),并向它展示了数千个例子,在这些例子中,专家会在命名字符之前先解释图片。这就像老师向学生演示:“看这些线条,它们看起来像一个屋顶。这意味着‘房子’。”AI 学习模仿这种推理过程。
第二步:模拟考试(生成数据)
AI 被要求参加一场测试。有时它答对了,有时答错了。研究人员收集了这些尝试过程。
- 好的答案: “这看起来像一棵带有根部的树。”(正确)
- 坏的答案: “这看起来像一根棍子。”(错误)
他们利用这些对比来教导 AI 区分什么是好的解释,什么是坏的解释。
第三步:专项辅导 (SFPO)
这是该论文最大的创新点。标准的训练方法有时会产生混乱,如果“坏”答案其实也“算对了一半”(例如,说一棵树看起来像一根棍子并不完全错,但不够具体)。
研究人员创建了一种新的辅导方法,称为稳定焦点偏好优化 (Stable Focal Preference Optimization, SFPO)。
- 类比: 想象一位教练,他不会在学生犯错时只会大喊“错!错!错!”。相反,这位教练会专注于最重要的错误,并忽略那些过于模糊或琐碎的错误。同时,他还会确保学生不会忘记在第一次“讲座”中学到的知识。这让 AI 的学习过程保持稳定且专注。
3. 结果:拥有强大智慧的小脑瓜
通常,要解决难题,你需要一个巨大的计算机大脑(一个巨大的 AI 模型)。但 OracleAnalyser 非常之小——它只有 30 亿个参数(相比于竞争对手那些拥有 700 亿参数的巨型大脑,这可以被视为一个高效的小型大脑)。
尽管规模较小,它的表现却优于所有巨型模型。
- 对于已知字符: 它在解释含义和识别字符方面表现得更出色。
- 对于未知字符: 当看到从未见过的骨头刻痕时,它仍然能够观察图片,描述形状(如“看起来像烟雾”或“看起来像屋顶”),并做出聪明的推测。
总结
论文声称,通过教导 AI 先去分析图片(像侦探一样),而不是仅仅识别模式(像复印机一样),并使用一种特殊的、稳定的训练方法来避免混乱,他们创造了一个小巧但强大的工具。这个工具通过解释古代绘画背后的“故事”,而不仅仅是猜测字符的名字,从而帮助研究人员理解中国古代历史。
技术摘要:OracleAnalyser
1. 问题陈述
甲骨文(中国最早的成熟文字系统)的破译仍然是考古学和文献学领域的一项重大挑战。虽然已有超过 4,500 个字符被识别,但其中仅有约 1,600 个被破译。现有的面向该领域的人工智能方法(包括深度学习模型和当前基准测试)主要侧重于识别任务(即识别字符本身)。这些方法往往忽视了同样关键的分析推理环节——即解释象形结构及其语义含义的过程。目前的基准测试缺乏评估模型生成中间分析推理能力的指标,这限制了人工智能在破译未知字符时的可解释性和有效性。
2. 方法论
作者提出了 OracleAnalyser,这是一个基于多模态大语言模型(MLLM)后训练技术(post-training techniques)的甲骨文分析推理框架。该框架通过三个主要阶段运行:
A. 数据集构建
- 甲骨文推理数据集: 从 EVOBC 数据集中构建,经过筛选包含 2,807 个有效字符。作者利用 Qwen-VL-MAX,以象形视角为基础,并以相应的现代汉字为约束条件来确保准确性,从而生成分析性描述。这些描述由 Qwen-3 进行优化,并由专家进行人工校验,最终形成了一个包含约 5,500 个样本的数据集(5,000 个用于训练,500 个用于域内测试,500 个用于域外测试)。
- 甲骨文偏好数据集: 通过使用监督微调模型(OracleAnalyser-SFT)对甲骨文图像进行多次推理追踪来生成。正样本为真实的分析过程,负样本则从模型自身的系统性错误(错误的识别推理过程)中选取。经过人工过滤后,由此产生了超过 3,400 对高质量的偏好对。
B. 训练流水线
- 监督微调 (SFT): 以 Qwen2.5-VL-3B-Instruct 为基座模型,在推理数据集上进行微调。此阶段使模型具备基础的视觉模式识别和分析推理能力,为后续步骤提供稳定的初始化。
- 稳定焦点偏好优化 (SFPO): 针对标准直接偏好优化(DPO)在该领域存在的局限性(特别是过度拟集噪声偏好以及在难以区分的对中过度解读的倾向),作者提出了 SFPO。
- 焦点组件 (LF): 借鉴焦点损失(Focal Loss)的概念,对“难以排序”的偏好对进行降权处理。这些对是模型难以区分正确与错误推理之处,旨在防止模型学习到伪造的区别。
- 稳定性组件 (LS): 引入反向 KL 散度项来约束策略模型 (πθ) 与参考模型 (πref) 之间的差异,从而确保训练的稳定性并防止过度漂移。
- 最终损失函数结合了这些组件:LSFPO=LF+λLS。
C. 评估基准
作者引入了一个包含域内和域外评估的新基准。不同于以往仅关注识别准确率的基准,该基准评估以下内容:
- 分析质量: 通过与标准答案(ground-truth)对比的 BLEU-1、BLEU-4、ROUGE-1 和 ROUGE-L 分数进行衡量。
- 识别准确率: 针对域内任务。
- Sentence-BERT 分数 (SBS): 针对域外任务,通过衡量模型生成的分析与标准答案之间的语义相似度,来评估其在未知字符上的泛化能力。
3. 核心贡献
- 数据集与基准: 发布了首个甲骨文推理数据集、首个甲骨文偏好数据集,以及一个旨在系统性评估分析能力而非仅仅是识别能力的全新基准。
- OracleAnalyser 框架: 一个将显式推理与多种后训练策略(SFT 和 SFPO)相结合的新颖框架,专门针对甲骨文分析进行了定制。
- SFPO 算法: 一种新的偏好优化算法,通过减轻噪声和模糊偏好对的负面影响,实现了训练的稳定并聚焦于有价值的样本。
- 性能表现: 证明了一个 3B 参数的模型可以实现优于规模显著更大(高达 241B 参数)的专用识别模型的分析性能。
4. 实验结果
在域内和域外测试集上进行了广泛的实验:
- 域内性能: OracleAnalyser 实现了 39.6% 的识别准确率,并在分析指标(BLEU 和 ROUGE)上显著超越了所有竞争模型(包括 InternVL-3.5-241B 和专门的 OBSD 模型)。例如,其 BLEU-4 得分为 72.77,而次优的通用 MLLM 得分仅约为 4.32。
- 域外泛化能力: 在未知字符上,OracleAnalyser 取得了最高的 Sentence-BERT 分数 (70.35),表明其生成的分析在语义上比大型模型更接近真实情况。
- 消融实验:
- 数据过滤: 去除模糊的偏好对提升了性能,证实了数据质量比数量更为关键。
- 训练策略: 结合了 SFT、焦点损失 (LF) 和稳定性损失 (LS)(即 SFPO)的方法取得了最佳结果。标准的 DPO 提升有限,而省略稳定性项 (LS) 会导致后期训练崩溃。
- 视觉分析: 定性结果显示,模型能够准确分解字形并将部件与现实世界的实体联系起来,展示了其习得的象形分析能力。
5. 意义
论文声称,OracleAnalyser 代表了甲骨文研究领域从纯粹识别向分析推理的转变。通过利用后训练技术和一种新颖的优化算法,该框架使得一个相对较小的模型(3B 参数)能够在破译任务中超越庞大的模型。作者认为,这种方法为文化遗产保护提供了一种更具可解释性和有效性的解决方案,为古文字学家在面对未知字符时提供了一种缩小搜索空间的方法。该工作被认为是第一个将显式推理与多种专门针对甲骨文分析的后训练策略相结合的研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。