SciMIF: Understanding Multimodal Instruction Following in Scientific Domains
本文介绍了 SciMIF,这是一个具有全面分类体系和高保真数据流水线的新型基准测试,旨在评估多模态大语言模型在复杂科学指令上的表现,揭示了不同学科之间显著的性能差异,并强调了尽管模型规模不断扩大,但在遵循细粒度约束方面仍存在的局限性。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:SciMIF
问题陈述
多模态大语言模型(MLLMs)在科学领域的应用已从基础的问答演变为复杂的自主科学智能体范式。然而,目前的评估方法主要关注科学正确性(最终答案是否事实准确),而非指令遵循能力(模型是否满足显式的操作约束)。
现有的通用指令遵循基准测试(如 IF-Eval、FollowBench)侧重于对格式、长度和风格的约束,但缺乏领域特定的科学约束。相反,现有的科学基准测试(如 SciBench、MMMU)评估的是推理和知识,却未能系统地测试模型遵循复杂、多步操作指令的能力。这一差距掩盖了两种截然不同的能力:模型可能在违反请求的单位或格式的情况下给出了科学正确的答案,或者在依赖无效科学推理的同时严格遵守了格式。此外,科学指令遵循具有独特的挑战性,因为它依赖于领域特定知识、学科间语义的变化,以及对多模态输入(如分子结构、显微图像)的频繁依赖。
研究方法
1. 科学约束分类法
作者引入了 SciMIF(科学多模态指令遵循),这是一个旨在评估 MLLMs 在化学、地理、生物、材料科学和物理学五个学科中表现的基准测试。
通过对这些学科中 22 个不同任务的分析,作者构建了一个层级化的分类法,包括:
- 10 个功能约束组: 这些组捕捉了跨领域的共同需求,包括:程序 (Procedure)、数量 (Number)、方法 (Method)、单位 (Unit)、格式 (Format)、术语 (Terminology)、精度 (Precision)、字母 (Letter)、结构 (Structure) 和 选择 (Selection)。
- 学科特定实例化: 虽然功能组是共享的,但其具体含义各异。例如,“术语”约束在化学中要求有效的分子命名法,在地理中要求层级地址,而在材料科学中则要求表征技术。
- 约束清单: 最终的基准测试包含从 10 个组中衍生出的 42 个不同约束,并根据每个学科的惯例进行了适配。
2. 数据构建流水线
SciMIF 通过一个四步流水线,对 13 个现有科学数据集(共 2,527 个样本)进行系统性增强构建而成:
- 种子准备: 选择包含问题 ()、可选视觉输入 ()、参考答案 () 和任务类型 () 的样本。
- 约束识别: 识别原始查询中已有的隐性约束,以避免冗余。
- 约束注入:
- 科学约束: 注入与任务类型兼容的领域特定约束。
- 通用约束: 注入通用操作约束(如输出格式、大小写),且不改变参考答案的科学正确性。
- 验证: 通过自动双重检查,确保注入的约束存在于查询中,且标准答案仍然有效。
- 人工校验: 两名标注员对样本的逻辑连贯性、流畅度和约束忠实度进行审查。有问题的样本会被修改或丢弃。
3. 评估指标
该基准测试采用三种指标来评估性能:
- 约束满足率 (CSR): 所有指令中已满足约束的平均比例。
- 指令满足率 (ISR): 指令中所有相关约束都被完全满足的比例。
- 分解需求遵循率 (DRFR): 在总约束数量层面,衡量对单个分解需求的遵循程度。
验证过程利用基于脚本的方法(用于处理格式和单位等确定性检查)以及 LLM-as-a-Judge 协议(用于处理推理步骤等语义检查)。
关键结果
1. 学科间的性能差异
对最先进的闭源模型(如 GPT-5.2, Claude-Sonnet-4.6)和开源模型(如 Qwen3.5, InternVL3.5)的评估显示出显著差异:
- 化学 构成了最大的挑战,表现最好的模型(GPT-5.2)其 ISR 仅为 46.33%。
- 生物 和 材料科学 表现出较高的性能(ISR 约为 72–78%)。
- 地理 由于空间层级关系也呈现出显著的难度。
- 物理 通常产生最高的 DRFR 分数(平均 92.2%)。
2. 模型规模与架构
- 缩放悖论 (Scaling Paradox): 增加模型参数并不意味着指令遵循能力的线性提升。例如,在 Qwen3.5 系列中,122B 模型的 ISR (50.41%) 略低于 27B 模型 (51.37%)。
- 闭源 vs 开源: 闭源模型在所有学科中均一致优于开源对应模型,这表明其在数据质量和对齐策略方面具有优势。
3. 约束领域分析
- 通用约束 vs 科学约束: 模型在科学约束(与任务语义耦合)上的表现明显优于通用约束(格式/结构)。对于 GPT-5.2,科学约束的 DRFR 为 88.74%,而通用约束为 74.65%。
- 细粒度挑战: 模型在 字母 (Letter) 和 数字 (Number) 约束上表现最差,这些约束需要精确的符号处理和领域特定的实体识别(例如,计算化学键的数量 vs 计算字符的数量)。
4. 正确性 vs 遵循度
一个关键发现是科学正确性与指令遵循度之间的弱耦合关系:
- 仅约 30% 的样本同时实现了科学正确性和完整的指令遵循(正确且遵循)。
- 约 20% 的样本在科学正确的同时违反了约束(正确但违反)。
- 超过 30% 的样本遵循了指令但产生了错误的科学答案(错误但遵循)。
- 统计分析(Pearson 检验)证实,虽然正确性和遵循度呈正相关,但这种关联强度较弱( 系数范围在 0.06 到 0.20 之间),表明它们是两种不同的能力。
意义与贡献
本文声称有三个主要贡献:
- 专家衍生的分类法: 建立了涵盖五个学科和十个功能组的全面科学约束分类法,捕捉了共同能力和领域特定需求。
- 可扩展框架: 提供了一种将现有科学任务转化为指令遵循评估的方法,通过识别隐性约束并在不改变参考答案的前提下注入兼容约束。
- 基准测试与评估: 构建了 SciMIF 并对代表性 MLLMs 进行了评估,揭示了:
- 显著的学科性能差异。
- 细粒度约束带来的严峻挑战。
- 科学正确性与指令遵循度之间明显的鸿沟。
作者总结认为,目前的 MLLMs 尚不足以胜任需要严格操作约束的严谨科学应用。他们建议未来的研究应侧重于领域感知的指令对齐、集成外部工具(如符号引擎)以处理细粒度约束,以及优化正确性与遵循度的共同达成,而非将其孤立对待。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。