← 最新论文
🤖 AI

Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

Ryze 是一个全自动、高性价比的系统,它通过合成来自生物医学论文的富含证据的训练数据,生成了 BioVLM-8B,这是一种专门的视觉语言模型,通过在图表、表格和文本之间保留关键的证据结构,其在生物医学基准测试上的表现显著优于其基础模型以及 GPT-5.2。

原作者: Yeqi Huang, Yue Chen, Yanwei Ye, Guanhao Su, Luo Mai

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeqi Huang, Yue Chen, Yanwei Ye, Guanhao Su, Luo Mai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一位才华横溢但天真烂漫的学生如何理解复杂的科学研究论文。问题在于,这些论文不仅仅是文字;它们是段落、图表、表格和图像的混乱混合体,而问题的答案往往隐藏在图表的微小标签或表格的特定行中。如果你只给学生提供文本,他们就会开始瞎猜或凭空捏造。

Ryze 是由爱丁堡大学的研究人员开发的一种全新的全自动系统,它解决了这个问题。它扮演着一个高效、不知疲倦的助教角色,将原始科学论文转化为高质量的 AI“教科书”,并利用这本教科书来训练一个名为 BioVLM-8B 的专门化 AI 模型。

以下是 Ryze 的工作原理,分为简单的几个步骤:

1. “智能扫描仪”(修复混乱)

当你扫描一篇科学论文时,标准的工具往往会出错。它们可能会读错图表的轴,或者弄丢表格中的某一行,或者丢失图片与描述该图片的段落之间的联系。

  • 类比: 想象一台复印机,它不仅弄脏了墨迹,还撕掉了说明文字。如果你试图根据这份副本学习,你会感到困惑。
  • Ryze 的做法: Ryze 使用了一个能够理解布局的“智能扫描仪”。它不仅仅是读取文字;它知道“图 3”属于旁边的段落,并且知道表格中的数字需要保留在特定的行中。它清理了错误,并将视觉线索(图表、表格)与文本重新缝合在一起,创建了一份完美的、富有证据支撑的论文副本。

2. “问题生成器”(构建测试)

一旦论文被清理干净,Ryze 就需要创建练习题。

  • 类比: 它不仅仅是问“这是什么?”(这太简单了),Ryze 扮演的是一位严厉教授的角色,它会观察整个语境。它会问:“基于图 2 中的图表和第 4 段中的描述,为什么细胞会改变颜色?”
  • 神奇之处: 它生成了数百万个这样的问题。至关重要的是,每一个问题都附带了它的“答案解析”和解决问题所需的“证据”(特定的图表、表格和文本)。这教会了 AI 去证明它的答案,而不仅仅是猜测。

3. “两步训练法”(学习事实,然后学习逻辑)

Ryze 将 AI 的训练分为两个截然不同的阶段,就像学生先背诵事实,然后再学习如何进行批判性思考一样。

  • 第一阶段:学习阶段 (SFT): AI 阅读数百万个问题和答案,以学习生物学的词汇和基本事实。这就像是在背诵元素周期表。
  • 第二阶段:辩论俱乐部 (强化学习): 一旦 AI 掌握了事实,Ryze 就会转换思路。它不再仅仅要求给出答案,而是开始迫使 AI 构建逻辑推理链。这就像一位辩论教练告诉学生:“不要只给我答案;要展示你利用图表和文本得出答案的具体步骤。”这一步让 AI 在解决难题时真正变得聪明。

结果:超越巨头的微型模型

研究人员从一个标准的开源 AI 模型(Qwen3-VL-8B)开始,利用 Ryze 将其转化为 BioVLM-8B

  • 成本: 整个过程在云端计算机上的运行成本不到 200 美元
  • 性能: 在一项名为 LAB-Bench(测试生物学推理能力)的高难度测试中,BioVML-8B 得分 48.0%
  • 对比: 这个分数大幅领先于 GPT-5.2(来自 OpenAI 的一款庞大且昂贵的商业模型)。它还击败了其他由人类手动编写的数据集,证明了 Ryze 的自动化、基于证据的方法在处理此类特定任务时实际上比人工策划的数据更好。

为什么这很重要

论文声称,秘诀不在于拥有更多的数据,而在于拥有结构更好的数据。通过保留文本、图表和表格之间的联系,Ryze 教会了 AI 成为一名通过证据进行追踪的侦探,而不是一个依赖模式进行猜测的猜测者。

简而言之: Ryze 是一个低成本、自动化的工厂,它将混乱的科学论文进行清理,将其转化为严格的训练课程,并产出一个在理解生物学方面表现惊人的专门化 AI——其表现甚至优于规模更大、更昂贵的模型。研究人员已将代码和模型开放给他人使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →