← 最新论文
🤖 AI

Prompt-to-Paper: Agentic AI System for Bioinformatics

本文介绍了“Prompt-to-Paper”,这是一个多智能体生物信息学系统,通过将论点锚定在可验证的文献中、执行真实的计算实验,并利用自动化的八维评分框架进行迭代质量优化,以低成本实现了达到高人类评分标准的可发表论文生成。

原作者: Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,有一支人工智能研究团队,他们决定开发一种机器人,它不仅仅是“写”一篇科学论文,而是真正地“做”科学研究,检查自己的工作,并不断改进,直到达到发表水平。他们将这个系统称为 Prompt-to-Paper(从提示到论文)。

以下是它的工作原理,分为几个简单的部分:

1. 问题所在:会撒谎的 AI

目前的 AI 工具可以非常快速地撰写文章和论文,但它们有三个重大缺陷:

  • 它们捏造事实: 它们经常编造事实或虚假的引用(就像一个学生编造了一本自己从未读过的书)。
  • 它们伪造结果: 它们在没有实际运行实验的情况下就写下“我们发现了 X”,只是在猜测数字。
  • 缺乏质量控制: 没有标准的方法来检查一篇论文是否真的优秀,或者它是否只是“空话”。

2. 解决方案:专业化机器人团队

作者构建了一个名为 Prompt-to-Paper(或 RLEv4)的系统,它就像一个运行在计算机里的完整研究实验室。它不是由一个机器人完成所有工作,而是使用了一个由专门的“智能体”(数字员工)组成的团队,它们彼此进行交流。

以下是其工作流程:

  • 图书管理员(研究员):
    当你给出一个主题(例如“病毒是如何变异的?”)时,图书管理员不会仅仅靠猜测。它会出去寻找 60 到 100 篇真实存在的科学论文。它会仔细阅读这些论文,检查哪些论文支持彼此,哪些论文存在分歧。它会构建一个“知识图谱”(事实地图),确保最终论文中的每一个主张都有真实的来源支撑。

    • 类比: 想象一个学生,他不是在猜答案,而是去图书馆阅读了 100 本教科书,并且只记录那些在书中得到证明的事实。
  • 科学家(代码编写者):
    这是最重要的部分。大多数 AI 只是写下数字,比如“结果是 42”。而这个系统拥有一个 科学家智能体,它会实际编写并运行真实的计算机代码来进行数学计算。它执行真实的生物实验(例如分析 DNA 序列),并将实际的数字保存到文件中。

    • 类比: 相比于一个学生写道“我跑了一场比赛,用了 10 分钟”,该系统实际上是用秒表跑了那场比赛,然后记录下了真实的成绩。
  • 编辑(质量评分员):
    一旦草稿写好,一个 编辑智能体 会根据 8 分制量表(类似于成绩单)对其进行评分。它会检查诸如:“数学对吗?”“引用的书对吗?”“写作是否清晰?”等问题。

    • 转折点: 如果编辑发现虚假引用或数字与科学家的真实数据不符,它会给予极大的扣分。这就像一位老师对照着计算器检查你的作业;如果数字对不上,你就得零分。

3. “深度研究”循环:变得越来越好

该系统不会只写一个草稿就停止。它运行一个 60 步的改进循环

  • 常规操作: 编辑找出论文中最薄弱的部分(例如“统计数据较弱”)。系统随后会采取三种行动之一:
    1. 增加分析: 回到科学家的真实数据中,更好地解释这些数字。
    2. 收集证据: 回到图书管理员的图书馆,寻找更多的证据。
    3. 重写: 修正语法和流畅度。
  • “深度挖掘”: 每 10 步,系统就会停止仅仅进行文字润色。它会回到科学家那里,说:“我们需要一个新的实验来证明这一点”,然后运行一个新的真实实验,并用新的、更强的证据重写整篇论文。

4. 结果:奏效了吗?

团队在 五个不同的生物信息学问题(例如分析 DNA 代码如何运作)上测试了该系统。以下是发生的情况:

  • 真实的结果: 系统生成了带有真实数据的真实 PDF 文件。
  • 没有虚假引用: 在所有五篇论文中,零个引用是虚假的。每一个参考文献都指向了系统实际找到的真实论文。
  • 不断进步: 通过运行改进循环,质量得分平均上升了 18 分(总分 100 分)。“深度挖掘”(运行新实验)是得分大幅跳升的主要原因。
  • 成本: 生成并完善一篇完整的论文大约花费 0.31 美元
  • 人工检查: 当独立的人类和其他 AI 阅读这些论文时,他们给出的平均分是 7 分(满分 10 分)。他们认为科学内容是扎实的,数学也是真实的,但写作方面仍需要人类的润色才能达到完美。

总结

Prompt-to-Paper 是一个证明了 AI 不仅仅能写文字的系统。它可以:

  1. 阅读真实的书籍以寻找事实。
  2. 运行真实的实验以获得真实的数据。
  3. 对自己的工作进行评分并修复自己的错误。

它目前还不是人类科学家的替代品(写作仍需润色),但它是一个强大的研究助手,确保论文背后的科学是真实的、可验证的,而不是凭空捏造的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →