paper.json: A Coordination Convention for LLM-Agent-Actionable Papers
本文提出了一种名为 `paper.json` 的轻量级学术论文配套 JSON 规范,该规范利用稳定标识符和明确的 Shell 命令,使大语言模型代理能够在不修改原始人类可读文本的情况下,可靠地提取子主张、界定范围并复现结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人如何阅读科学论文。你递给它一份标准的 PDF 文件,期望它能理解要点、找到具体实验,甚至运行代码以验证结果是否真实。
根据这篇论文,问题在于标准论文是写给人类看的,而不是给机器人看的。它们就像一篇美味而复杂的故事,最重要的事实被埋藏在辞藻华丽的段落中。当机器人尝试阅读时,它会感到困惑。它可能会臆测出一个不存在的事实,遗漏运行实验所需的特定指令,或者误解某个定义。
这篇论文提出了一个简单的解决方案:paper.json。
将 paper.json 想象成随论文一同寄出的机器可读“作弊条”。它不会改变人类眼中论文的样子,只是增加了一个结构化的数字层,让机器人能够瞬间理解。
以下是该论文通过四个主要“规则”(惯例)对解决方案的拆解,并辅以日常类比进行解释:
1. “便利贴”系统(稳定主张 ID)
问题: 在普通论文中,如果机器人想引用某句特定的话,它必须搜索全文。它可能会抓取错误的句子,或者错过细微差别。
解决方案: 论文为每个重要主张分配一个唯一 ID,就像贴着一张带编号的便利贴(例如 C1、C2)。
类比: 想象一个图书馆,每本书都有特定的书架位置。与其告诉机器人“去第三章找关于蓝鸟的那部分”,你只需说“去 C1"。机器人确切知道该看哪里,无需猜测。
2. “我们未做之事”清单(显式非主张)
问题: 机器人往往过于兴奋。如果论文说“方法 A 在数据集 X 上有效”,机器人可能会猜测:“哦,所以方法 A 对所有数据集都有效!”这被称为“范围过度延伸”。
解决方案: 论文包含一个名为 “非主张(Does-Not-Claim)” 的特定部分。
类比: 想想餐厅的菜单。通常菜单列出你可以点的菜。这篇论文则增加了一份你不能点的清单。它明确告诉机器人:“我们在苹果上测试过,但没有在橙子上测试。不要假设它在橙子上也有效。”这能阻止机器人编造事实。
3. “复制 - 粘贴”按钮(可执行命令)
问题: 论文可能会说“我们运行了一个脚本来生成图 3"。但它没说哪个脚本,也没说用什么设置。机器人不得不猜测,而通常猜错。
解决方案: 论文列出了机器人需要在计算机上输入的确切命令,以重现该图表。
类比: 想象一份食谱说“把意大利面煮到熟为止”。这很模糊。而 paper.json 就像一份食谱,写着“精确输入:boil water -time 10min"。机器人可以复制该字符串,粘贴并运行,无需成为大厨。
4. “字典”(稳定定义)
问题: 科学家经常以不同于日常语言的方式使用词汇。如果论文在长段落中定义了一个术语,机器人可能会错过它,并在之后使用错误的含义。
解决方案: 论文为每个定义分配一个唯一 ID(如 D1),并清晰地写出定义。
类比: 这就像拥有一个术语表,每个词都有固定的 ID 卡。如果机器人看到“网络(Network)”这个词,它不必猜测你指的是计算机网络还是社交网络。它只需查找 D1,就能看到作者写的确切定义。
"C4"规则:保持简单
论文强调,这对人类作者来说不应困难。
类比: 你不需要为了装门铃而重建房子。你只需要安装那个按钮。作者声称,手写这份“作弊条”(paper.json)耗时不到一小时,不需要任何特殊软件,也不必修改论文文本。这是一个低成本附加项,能让论文具备“机器人就绪”状态。
实验
这篇论文之所以独特,是因为它言行一致。
- 论文本身包含一个
paper.json文件。 - 它包含一个“验证器”(用于检查作弊条是否与论文匹配的工具)。
- 它邀请机器人阅读它、测试这些规则,并报告结果是成功还是失败。
论文未主张的内容
作者非常谨慎,避免过度承诺。他们明确指出:
- 他们并未证明机器人将永远不再犯错;他们只是降低了犯错的可能性。
- 他们尚未解决所有类型论文的问题(例如那些包含复杂数学定理的论文);那是未来的工作。
- 他们并非要取代现有系统(如标准学术数据库);他们只是在现有系统之上增加了一个轻量级层。
简而言之: 这篇论文建议,为了帮助机器人阅读科学,我们需要停止仅为人类写作。通过添加一份简单、结构化的“作弊条”(paper.json),明确列出论文主张了什么、未主张什么,以及确切如何运行代码,我们可以让机器人停止猜测,转而基于确切知识行动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。