← 最新论文
🧬 genetics

A collaborative submission model for building high-quality data resources at scale through partnership

本文提出了一种协作式提交模型,以 CZ CELLxGENE Discover 为例,该模型通过让数据贡献者与专门的策展人合作,在平衡语料库规模与元数据丰富度及质量方面取得了成功,从而有效地扩展了高质量生物医学数据资源的创建。

原作者: Hilton, J. A., Chaffer, J., Chien, J., Gabdank, I., Mott, B., Rutherford, E., Small, C., Zamanian, J., Aevermann, B., Cherry, J. M., Klein, T. E.

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Hilton, J. A., Chaffer, J., Chien, J., Gabdank, I., Mott, B., Rutherford, E., Small, C., Zamanian, J., Aevermann, B., Cherry, J. M., Klein, T. E.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图建立世界上最大、最实用的生物信息库,以帮助科学家训练智能计算机程序(AI)并解决重大的医学谜团。

这篇论文描述了一个主要问题:你想要一个拥有数百万本书(海量数据)的图书馆,但同时你又需要每一本书都书写完美、组织有序且易于理解(高质量且细节丰富)。通常情况下,这两个目标是相互冲突的。如果你只是让人们把书丢过来,你会得到一大堆乱七八糟的东西,里面充满了残缺的页面和缺失的书名;如果你试图亲自动手整理一切,你一次只能处理很少量的书。

解决方案:“协作提交”模式

作者解释了他们是如何通过建立两个群体之间的合作来解决这个问题的:

  1. 研究人员(贡献者): 这些是实际进行实验的科学家。他们了解数据背后的“秘密故事”,但由于工作繁忙,没时间花好几个小时来为公共图书馆进行格式化处理。
  2. 馆员(合作伙伴): 这些是图书馆专家,他们深谙如何组织、标记和标准化数据,使计算机和其他科学家能够轻松使用这些数据。

它是如何运作的(类比)

把它想象成一家协助搬家的专业搬家公司

  • 旧方式(贡献者驱动): 你要求房主打包每一个箱子、贴好每一个标签并驾驶卡车。他们确实做了,但他们可能会忘记给“易碎品”贴上标签,或者把厨具和书混在一起打包,导致以后很难找到任何东西。
  • 另一种旧方式(资源驱动): 搬家公司在不询问房主任何情况的情况下尝试为你打包整个房子。他们把一切都收拾得很整齐,但他们不知道哪个箱子里装的是传家宝,或者哪本书是珍贵的初版书。他们可能会扔掉重要的东西或贴错标签。
  • 新方式(协作式): 房主(研究人员)说:“这是传家宝,这是我想保留的书。” 搬家公司(馆员)说:“太好了,我会小心地打包它,贴好完美的标签,并把它放入正确的卡车中。”

为什么有效

  • 两全其美: 研究人员提供“亲身经验”(背景信息),而馆员提供“标准化”(组织方式)。
  • 减轻负担: 研究人员不需要承担所有的繁重格式化工作;他们只需要分享他们的知识。
  • 更高的质量: 因为馆员是让数据可重复使用的专家,所以最终结果是一个高质量的资源,已准备好用于 AI 训练和复杂的分析。

结果

通过使用这种合作伙伴模式,CZ CELLxGENE Discover 项目已成为一个快速增长、高质量的“图书馆”,科学家们利用它来测试新想法、验证他们的发现并构建 AI 模型。该论文认为,这种特定的协作工作方式是建立大规模、可靠且能随着时间推移持续增长的数据资源的秘诀,且不会以牺牲质量来换取数量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →