← 最新论文
🤖 AI

Position: Want Better ML Reviews? Stop Asking Nicely and Start Incentivizing with a Credit System

本立场文件认为,若要改善机器学习同行评审,需要超越礼貌性的准则,转而实施可强制执行的程序性保障措施以及一种基于信用的激励机制(例如“OpenReview 积分”),以奖励高质量贡献并规范投稿量。

原作者: Shaochen Zhong

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaochen Zhong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器学习这个致力于教计算机如何从数据中学习的广阔且快速发展的领域中,一个关键的瓶颈已经出现,它不在于技术本身,而在于用于验证技术的这种人类流程。在新的发现可以与世界分享之前,它必须通过同行评审——这是一个由专家阅读并评估其同事的工作,以决定其是否值得发表的系统。几十年来,这一过程一直依赖于一个简单的社会契约:如果你想发表你的作品,你必须同意评审他人的作品。然而,随着研究论文的数量激增,单个重大会议的投稿量已达数万篇,这种礼貌性的协议已开始出现裂痕。海量的投稿量压垮了现有的专家资源,导致评估仓促、标准不一,并让那些感到系统不再按预期运行的科学家们产生了日益增长的挫败感。该领域面临的核心问题不再仅仅是如何管理工作量,而是如何创建一个能够真正鼓励高质量、深思熟虑的反馈,而非仅仅是“打卡式”完成任务的系统。

莱斯大学的钟绍臣(Henry Zhong)最近发表的一篇立场论文指出,要求研究人员更加细心或遵循更好的准则的现有方法是不足够的。作者认为,机器学习界已经到了一个阶段,即仅靠礼貌的请求和乐观的准则已无法解决投稿量和评审质量的危机。相反,该论文提议进行一次彻底的转变,将评审视为一种形式的“货币”。其核心思想是用一种有形的信用经济取代目前的“荣誉制度”,在这种经济中,研究人员通过对评审过程的贡献来赚取积分,并可以用这些积分来获得特定的特权。这种方法从依赖于善意转向了一种结构,其中良好的行为得到奖励,而不良行为则承担可衡量的代价。

该论文指出了导致当前功能失调的两个主要驱动因素。首先,提交给主要会议的论文数量增长如此之快,以至于现有的专家在物理上不可能为每一篇论文都给予应有的关注。由于一些会议收到的投稿超过两万篇,系统被迫做出快速且往往是武断的决定,以维持流程的推进。其次,对于不良行为缺乏后果约束。一名评审员可以在无需担心后果的情况下提交敷衍、低质量甚至荒谬的批评,而一名付出额外努力提供详细、建设性反馈的评审员却得不到任何实质性的认可。作者指出,虽然一些会议尝试通过限制作者可以提交的论文数量来控制规模,但这些措施通常会失败,因为它们没有解决根本原因:即提交未准备好工作的论文缺乏代价,以及进行高质量评审缺乏奖励。

为了解决这些问题,作者提出了一个名为“OpenReview积分”的系统。在这种模式下,研究人员可以通过执行特定任务来赚取积分,例如撰写一份标准的评审报告、协助处理紧急评审,或被认定为优秀的评审员。这些积分随后将作为一种灵活的货币,可以在不同的主要会议之间使用。例如,研究人员可以消耗积分来申请豁免评审义务、请求另一位专家对争议性论文进行评议,甚至可以用积分兑换免费的会议注册费。该系统旨在实现细粒度和可执行性,允许组织者以比目前“全有或全无”的方法更微妙的方式,奖励良好行为并惩罚不良行为。

该论文明确反对社区尝试过的几种现有解决方案。它指出,仅仅要求评审员表现得更友善或更彻底是无效的,因为这依赖于当前系统并不支持的动力。它还批评了对作者提交论文数量实施严格硬性限制的想法,指出此类规则往往导致团队只是通过删除论文中的姓名来符合上限,而不是真正减少投稿数量。此外,作者警告说,严厉的惩罚(例如因为评审员投入较低而拒绝论文)是一种过于粗放的手段,难以应对广泛存在的低质量评审行为。相反,提议的信用系统提供了一个中间地带,其中的惩罚可以是成比例的,例如通过扣除积分来应对低质量评审,这起到了威慑作用,又不会摧毁研究者的职业生涯。

该提案的一个关键组成部分是“细粒度的程序保障”理念。作者概述了四种具体的机制来防止系统被滥用。首先,系统会将某些操作限制在特定角色内,确保只有论文的主作者才能通过消耗积分来请求额外帮助,从而防止负担转移到责任较小的团队成员身上。第二,系统会对某些行为的频率设置上限,防止任何人通过提交大量低质量评审来“刷分”。第三,系统将采用动态定价,这意味着研究人员使用的特定特权越多,所需的积分就越高,从而确保稀缺资源被保留给最关键的需求。最后,系统将依靠同行投票来判断评审质量,允许社区集体识别并惩罚不良行为者,同时奖励那些提供卓越反馈的人。

作者承认,这个系统并非没有挑战或潜在的负面影响。人们担心信用系统可能会有利于那些已经拥有更多时间和资源的学者,让他们能够通过“购买”来逃避责任。然而,论文认为,由于积分是通过劳动而非金钱赚取的,因此该系统奖励的是努力而非财富。此外,也存在系统被操纵或积分随时间流逝而贬值的风险,类似于现实经济中的通货膨胀。为了应对这一点,作者建议积分应在一定期限后过期,并且系统应逐步推广,先从现有的福利(如免费会议注册)开始,然后再引入更复杂的功能。

论文最后强调,目标并不是创建一个完美的系统,而是使当前系统变得更具可持续性和问责制。作者建议,首批采用该系统的会议应当从小规模开始,利用现有的奖励机制来测试水温,然后再扩大范围。通过追踪关键指标并在不同会议间共享数据,社区可以学习哪些做法有效,哪些无效,最终建立一个惠及所有人的共享框架。其最终愿景是一个同行评审过程,其中良好的行为得到认可和奖励,研究人员对系统的质量拥有利益相关性,并且当前的挫败感将被一种更具功能性和公平性的思想交换所取代。这一提议代表了一种转变:从寄希望于研究人员会做正确的事,转向创建一个让“做正确的事”成为最合逻辑且最有利的选择的结构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →