An Isotonic Mechanism for Overlapping Ownership
本文提出了一种诚实的、高效的机制,通过将所有者-项目关系划分为不相交的块,并应用保序回归根据所有者报告的排名来校准噪声评审,从而在重叠所有权设置下提高同行评审评分,该机制得到了理论保证以及在真实会议数据上的实证验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在科学研究的高风险世界中,同行评审过程充当着新知识的守门人。当研究人员向主要会议提交论文时,论文会被发送给其他专家进行阅读并评分。这些分数决定了作品是被发表、在舞台上展示,还是被拒绝。几十年来,这一系统完全依赖于这些外部评审员的意见。然而,随着投稿数量的爆炸式增长,该系统已开始出现崩溃迹象。合格评审员的增长速度未能跟上步伐,导致出现这样一种情况:同一篇论文可能被一组专家接受,却被另一组专家拒绝,仅仅是因为随机分配到的读者不同。这种不一致性威胁着整个领域的完整性,从而产生了一种需求:寻找一种方法,在不完全依赖于过度劳累且往往缺乏经验的评审员池的情况下,来稳定这些分数。
挑战在于,最了解论文的人——作者本身——通常是组织者最不信任其进行评估的对象。要求作者为自己的工作评分似乎会招致不诚实;研究人员可能会自然而然地夸大自己的分数以确保被接收。然而,作者拥有评审员所缺乏的一种独特信息:他们知道自己作品的相对质量。作者可能不知道一篇论文究竟应该得多少分,但他们几乎肯定知道自己的哪篇论文比其他论文更好。研究人员提出的问题是,这种相对知识是否可以用来修正陌生人给出的带有噪声的分数,同时又不给作者提供撒谎的动机。
一个研究团队开发了一种名为“保序机制”(Isotonic Mechanism)的新方法来解决这个难题。该系统不是要求作者提供具体的数值(这容易出错且易受操纵),而是要求他们简单地将自己的论文按从优到劣进行排序。该机制随后将这些排名与评审员给出的带有噪声的分数相结合,生成一套更准确的新分数。其设计的精妙之处在于如何处理复杂的论文所有权关系。在现代科学中,论文通常有多个作者,且这些作者经常在不同的论文集上进行合作。这创造了一个错综复杂的网络,其中一位作者对论文的排名可能会与另一位作者发生冲突。
为了应对这一问题,研究人员首先将整个论文集分解为若干个独立的、互不重叠的组。在每个组内,他们识别出撰写了该特定集合中每一篇论文的作者。只有这些作者才会被要求对该组内的论文进行排名。通过隔离这些特定的组,系统确保了提供排名的作者对他们所评判的项目拥有完整的视野,并且没有任何一位作者可以操纵其并未完全拥有的论文的分数。系统随后使用一种数学平滑过程来调整原始的评审员分数,使其尊重作者提供的顺序。如果一位作者说论文 A 比论文 B 好,那么最终的分数将反映这种顺序,但也会尽可能保持接近原始的评审员分数,以避免过度修正。
研究人员证明,在该系统下,诚实是每位作者的最佳策略。如果其他人都保持诚实,任何一位作者都无法通过撒谎来获得优势。事实上,该系统创造了一种让每个人都通过诚实获得最大回报的情境。即使在论文所有权复杂且重叠的情况下,只要系统设定为仅在这些精心定义的组内进行排名请求,这一结论依然成立。团队还表明,试图通过允许作者跨组对论文进行排名来表现得过于聪明是行不通的;要保证诚实,唯一的办法就是坚持这些孤立的组。
为了找到划分这些组的最佳方式,研究人员设计了一种快速且高效的算法。他们发现,寻找完美的划分是一个计算机无法在合理时间内精确求解的难题。然而,他们的贪心算法——即在每一步中仅选择单个作者拥有的最大的可用论文组——能够非常接近最佳结果。该算法运行速度极快,足以在拥有数千篇论文的实际场景中使用。
该团队利用真实的机器学习会议数据(具体针对 ICLR 和 ICML 的论文)测试了他们的方法。他们通过在现有分数中加入随机噪声来模拟评审过程,以模仿真实同行评审中的不一致性。当应用该机制时,调整后的分数比原始的评审员分数显著更加准确。在测试中,新方法将分数的误差降低了 21% 到 33%。它还成功找回了许多被原始噪声分数误判而遗漏的高质量论文。在另一个使用作者已提交排名数据的实际测试中,该方法同样提高了分数的准确性,优于基准水平。
研究人员还探讨了该系统涉及的权衡。他们发现,在同一个组中要求更多的作者进行排名,可以增强系统对抗作者自身感知误差的鲁棒性。然而,要求更多作者往往会导致组的规模变小,从而减少系统能收集到的有用信息量。这种最优平衡取决于作者的预期准确度。如果作者对自己的排名非常有信心,较大的组效果最好;如果他们的感知存在噪声,则较小的组配合更多的作者会产生更好的结果。
这项工作证明,通过利用作者的自我认知来提高科学评估的水平,而不损害过程的完整性是可能的。通过要求简单的排名而非具体评分,并仔细构建评价对象及其结构,该系统将潜在的利益冲突转化为了提升准确性的工具。研究结果表明,会议组织者可以采用这种方法来稳定其评审过程,确保即使在评审员资源紧张的情况下,优秀的论文也能得到认可。该机制并非取代评审员,而是作为一种稳定器,利用作者自身的洞察力来修正系统中不可避免的噪声。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。