Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review
本回应针对 ICML 2023 排名实验的反馈,围绕四个核心主题构建:将同行评审框架化为统计估计、缓解等渗机制中的公平性与策略性问题、整合审稿人排名等互补信号,以及为生成式人工智能时代提出以人为中心的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,顶尖计算机科学(特别是人工智能)研究的世界就像一场巨大而混乱的音乐节。每年,成千上万的乐队(研究人员)都想登上主舞台(发表论文)。但是,只有几百名评委(审稿人)来聆听他们,而且音乐节发展得如此迅速,以至于评委们被海量的申请淹没了。
本文的作者团队由统计学家和计算机科学家组成,他们主张,我们不应再将这场音乐节视为简单的流行度竞赛,而应将其视为一个统计谜题。以下是他们观点的分解,并辅以日常类比:
1. 问题:门票太多,评委太少
音乐节正在爆发式增长。2026 年,他们收到了超过 26,000 首歌曲需要评审。评委们疲惫不堪,无法完美地聆听每一首歌曲。有时评委心情不好,有时他们只是“不懂”某种特定流派,有时音乐本身太好或太差,导致他们无法公平评判。
作者们表示:“我们不能仅仅让大众来决定(就像在社交媒体上数‘点赞’数),因为大众不够专业。我们需要一种更好的方法来找出哪些歌曲实际上是最好的。”
2. 解决方案:“作者的播放列表”(等渗机制)
作者们提出了一种巧妙的技巧,称为等渗机制(Isotonic Mechanism)。
类比:想象你是一名烹饪比赛的评委。你需要给 100 道菜打分。你可能对辛辣食物有点苛刻,或者对甜点有点过于宽容。你的评分是“有噪声的”(有点混乱)。
现在,想象制作这道菜的厨师(作者)就站在你旁边。他们比任何人都更了解自己的食物。他们确切地知道自己的 10 道菜之间是如何相互比较的。
- 旧方法:厨师只是说:“我的菜是 10 分里的 9 分。”(这很容易撒谎;每个人都想要 10 分)。
- 新方法:厨师被要求排名他们自己的 10 道菜,从最好到最差。“菜 A 比菜 B 好,菜 B 比菜 C 好。”
为什么这有效:很难在不被察觉的情况下对自己作品的排名撒谎。如果你说你的“菜 C"是最好的,但你的“菜 A"实际上很糟糕,数学就能识破这个谎言。通过让作者对自己提交的论文进行排名,系统可以“清理”评委那些混乱的评分。这就像利用厨师自己的知识来修正评委糟糕的听力。
3. 解决“不公平”的担忧
有些人担心:“如果一个拥有 50 道菜的著名厨师比一个只有 2 道菜的新厨师获得巨大优势怎么办?排名系统对拥有更多待排名项目的人更有效。”
作者的修正:他们意识到,如果让一个人排名所有内容,这是不公平的。因此,他们建议采用“分组”策略。
- 类比:不要要求著名厨师将所有 50 道菜排成一条巨大的长队,而是要求他们将它们分成小的“品尝菜单”(例如,“汤品菜单”、“甜点菜单”)。让汤品之间相互排名,甜点之间相互排名。
- 结果:这拉平了竞争环境。数学表明,即使采用这种分组,系统仍然能使评分更加准确,但它阻止了著名厨师仅仅因为拥有更多参赛作品而主导结果。
4. “策略”问题:厨师会作弊吗?
作者们承认,如果排名实际上决定了谁能登上主舞台,厨师们可能会试图操纵系统。
- 风险:厨师可能会将一道糟糕的菜排名为“很棒”以使其被接受,或者将最好的菜排名较低,以便“留”到明年。
- 现实检验:作者们说:“我们无法阻止所有作弊,但我们可以设计规则使作弊变得更难。”他们建议从小处着手(仅使用排名来标记哪些论文需要二次审查,而不是立即接受或拒绝),以便我们在将其变成高风险游戏之前,先了解人们的行为模式。
5. 未来:人类 + 人工智能,而非人工智能 vs 人类
这篇论文最后提出了一个宏观视角。人工智能正在改变研究的撰写和评审方式。人工智能可以编写代码、检查数学,甚至起草审稿意见。
作者的立场:
- 不要取代人类。人工智能是一种工具,就像超级计算器。它可以组织数据并发现模式,但它不应成为最终法官。
- “人在回路中”:将人工智能想象成负责布置灯光和整理乐器的舞台工作人员。人类评委才是决定音乐是否真正好听的人。
- 为什么?因为科学不仅仅是关于数据;它还关乎创造力、伦理和“品味”。人工智能可能会错过论文微妙的灵魂,或者产生幻觉(编造内容)。人类需要保持对最终决定的掌控。
总结
该论文认为,为了修复不堪重负的人工智能研究评审系统,我们应该将其视为一个数学问题。通过让作者诚实地对自己作品进行排名,我们可以“去噪”评委的评分,更准确地找出最好的论文。然而,我们必须小心,不要让系统被操纵,同时必须确保,虽然人工智能帮助我们组织混乱,但人类仍然是握有法槌的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。