← 最新论文
🤖 machine learning

Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

本文提出了一种基于期望最大化(EM)的算法,该算法通过利用 Polya-Gamma 隐变量将玻尔兹曼理性模型(Boltzmann-rational model)转化为一个易于处理的矩阵感知问题,从而从带有噪声的两两比较中联合学习项目奖励和工人可靠性,并证明了其在众包场景下针对欺诈者和对抗性工人的卓越鲁棒性。

原作者: Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal, Avishek Ghosh

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal, Avishek Ghosh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图找出镇上最好的披萨。你请了一百位朋友投票选出哪种切片更好吃:是意大利香肠味还是芝士味。你的大多数朋友都给出了诚实且深思熟虑的答案。但也有少数人在瞎猜,因为他们饿了,根本没看披萨。有一位朋友是个恶作剧者,总是为了抬杠而故意选错;还有一位朋友因为太累了,无论配料是什么,都只是机械地点击左边的按钮。如果你只是简单地统计票数,你的“最佳披萨”名单就会被这些不可靠的声音搞得一团糟。这正是**众包(crowdsourcing)**的核心问题:让一群人做决策,但要应对并非每个人都在认真观察、甚至有人在刻意误导你的情况。

在计算机科学领域,这被称为“从成对比较中学习(learning from pairwise comparisons)”。这就是推荐系统决定下一步向你展示哪部电影,或者人工智能模型通过人类反馈来学习如何写出更好文章的方式。目标是根据“谁胜过谁”的关系,找到每个项目的隐藏“分数”或“奖励”。但要准确做到这一点,你必须解决一个棘手的谜题:在没有“金标准”答案进行校验的情况下,你如何知道哪些朋友在说实话,而哪些人在灌水?这篇论文深入探讨了这一混乱局面,试图将信号(真实的偏好)与噪声(垃圾信息)分离出来。

来自印度理工学院孟买分校(IIT Bombay)的研究团队提出了一种巧妙的新方法来解决这个谜题,称为 BoRaEM。该方法并不假设每个人都同样聪明,也不试图预先寻找一份单独的“优秀工人”名单,而是同时学习两件事:每个项目的真实得分以及每个工人的胜任程度。他们使用了一个名为“玻尔兹曼理性(Boltzmann-rational)”的模型,该模型想象每个工人都有一个“理性旋钮”。如果旋钮设定为 1,则该工人是完美的专家;如果设定为 0,则是一个随机点击按钮的灌水者;如果设定为 -1,则是一个试图破坏结果的对手。

这篇论文中的数学魔术在于使用了一种被称为“Polya-Gamma 变量”的技术。你可以把它想象成在食谱中加入了一种秘密配料,能将一个杂乱、无法烹饪的方程变成一个平滑、易于求解的方程。这使得他们能够使用一种称为“期望最大化(EM)”的算法,通过迭代地猜测得分和工人技能,然后不断优化这些猜测,直到它们稳定在最可能的答案上。他们在数学上证明了这个过程是稳定的,并且即使在数据有噪声的情况下也能收敛到一个良好的解。

当他们在模拟数据和真实世界数据集(例如通过比较面孔来判断谁看起来更年长,或评判阅读文章的难度)上进行测试时,他们的方法脱颖而出。在注入了高达 44% 的灌水者(涵盖从随机点击者到恶意撒谎者)的模拟实验中,BoRaEM 依然保持冷静。当旧方法崩溃失败时,BoRaEM 依然表现稳健,能够正确识别出真实的排名。论文表明,通过共同学习谁是可靠的以及各项指标的价值,我们可以构建出更加值得信赖的排序系统,即便是在一个充满噪声和不良行为者的世界里。它并不是能瞬间解决一切的魔杖,但它提供了一种强大的、具有理论依据的方法,让我们能在充满谎言的人群中寻找到真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →