← 最新论文
🤖 machine learning

Human Preference aligned Tabular Similarity

本文认为,目前针对预测任务优化的表格嵌入方法无法与人类对相似性搜索的偏好保持一致,并提出了一种新的评估程序,通过一个产品生命周期管理(PLM)用例来解决这一差距。

原作者: Frederik Hoppe, Astrid Franz, Marianne Michaelis, Lars Kleinemeier, Udo Göbel

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Frederik Hoppe, Astrid Franz, Marianne Michaelis, Lars Kleinemeier, Udo Göbel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座宏大的魔法图书馆里,这里的每一本书其实都是由数字和文字组成的电子表格。在这座图书馆里,有一些机器人的职责是寻找与你手中那本书“相似”的书。如果你拿起一本关于“修理坏掉的面包机”的书,机器人应该递给你其他关于面包机维修的书,而不是关于烤蛋糕或开车之书。这就是**表格数据(tabular data)的世界——那些支撑着我们的商业、医院和工厂的组织有序的信息网格。这些机器人使用一种叫做嵌入(embeddings)**的技术,这就像是看不见的磁性代码,将每一行数据转化为巨大、多维空间中的一个点。两个点越接近,机器人就认为它们的数据越相似。

长期以来,科学家们一直在教导这些机器人如何更好地预测一个特定的问题,比如“这个零件会坏吗?”或者“价格是多少?”但问题在于:擅长猜对一个答案并不一定意味着擅长找到人类觉得“感觉相似”的东西。机器人可能会认为两个零件是双胞胎,因为它们都包含数字“5”,尽管一名工程师知道一个是螺钉,而另一个是螺栓。这篇论文提出了一个非常重要的问题:我们如何确保这些机器人找到的东西,能真正符合不同使用者(如工程师、工厂工人或购物者)的理解?


问题所在:当机器人搞错了“感觉”

本文作者在与一家构建产品生命周期管理软件的公司合作时,发现了一个巨大的鸿沟。他们注意到,虽然机器人在将表格数据转化为那些看不见的磁性代码方面变得越来越聪明,但我们还没有一种好的方法来检查这些代码是否符合人类真正关心的内容。

想象一下,你要求机器人寻找与某个新汽车零件“相似”的变更请求。一位工程师可能会说:“这些很相似,因为它们都涉及发动机冷却系统。”一位工厂工人可能会说:“不对,这些相似是因为它们都需要同样的焊接机。”一位采购员可能会说:“这些相似是因为它们来自同一个供应商。”

论文指出,目前测试这些机器人的方式就像是只根据学生的数学考试成绩来评分,却忽略了该学生其实是在尝试成为一名诗人。标准测试衡量的是机器人能否正确预测一个数字或类别,但它们并不问:“用户是否觉得结果有用?”作者认为,如果不询问人类的想法,我们就是在盲目飞行。我们可能会拥有一个数学上近乎完美,但在理解人类需求方面却糟糕透顶的机器人。

解决方案:“数据味觉测试”

为了解决这个问题,作者提出了一种新的工作流程,听起来有点像针对食物进行的盲测,但对象是数据。他们建议不要只是运行机器人并寄希望于好结果,而是采用一个包含三个步骤的流程来获取人类反馈:

  1. 设置: 首先,机器人为所有数据创建其磁性代码并进行存储。
  2. 挑选: 向人类用户展示一个特定的项目(即“锚点”),例如一个特定的零件或工单。然后,机器人调出它认为最接近匹配项的列表。
  3. 投票: 人类将原始项目与机器人给出的其中一个建议并排对比。然后,他们给出一个评分:“完全相同”、“相似”、“略微相似”或“不相似”。

这不仅仅是一次性的行为。作者建议反复进行这种操作,收集数以千计的此类“选票”。这创建了一张地图,描绘了不同群体实际上认为什么是相似的。

他们的发现:每个人看世界的视角都不同

为了测试他们的想法,团队进行了一项小型试点研究。他们提取了一份包含 20 个不同“工单”(如求助请求或变更请求)的列表,并要求三个人对机器人找到的每个项目的排名前 6 位匹配项进行评分。

结果令人震惊。在他们查看的 120 对项目中,三个人仅在 63 对 上达成了评分一致(即 52.5%)。在 52 对 中(43.3%),两人意见一致而第三人不同;而在 5 对 中(4.2%),三个人给出了完全不同的评分!

这证明了“相似性”并不是一个单一的、固定的事实。它完全取决于你是谁。工程师可能会看到一个采购员忽略的模式,反之亦然。

随后,团队测试了 10 种不同的机器人算法,以观察哪一个最擅长猜测人类的需求。这里有一个转折:没有出现唯一的“赢家”。

  • 对于标注者 1 和标注者 3,算法 7 表现最好。
  • 但对于标注者 2,算法 4 表现最好。

更有趣的是,对于标注者 2 来说,“最好”与“次好”之间的差距微乎其微——在 165 个三元组(一组三个项目)中仅差了 一个。这表明,在如此少量的选票下,很难百分之百确定哪个机器人真正更好。作者指出,我们需要更多的数据才能得出确定的结论,但核心观点很明确:并非一种方案适用于所有人。 一个对工程师完美的机器人,对采购员来说可能毫无用处。

为什么这很重要:关乎信任

论文总结道,为了让人工智能真正值得信赖,我们不能仅仅依赖机器人的内部数学逻辑。我们需要建立一个系统,让人类能够不断检查机器人的工作。

他们强调了这种方法带来的四个关键益处:

  • 公平性: 它确保机器人能公平对待不同的群体(如工程师与采购员),而不是偏袒某种特定的视角。
  • 透明度: 它让人们能够看到机器人为什么选择了某个项目,从而让“黑箱”不再那么黑暗。
  • 鲁棒性(稳健性): 它有助于发现混乱的数据,例如重复项或容易引起混淆的类别,这些是机器人可能会出错的地方。
  • 问责制: 它创造了一个人类决策的记录追踪,这在受监管的行业中至关重要,如果 AI 犯了错误,这可以作为依据。

作者承认,要求人类进行这些工作是辛苦且耗时的。他们并不声称已经完美解决了这个问题。相反,他们呼吁科学界开始将这些“人类味觉测试”作为构建人工智能的标准组成部分。他们认为,信任不是一次性植入代码中的东西;而是通过不断倾听系统的使用者来建立起来的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →