在现代互联网那广阔而混乱的市场中,数以百万计的独立卖家以不同的名称、不同的照片,有时还带着缺失或令人困惑的细节,列出相同的商品。一个单一的产品,比如某个特定品牌的咖啡机,可能会出现在成千上万次的目录中,每一条目都与前一条略有不同。对于驱动搜索引擎和推荐系统的计算机而言,这制造了一层混乱的迷雾。如果系统无法识别出两个不同的列表实际上是同一个物品,它就无法合并它们的评论、追踪它们的销量,或将它们展示给正确的客户。 “产品链接”(product linking)的目标就是拨开这层迷雾,扮演一名数字图书管理员的角色,通过梳理噪音来为货架上的每一件物品找到唯一的、正确的身份。这不仅仅是一个组织有序的问题,它是在线商店理解自己正在销售什么的基石。
DoorDash 的一个研究团队构建了一个全新的系统来解决这个问题,其规模之大,能够处理数十亿条记录而不会造成巨大的成本负担。他们意识到,对每一件商品都一视同敬地对待是一种资源的浪费。有些商品很容易识别,因为它们的名称和代码完全匹配;而另一些则像是失散多年的双胞胎,需要深入调查才能分辨彼此。他们没有使用一个强大且昂贵的“计算机大脑”去检查每一个商品,而是创建了一个三步走的流程,仅在真正需要时才投入更多精力。首先,系统会快速缩小范围,筛选出一份可能的匹配列表。接着,一个快速且轻量级的计算机程序会对这些配对进行检查。如果匹配显而易见,系统会立即接受;如果匹配显然错误,系统则会拒绝。但如果程序无法确定,它会将这个困难的案例升级交给一个更高级的人工智能代理。
这个高级代理是这项新发现的核心。与只能读取文本的快速程序不同,这个代理可以查看产品照片,并且至关重要的是,它可以搜索开放的网络以寻找额外的线索。当系统遇到两个列表名称相似但细节模糊的困惑配对时,该代理就像一名侦探。它可能会观察一个锅的照片,以判断它是铸铁制的还是不锈钢制的;或者它可能会利用条形码号码在网上进行搜索,以找到制造商的官方描述。这种从原始记录之外收集证据的能力,使得该系统能够解决那些会让简单的文本匹配工具感到困惑的案例。研究人员发现,通过使用这种“升级”策略,他们可以自动链接近 77% 的所有产品,这比仅使用廉价、快速工具所能实现的 68% 有了显著提升。
该团队还发现了一个关于如何训练这些系统的惊人事实。他们没有雇佣数千名人类来标注数百万个示例,而是使用了两个不同的高级人工智能模型来对相同的项目进行评分。他们只保留了两个模型达成一致的答案,从而创建了一套高度可靠的训练数据。这种方法使他们能够教会那个快速、轻量级的程序以与昂贵、缓慢的模型相同的信心做出决策,但成本却仅为后者的一小部分。他们还发现,直接将条形码的原始数字输入系统,效果比提供预设的“匹配”或“不匹配”标记更好,因为计算机可以学会自行识别部分匹配和错误。然而,他们必须保持谨慎,因为过度依赖条形码可能会在两个不同产品意外共享相同代码时导致错误。他们通过教导系统在条形码匹配时务必复核产品名称来解决这个问题,从而确保不会被罕见的错误所误导。
通过将快速过滤器与智能的联网代理相结合,研究人员创造了一个既准确又经济的系统。他们用一个自托管的版本取代了昂贵的闭源人工智能,运行成本仅为原来的约七分之一,同时仍保持了极高的准确性。这种方法意味着在线市场可以更彻底地清理其目录,确保客户看到的是每个产品的单一、清晰的条目,而不是散乱重复的杂乱堆砌。其结果是,这是一种更聪明、更高效的组织世界商品的方式,证明了有时解决大规模问题的最佳方法并非对每颗钉子都使用最大的锤子,而是知道何时该请出专家。
技术摘要:检索、匹配与升级
问题定义
本文研究了大规模按需市场(DoorDash)规模下的商品链接(实体解析)问题。该任务涉及将数十亿条嘈杂、多语言且多类别的商家商品记录(SKU)映射到包含数千万件产品的标准目录中。
核心挑战在于成本与能力的权衡。
- 规模: 对每一对候选对使用单一的高容量模型进行解析在计算上是极其昂贵的。
- 难度差异: 许多配对非常简单(例如,精确的条形码匹配),而另一些则因数据缺失、属性冲突或需要区分细微差异(如尺寸、口味)而具有歧义。
- 数据质量: 商家记录通常包含缺失的图像、未规范化的条形码和自由文本属性,这使得简单的文本匹配不足以处理存在歧义的“长尾”情况。
- 标注瓶颈: 获取可靠的人类标签非常困难,因为商品身份是结合性的(在品牌、尺寸等方面保持一致),且标注过程需要对不完整的证据进行联合解析。
方法论
作者提出了一种基于置信度路由的三阶段级联架构,根据决策难度分配计算资源。
1. 第一阶段:检索
在匹配之前,系统将全球目录缩小到每个商家记录的一个较小的候选集(K=20)。
- 机制: 向量索引融合了三个通道:文本(名称/结构化字段)、图像(产品照片)和条形码(GTIN/UPC)。
- 技术: 使用近似最近邻(ANN)搜索进行文本和图像检索,并结合精确/部分条形码匹配。结果通过倒数排名融合(RRF)进行合并。
- 目标: 确保高召回率;如果正确的标准产品未被检索到,则后续无法进行匹配。
2. 第二阶段:轻量级交叉编码器匹配器
此阶段对候选对进行评分,并根据置信度进行路由。
- 架构: 一个仅限文本的 ModernBERT-base 交叉编码器(1.5 亿参数),带有 Sigmoid 输出头。它将来自两个记录的序列化字段(类别、名称、GTIN/UPC 列表、尺寸、单位)拼接成一个 256 个 token 的序列。
- 输入策略: 原始条形码数字直接输入序列,而不是预计算的等值标志,从而允许模型学习部分和噪声模式的匹配规律。
- 训练与蒸馏: 该模型通过双 VLM 共识生成的 530 万个配对进行训练。两个独立的 VLM 对每个配对进行评分;只有当两者达成一致时,该配对才会被用作训练标签。这用 130 倍于人类标签的、更具一致性的合成标签取代了 4 万个高质量人工标签。
- 路由策略: 模型输出一个校准后的分数 (s∈[0,1])。
- 高置信度 (s≥θhigh): 自动接受(精度 ≥98%)。
- 低置信度 (s≤θlow): 自动拒绝。
- 中等置信度: 升级至第三阶段。
3. 第三阶段:智能体化多模态 VLM
此阶段负责裁决第二阶段无法解决的模糊“中等”区间。
- 架构: 一个自托管的开源权重混合专家模型(MoE)VLM(Qwen 3.6 35B-A3B)。
- 能力: 该智能体是具备智能体属性的(Agentic)。它接收商品记录、图像,并通过 MCP 接口访问网络搜索工具。它遵循 ReAct 模式,决定何时搜索外部证据(例如,验证条形码或品牌是否与零售商网站一致)以解决记录中缺失的冲突信息。
- 优化:
- 提示工程: 特定的补充说明引导模型将“搜索结果为空”视为不确定(而非不存在的证明),并将身份证明限制在同一零售商的证据内。
- 循环控制: 智能体被限制在四轮工具调用内,以防止过度搜索和延迟膨胀。
- 成本降低: 系统从闭源前沿 VLM(GPT-5.4)迁移到开源权重模型,消除了按 token 计费的供应商成本,并实现了对搜索后端的控制。
核心贡献
- 使用工具的多模态推理: 将模糊的商品链接形式化为一项需要主动收集证据(网络搜索)和多模态推理的任务,通过带有特定提示词的预训练 VLM 实现。
- 可扩展的置信度路由级联: 展示了如何将轻量级的蒸馏交叉编码器与智能体化 VLM 相结合。交叉编码器高效地解决高信号的大多数情况,而智能体则处理困难的长尾部分,从而优化了成本-准确度权衡。
- 生产验证与蒸馏洞察:
- 在生产运行点(98% 精度)验证了该流水线。
- 表明开源权重智能体在实现精度对等的同时,其成本仅为闭源前沿模型的 ~1/7(同时伴随 4 个百分点的召回率权衡),且无需微调。
- 识别了交叉编码器的一个失效模式(条形码在损坏标识符上的过度索引),并通过使用正则化教师进行的第二次蒸馏过程而非手动修复解决了该问题。
结果
- 检索: 检索阶段在去重切片(独立地面真值)上达到了 93.06% 的召回率,在已链接配对上达到了 99.12%。
- 匹配器(第二阶段): 蒸馏后的交叉编码器在留出集上实现了 77.05% 的召回率,精度为 98% (R@P98)。在生产环境中,它在这一精度标准下自动接受了 43.7% 的链接。
- 智能体(第三阶段):
- 对比人类: 在困难的中等置信度任务上,该智能体的准确率比受训的操作员高出 +13.7%,召回率高出 +18.5%,精度高出 +4.7% (p<0.0001)。
- 对比闭源模型: 开源权重智能体在匹配闭源前沿模型精度的同时(98.0%),召回率略低(88% vs 92%),但单对成本降低了 ~7 倍。
- 端到端影响: 通过解决最模糊的记录,该级联架构将端到端链接覆盖率从 68.1%(仅使用廉价阶段)提升至 77.1%,实现了 9.0 个百分点的增益。
意义与主张
论文声称,标签才是瓶颈,而非架构。结果表明,通过扩大高一致性合成标签的规模(通过双 VLM 共识),所带来的性能提升比增加模型容量或调整超参数更为显著。
该系统建立了一个生产运行点,其中:
- 成本效率: 仅在必要时投入计算。每对配对的成本跨越了五个数量级,但级联机制确保了昂贵的智能体仅在处理“困难长尾”时才被调用。
- 鲁棒性: 通过结合原始 Token 学习(针对条形码)与智能体搜索(针对缺失上下文),该流水线能够处理嘈杂、异构的数据(缺失图像、未规范化的条形码)。
- 可移植性: “检索-匹配-路由-蒸馏”的设计是领域无关的。其成功依赖于能够在保持提示词和工具契约稳定的前提下,灵活更换模型(例如,从闭源转向开源权重),而无需重新训练整个流水线。
作者强调,该系统并非实现 100% 覆盖的“银弹”(受限于检索和目录的完整性),但它代表了在大规模市场中实现可扩展、准确且具成本效益的实体解析的重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。