← 最新论文
🤖 machine learning

A Unified Structured Query Understanding Framework for Industrial Semantic Search

本文提出了一种统一的工业级语义搜索小语言模型框架,将碎片化的查询理解任务整合为单一的模式约束生成系统,并辅以“查询阐明器”进行数据标注与评估,该系统在满足严格延迟约束的同时,成功提升了领英职位与人员搜索系统的用户参与度并降低了成本。

原作者: Ping Liu, Qianqi Shen, Jianqiang Shen, Chunnan Yao, Kevin Kao, Rajat Arora, Dan Xu, Baofen Zheng, Yunxiang Ren, Benjamin Le, Ali Hooshmand, Igor Lapchuk, Juan Bottaro, Raghavan Muthuregunathan, Caleb
发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ping Liu, Qianqi Shen, Jianqiang Shen, Chunnan Yao, Kevin Kao, Rajat Arora, Dan Xu, Baofen Zheng, Yunxiang Ren, Benjamin Le, Ali Hooshmand, Igor Lapchuk, Juan Bottaro, Raghavan Muthuregunathan, Caleb Johnson, Liangjie Hong, Jingwei Wu, Wenjing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在运营一座庞大而繁忙的图书馆(LinkedIn 的职位搜索系统),每天都有数百万人走进去寻找书籍(工作)。

在旧有的运作方式中,图书馆由一支分散的专家团队排成一列来提供服务。

  1. 第一个人试图猜测你的需求(意图识别)。
  2. 第二个人试图查找具体的作者或类型(标签化)。
  3. 第三个人试图将你杂乱无章的句子改写为清晰的请求(重写)。
  4. 第四个人检查你是否在询问某些危险内容(安全审查)。

问题所在: 这条流水线速度慢、维护成本高,且容易出错。如果第一个人误解了你的意思,第二个人就会感到困惑,第三个人则会错误地改写请求。这就像一场“传话游戏”,信息传到终点时早已面目全非。此外,如果有人提出奇怪、冗长或复杂的问题(例如“我需要一份远程数据录入工作,薪资超过 5 万美元,但仅限美国”),整个团队往往会陷入瘫痪。

新解决方案:“超级图书管理员”

这篇论文的作者构建了一个统一的结构化查询理解框架。他们不再雇佣一团队专家,而是聘请了一位经过高度训练的“超级图书管理员”(一个小语言模型,SLM),由他一次性完成所有工作。

以下是其运作方式,使用简单的类比说明:

1. 单次决策(“一站式”菜单)

你不再将请求沿流水线传递,而是直接交给超级图书管理员。这位图书管理员只需一眼就能:

  • 判断你在寻找什么(路由)。
  • 提取具体标签(例如“远程”、“高级”、“数据科学家”)。
  • 如有需要,将杂乱的句子改写为清晰、专业的请求。
  • 检查你是否在询问违反规则的内容(信任/安全)。

魔法技巧: 这位图书管理员并非凭空猜测;他们会填写一份严格格式的清单(受模式约束的生成)。他们不能写小说;必须在表格的特定框中填写内容。这确保了下游计算机系统能完美理解请求,而不会被杂乱无章的文本搞糊涂。

2. “查询照明器”(教师与法官)

训练一位图书管理员完成所有工作非常困难,因为你需要成千上万个“完美”答案的示例,而人类编写这些答案的速度太慢。

为了解决这个问题,团队创建了一个查询照明器。你可以将其想象为一位在幕后工作的大师级图书管理员(一个更大、更智能的 AI)。

  • 作为教师: 大师级图书管理员阅读成千上万个杂乱的用户请求,并写下“完美”的清单式答案。随后,它教导小型的超级图书管理员如何做到同样的事情(这被称为蒸馏)。
  • 作为法官: 当超级图书管理员犯错时,大师级图书管理员充当代理法官。它根据规则(例如“你是否编造了一个不存在的工作?”)对超级图书管理员的工作进行评分,而无需每次都让人类进行检查。

3. 结果:更快、更智能、更安全

团队在 LinkedIn 实际的职位搜索引擎中测试了这一新系统。

  • 更少的失败请求: 由于超级图书管理员一次性处理整个流程,更少请求被丢弃或误解。论文报告显示,失败请求减少了 17%
  • 更满意的用户: 更多人找到了他们喜欢的工作并进行了申请。
  • 速度: 尽管图书管理员承担了更多工作,但系统速度足以每秒处理数百万个请求,而不会让用户等待。
  • 多功能性: 他们证明这也适用于其他场景,例如搜索人物(而不仅仅是工作),表明“超级图书管理员”只需极少的努力即可重新训练,以适应不同类型的图书馆。

总结

该论文描述了用一个聪明、高效的机器人取代了由小型工具组成的缓慢且易出错的流水线。这个机器人能理解复杂的人类语言,遵循严格规则,并从“大师级教师”AI 中学习。这使得所有求职者的搜索体验更加顺畅、快速和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →