A Unified Structured Query Understanding Framework for Industrial Semantic Search
本文提出了一种统一的工业级语义搜索小语言模型框架,将碎片化的查询理解任务整合为单一的模式约束生成系统,并辅以“查询阐明器”进行数据标注与评估,该系统在满足严格延迟约束的同时,成功提升了领英职位与人员搜索系统的用户参与度并降低了成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在运营一座庞大而繁忙的图书馆(LinkedIn 的职位搜索系统),每天都有数百万人走进去寻找书籍(工作)。
在旧有的运作方式中,图书馆由一支分散的专家团队排成一列来提供服务。
- 第一个人试图猜测你的需求(意图识别)。
- 第二个人试图查找具体的作者或类型(标签化)。
- 第三个人试图将你杂乱无章的句子改写为清晰的请求(重写)。
- 第四个人检查你是否在询问某些危险内容(安全审查)。
问题所在: 这条流水线速度慢、维护成本高,且容易出错。如果第一个人误解了你的意思,第二个人就会感到困惑,第三个人则会错误地改写请求。这就像一场“传话游戏”,信息传到终点时早已面目全非。此外,如果有人提出奇怪、冗长或复杂的问题(例如“我需要一份远程数据录入工作,薪资超过 5 万美元,但仅限美国”),整个团队往往会陷入瘫痪。
新解决方案:“超级图书管理员”
这篇论文的作者构建了一个统一的结构化查询理解框架。他们不再雇佣一团队专家,而是聘请了一位经过高度训练的“超级图书管理员”(一个小语言模型,SLM),由他一次性完成所有工作。
以下是其运作方式,使用简单的类比说明:
1. 单次决策(“一站式”菜单)
你不再将请求沿流水线传递,而是直接交给超级图书管理员。这位图书管理员只需一眼就能:
- 判断你在寻找什么(路由)。
- 提取具体标签(例如“远程”、“高级”、“数据科学家”)。
- 如有需要,将杂乱的句子改写为清晰、专业的请求。
- 检查你是否在询问违反规则的内容(信任/安全)。
魔法技巧: 这位图书管理员并非凭空猜测;他们会填写一份严格格式的清单(受模式约束的生成)。他们不能写小说;必须在表格的特定框中填写内容。这确保了下游计算机系统能完美理解请求,而不会被杂乱无章的文本搞糊涂。
2. “查询照明器”(教师与法官)
训练一位图书管理员完成所有工作非常困难,因为你需要成千上万个“完美”答案的示例,而人类编写这些答案的速度太慢。
为了解决这个问题,团队创建了一个查询照明器。你可以将其想象为一位在幕后工作的大师级图书管理员(一个更大、更智能的 AI)。
- 作为教师: 大师级图书管理员阅读成千上万个杂乱的用户请求,并写下“完美”的清单式答案。随后,它教导小型的超级图书管理员如何做到同样的事情(这被称为蒸馏)。
- 作为法官: 当超级图书管理员犯错时,大师级图书管理员充当代理法官。它根据规则(例如“你是否编造了一个不存在的工作?”)对超级图书管理员的工作进行评分,而无需每次都让人类进行检查。
3. 结果:更快、更智能、更安全
团队在 LinkedIn 实际的职位搜索引擎中测试了这一新系统。
- 更少的失败请求: 由于超级图书管理员一次性处理整个流程,更少请求被丢弃或误解。论文报告显示,失败请求减少了 17%。
- 更满意的用户: 更多人找到了他们喜欢的工作并进行了申请。
- 速度: 尽管图书管理员承担了更多工作,但系统速度足以每秒处理数百万个请求,而不会让用户等待。
- 多功能性: 他们证明这也适用于其他场景,例如搜索人物(而不仅仅是工作),表明“超级图书管理员”只需极少的努力即可重新训练,以适应不同类型的图书馆。
总结
该论文描述了用一个聪明、高效的机器人取代了由小型工具组成的缓慢且易出错的流水线。这个机器人能理解复杂的人类语言,遵循严格规则,并从“大师级教师”AI 中学习。这使得所有求职者的搜索体验更加顺畅、快速和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。