Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment
本文提出了一个统一的查询自动补全框架,将该任务重新表述为基于检索增强生成和多目标直接偏好优化的端到端列表生成,在解决传统检索流水线和生成幻觉局限性的同时,显著提升了离线指标、人类偏好以及在线用户参与度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在手机上输入搜索查询,比如“apps take me to the moo...”(应用带我去月...),你期望手机能帮你补全句子,比如“moon”(月球)或“moon apps”(月球相关应用)。但有时,旧系统会卡住,而有时,新的“智能”系统又会过于天马行空,建议一些并不存在的东西(比如一个真的能带你飞向月球的应用)。
这篇论文描述了一种构建这类“自动完成”(autocomplete)功能的更聪明的新方法。来自苹果公司和加州大学伯克利分校的作者们创建了一个系统,它就像一个既是超级组织有序的图书管理员,又是创意作家的结合体,共同协作为你提供完美的建议列表。
以下是该系统的运作方式,通过简单的概念进行拆解:
1. 问题所在:旧方式 vs. “过于聪明”的方式
- 旧方式(文件柜): 传统的系统查看的是人们过去搜索过的庞大列表。如果你输入了新颖或奇怪的内容,文件柜就是空的,它们无法提供帮助。如果它们找到了内容,也只是挑选最热门的一个,但这可能并不是你真正想要的。
- “过于聪明”的方式(白日梦者): 新型的 AI 系统使用强大的 AI 从头开始“编写”建议。虽然这在涵盖新话题方面表现出色,但 AI 有时会产生“幻觉”——它会凭空捏造虚假的应用或危险的想法,因为它试图表现得过于有创意。
2. 解决方案:“研究员 + 作家”团队
作者构建了一个统一的系统,通过三个主要技巧将两者的优点结合在一起:
A. 研究员(检索增强生成 - RAG)
在 AI 写下第一个字之前,它先扮演研究员的角色。它会快速检查一个真实的应用程序和产品数据库(“目录”),看看实际存在什么。
- 类比: 想象你请一位作家推荐一本书。与其仅仅靠猜测书名,不如让这位作家先跑到图书馆的书架旁,找出几本符合你心境的真实书籍,并把它们放在桌上。随后,作家利用这些真实的图书来激发灵感并给出建议。这防止了 AI 编造虚假内容。
B. 编辑(多目标对齐)
AI 不仅仅是写出一个列表;它还必须遵循一套严格的规则以确保有用。作者教会了 AI 同时平衡六个不同的目标,就像厨师平衡盐、糖和香料一样:
- 相关性: 它是否符合你输入的内容?
- 安全性: 它是否安全且礼貌?(例如,如果你输入“我感到抑郁”,它会建议求助热线,而不是有害的内容)。
- 可靠性(落地性): 建议的内容是否真的存在于应用商店中?
- 参与度: 用户真的会点击它们吗?
- 多样性: 列表是否提供了不同类型的答案,还是仅仅重复了五次同样的东西?
- 格式: 列表是否整洁且易于阅读?
为了教会 AI 这些规则,他们使用了名为 DPO(直接偏好优化) 的技术。
- 类比: 把这想象成一次“味觉测试”。AI 生成两个建议列表。一组评审团(包括计算机程序和人类)对它们进行品尝并选出更好的一个。AI 从而学习到:“哦,评审团更喜欢那个包含安全、真实应用的列表,而不是那个包含虚假应用的列表,”并调整其大脑以在以后更多地这样做。
C. 评论家(迭代式批判-修正)
在 AI 进入现实世界之前,他们使用了一个“教师”AI 和一个“评论家”AI 来训练它。
- 类比: 教师 AI 写出一份建议草案。评论家 AI 阅读它并说:“这个和那个太相似了,”或者“这个拼写错了。”教师 AI 随后重写它。他们不断重复这个循环,直到建议变得完美。这创造了一个巨大的“完美练习案例库”,用来教导最终的系统。
3. 交付方式:“快车道”与“特快车道”
由于系统非常聪明,思考需要一点时间。但用户需要即时获得答案。为了解决这个问题,作者构建了一个混合服务架构:
- 快车道(离线): 对于最常见的搜索(如“天气”或“地图”),系统会预先计算答案并存储在缓存中。当你输入这些内容时,答案会瞬间弹出,就像从冰箱里拿出一个预制好的三明治一样。
- 特快车道(在线): 对于罕见或新的搜索,一个更小、更快的 AI 版本会实时运行,即时生成答案。
4. 结果:效果如何?
团队在一个大规模的真实世界搜索系统(类似于 iPhone 上的搜索)上进行了测试。
- 减少按键次数: 由于建议更精准且出现得更早,用户输入的字符数减少了 5.44%。
- 增加点击量: 用户接受建议的频率提升了 3.46%。
- 人类认可度: 当人们被要求在旧系统和新系统之间做出选择时,他们明显更倾向于新系统。
- 安全性: 与其他 AI 方法相比,新系统在避免虚假应用和不安全建议方面表现得更好。
总结
简而言之,这篇论文展示了一种构建搜索自动完成功能的新方法。它不再仅仅是靠猜测或查阅旧列表,而是构建了一个先研究真实事实,然后再编写建议的系统,同时严格遵循六项规则的评分表(安全性、相关性等)。其结果是一个比我们现有的系统更快、更安全、更有帮助的搜索助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。