← 最新论文
💬 NLP

OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework

本文提出了 OneSearch-V2,一种通过思维增强查询理解、推理内化自蒸馏训练及行为偏好对齐优化三大创新,显著提升复杂查询理解与用户意图挖掘能力,并在不增加推理成本的情况下有效改善搜索体验与商业指标的生成式搜索框架。

原作者: Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipeng Qian, Xinyu Sun, Zhixin Zhai, Yang Zhao, Bochao Liu, Jingshan Lv, Xiao Liang
发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipeng Qian, Xinyu Sun, Zhixin Zhai, Yang Zhao, Bochao Liu, Jingshan Lv, Xiao Liang, Hui Kong, Jing Chen, Han Li, Chenyi Lei, Wenwu Ou, Kun Gai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OneSearch-V2 的“超级搜索助手”,它是快手电商搜索系统的升级版。

为了让你更容易理解,我们可以把电商搜索想象成去一家巨大的、没有导购的超级超市买东西。

🛒 核心故事:从“死记硬背”到“聪明导购”

1. 旧版本(OneSearch V1):像一本“死板的字典”

  • 怎么工作: 当你输入“红色 T 恤”时,它就像一本字典,只会在数据库里找包含“红色”和"T 恤”这两个词的商品。
  • 痛点:
    • 不懂潜台词: 如果你搜“送女朋友的礼物”,它可能只给你推“礼物盒”,却不懂你可能想要“口红”或“项链”。
    • 死板: 它只记得过去大家怎么搜、怎么买。如果有个新商品刚上架,或者你的喜好变了,它就反应不过来。
    • 信息茧房: 它总是给你推你以前买过的东西,让你觉得“怎么全是这些”,看不到新东西(长尾商品)。

2. 新版本(OneSearch V2):像一位“经验丰富的金牌导购”
OneSearch-V2 引入了三个“超能力”,让它从字典变成了真人导购:

🧠 超能力一:深度思考(Thought-Augmented Query Understanding)

  • 比喻: 以前你问导购“我要个能跑步的”,导购可能只给你推“跑鞋”。现在,这位金牌导购会先在脑子里过一遍
    • “用户说跑步,是在室内还是室外?是新手还是老手?是不是需要护膝?”
    • 它会把你的简单搜索词(比如“送女友”),在脑子里拆解成具体的关键词(“口红”、“香水”、“项链”、“包包”)。
  • 效果: 即使你搜得很模糊,它也能猜到你真正想要什么,不再只盯着字面意思。

🧠 超能力二:把思考“内化”成直觉(Reasoning-Internalized Self-distillation)

  • 痛点: 如果让 AI 每次搜索前都像人一样把思考过程(写小作文)全打出来,速度太慢了,用户等不起。
  • 解决方案: 论文发明了一种“自我蒸馏”技术。
    • 比喻: 想象这位金牌导购先经过“特训”,在脑子里把“如何思考”的过程反复演练了成千上万次。最后,它把思考过程吃进了肚子里,变成了肌肉记忆直觉
    • 结果: 当你问它问题时,它不需要再“想”一遍,而是瞬间凭直觉给出最精准的答案。既保留了思考的深度,又保持了闪电般的速度,而且不需要额外的硬件成本。

🎯 超能力三:直接听用户反馈(Behavior Feedback Preference Alignment)

  • 旧模式: 以前,系统靠一个“中间人”(奖励模型)来告诉 AI 什么好。这个中间人只看历史数据,容易有偏见,或者为了刷分而“作弊”(比如只推那些容易点击但质量差的东西)。
  • 新模式: OneSearch-V2 直接听用户的真实行为
    • 比喻: 不再听“中间人”转述,而是直接看用户有没有点击、有没有加购物车、有没有付款
    • 创新点: 它把搜索过程看作一个层层递进的过程(先选大类,再选具体属性)。如果第一步(大类)选错了,后面再对也没用。它学会了“前功尽弃”的逻辑,只奖励那些每一步都走对的路径,从而更精准地匹配用户需求。

📊 实际效果:真的变强了吗?

在快手的真实电商环境中,这个“金牌导购”上线后,效果非常惊人:

  1. 卖得更多了: 商品点击率提升了 3.98%,下单转化率提升了 3.05%,订单量增加了 2.11%
  2. 体验更好了: 用户觉得搜索结果更相关了,页面满意度提升了 1.65%
  3. 更公平了: 它不再只盯着热门商品,那些刚上架的“冷门”商品(长尾商品)也能被更多人看到,解决了“信息茧房”问题。
  4. 没变慢: 最重要的是,它虽然变聪明了,但没有增加任何延迟,用户感觉不到等待时间变长。

💡 总结

OneSearch-V2 的核心思想就是:让 AI 像人一样思考,但像机器一样快。

它不再死板地匹配关键词,而是通过“深度思考”理解你的真实意图,通过“自我内化”把思考变成直觉,通过“直接反馈”不断修正自己的推荐策略。这让电商搜索从一个简单的“找东西工具”,变成了一个懂你、能帮你发现新惊喜的“智能购物伙伴”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →