← Derniers articles
💬 NLP

OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework

Le papier présente OneSearch-V2, un cadre de recherche générative amélioré par un raisonnement latent et une auto-distillation, qui surpasse la version précédente en comprenant mieux les requêtes complexes et les intentions utilisateurs, tout en alignant les préférences comportementales pour obtenir des gains significatifs de CTR et de taux de conversion sans augmenter la latence.

Auteurs originaux : Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipeng Qian, Xinyu Sun, Zhixin Zhai, Yang Zhao, Bochao Liu, Jingshan Lv, Xiao Liang
Publié 2026-03-26
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipeng Qian, Xinyu Sun, Zhixin Zhai, Yang Zhao, Bochao Liu, Jingshan Lv, Xiao Liang, Hui Kong, Jing Chen, Han Li, Chenyi Lei, Wenwu Ou, Kun Gai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes dans un immense supermarché (le moteur de recherche) et que vous cherchez quelque chose de très précis, mais que vous ne savez pas exactement comment le nommer.

Le système OneSearch-V1 (l'ancienne version) était comme un employé très rapide, mais un peu distrait. Il vous donnait des produits basés sur ce que les gens ont acheté par le passé. Si vous cherchiez "cadeau pour petite amie", il vous sortait des roses parce que c'est statistiquement probable. Mais si vous vouliez éviter les fleurs (allergie) ou si vous cherchiez quelque chose de très spécifique et rare, il se perdait. Il ne comprenait pas vraiment pourquoi vous cherchiez cela.

OneSearch-V2 est la nouvelle version : c'est comme si cet employé avait reçu une formation de détective privé et de psychologue. Voici comment cela fonctionne, expliqué simplement :

1. Le Détective qui "Réfléchit à voix haute" (Compréhension des requêtes complexes)

Quand vous tapez une requête bizarre comme "équipement de fitness pour intérieur" ou "cadeau pour St-Valentin", l'ancien système regardait juste les mots-clés.
Le nouveau système, lui, fait un petit exercice mental (qu'ils appellent "Chain of Thought" ou Chaîne de Pensée) avant de vous répondre.

  • L'analogie : Imaginez que l'employé prend un moment pour se dire : "Attends, l'utilisateur veut un cadeau. Ce n'est pas juste 'cadeau'. C'est pour une fille, donc peut-être des bijoux, du maquillage, ou un parfum. Mais attention, l'utilisateur a acheté des livres de cuisine récemment, donc il aime peut-être la cuisine..."
  • Au lieu de vous donner une réponse brute, il extrait les mots-clés essentiels de cette réflexion (ex: "bijoux", "parfum", "cadeau romantique") pour mieux cibler sa recherche.

2. L'Entraînement "Miroir" (Auto-distillation)

C'est la partie la plus magique. Habituellement, pour apprendre à un robot à réfléchir, on lui fait lire des livres de logique, ce qui le rend lent.
Ici, les chercheurs ont utilisé une technique d'auto-distillation.

  • L'analogie : Imaginez un professeur (le modèle "Maître") qui a accès à toutes les notes de réflexion (les mots-clés extraits). Il enseigne à un élève (le modèle "Étudiant") qui, lui, n'a pas les notes.
  • L'élève doit deviner la réponse correcte sans avoir les notes, mais en regardant ce que le professeur a répondu.
  • Le résultat : L'élève finit par internaliser la logique du professeur. Il n'a plus besoin de lire les notes pendant l'examen (la recherche en temps réel). Il a intégré la "réflexion" directement dans son cerveau. C'est pour ça que le système reste ultra-rapide, même s'il est plus intelligent.

3. Le Feedback Direct (Apprendre par l'action, pas par les vieux logs)

Les anciens systèmes apprenaient uniquement en regardant des vieux carnets de commandes (logs). Si personne n'avait acheté de "chaussures de randonnée" l'année dernière, le système ne vous en proposerait jamais, même si tout le monde en veut maintenant.
OneSearch-V2 change la règle : il apprend directement de vos actions en temps réel.

  • L'analogie : Au lieu de regarder un livre de recettes de l'an dernier, le chef écoute ce que vous dites pendant le repas. Si vous cliquez sur un produit, si vous l'ajoutez au panier ou si vous l'achetez, le système ajuste sa stratégie immédiatement.
  • De plus, il ne se contente pas de compter les clics. Il comprend la hiérarchie : cliquer c'est bien, acheter c'est mieux. Il apprend à privilégier ce qui vous fait vraiment plaisir, pas juste ce qui est populaire.

Pourquoi est-ce si important ?

  • Plus de bulles de filtres : Le système ne vous enferme pas dans ce que vous avez déjà acheté. Il ose vous proposer des nouveautés (les "articles froids") parce qu'il a compris votre intention réelle.
  • Plus rapide : Même s'il réfléchit plus, il ne ralentit pas la recherche grâce à l'entraînement "miroir".
  • Plus humain : Il comprend les nuances. Si vous cherchez "pas de sucre", il ne vous proposera pas de gâteaux, même si c'est populaire.

En résumé : OneSearch-V2 est passé d'un simple vendeur de statistiques à un concierge intelligent qui comprend vos besoins profonds, apprend de vos réactions en direct, et vous propose exactement ce qu'il vous faut, même si vous ne savez pas comment le nommer.

Les résultats ? Les utilisateurs cliquent plus (+3,98%), achètent plus (+2,11% de commandes) et sont plus satisfaits de leur expérience de recherche. C'est comme passer d'un distributeur automatique de bonbons à un sommelier qui connaît votre palais par cœur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →