← 最新论文
💬 NLP

Interactor: Agentic RL oriented Iterative Creation for Ad Description Generation in Sponsored Search

本文介绍了 Interactor,这是一个代理强化学习框架,通过与生成式奖励模型进行多轮交互,迭代地优化赞助搜索中的广告描述,在显著提升知识丰富度与落地页一致性的同时,实现了成功的在线部署。

原作者: Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一个柠檬水摊位,但你不仅仅是喊着“柠檬水!”(这就像是一个广告标题),而是有一个详细的长菜单板,你可以用它来解释为什么你的柠檬水如此特别。

这篇论文介绍了一个名为 INTERACTOR 的新系统,它就像是一个超级智能、具备自我纠错能力的营销助手,专门负责编写这些长篇且详细的广告描述。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“一蹴而就”的错误

目前大多数 AI 工具尝试在一次性尝试中就写好一段广告描述,就像一个没有草稿纸的学生在参加考试。它们有时能写对,但也经常犯两个大错:

  • 它们会编造事实: 它们可能会说你的柠檬水使用了“有机柠檬”,但你的供应商只卖普通的柠檬(这被称为对落地页的不忠实/不符合事实)。
  • 它们太笼统: 它们可能只会说“味道很好”,而不是解释柠檬是在黎明时分手工采摘的(这被称为缺失世界知识)。

因为 AI 无法立即“看到”用户的反应,所以它会不断重复同样的错误。

2. 解决方案:“教练与选手”的循环

INTERACTOR 改变了游戏规则。它不再是一次性的测试,而是将广告编写变成了一场选手(编写广告的 AI)与教练(一组专门的 AI 评委)之间的多轮对话

以下是具体步骤循环:

  1. 选手制作草案: AI 写出广告的第一版。
  2. 教练进行评审: 教练不仅仅是给一个分数(比如“8/10”)。它扮演的是一位拿着红笔的严厉编辑。它会说:
    • “你声称‘免运费’,但你的网站上写的是‘需支付配送费’。这是谎言。请修正它。”
    • “你没有提到黑芝麻有助于头发健康,而这正是用户真正想了解的内容。请加上这一点。”
  3. 选手进行精炼: AI 阅读教练的笔记,思考这些建议,并重写广告以修复特定的错误。
  4. 重复: 这个过程会多次进行,直到广告趋于完美。

3. 核心秘诀:“智能体强化学习 (Agentic RL)”

论文称之为 Agentic Reinforcement Learning。可以把它想象成训练一只狗,但由于这只狗足够聪明,它能理解自己为什么得到奖励或受到了纠正。

  • 传统的 RL(强化学习): AI 接收到一个“做得好!”或“做得差!”的信号。它只能靠猜测下一步该做什么。
  • INTERACTOR (Agentic RL): AI 接收到的是推理反馈。它确切地知道哪句话错了以及为什么错。这使得它学习得更快,写出的描述也更好。

4. 结果:从“空洞”到“事实”

论文在来自百度搜索引擎的真实数据上进行了测试。

  • 之前: AI 广告往往充满了“空洞的辞藻”(充满废话)或者存在“幻觉”(捏造事实)。
  • 之后: INTERCTOR 系统生成的广告具有以下特点:
    • 知识丰富: 它们利用真实的知识点真正回答了用户的问题。
    • 忠实可靠: 它们严格遵循广告主网站实际提供的产品内容。
    • 点击率更高: 因为广告质量更高,更多的人点击了广告,从而为公司带来了更多收益。

5. 现实世界的影响

论文指出,自 2026 年 5 月起,该系统已在一家主流搜索引擎上进行实时运行。它不仅仅是一个理论;它目前正在帮助广告商编写更好的广告,并帮助用户找到更相关的信息,同时也提升了搜索引擎的收入。

简而言之: INTERCTOR 就像是给一位 AI 作家配备了一支专家编辑团队,他们不仅是给文章打分,还会坐下来协助作者修改每一个错误,直到广告达到完美为止。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →