← 最新论文
🤖 AI

Self-EvolveRec: Self-Evolving Recommender Systems with LLM-based Directional Feedback

该论文提出了 Self-EvolveRec,这是一个通过集成用户模拟器(User Simulator)和模型诊断工具(Model Diagnosis Tool)来构建自进化、定向反馈循环的新颖框架,旨在克服传统推荐系统设计中固定搜索空间和标量指标的局限性,从而实现评估标准的动态调整,并显著优于现有的 NAS 和 LLM 驱动的基准模型。

原作者: Sein Kim, Sangwu Park, Hongseok Kang, Wonjoong Kim, Jimin Seo, Yeonjun In, Kanghoon Yoon, Hyunsik Jeon, Chanyoung Park

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Sein Kim, Sangwu Park, Hongseok Kang, Wonjoong Kim, Jimin Seo, Yeonjun In, Kanghoon Yoon, Hyunsik Jeon, Chanyoung Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人成为一名终极购物助手。多年来,实现这一目标的标准方法就像是在玩一个规则极其严格的“填词游戏”(Mad Libs)。你会给机器人一个固定的乐高积木清单(预定义的数学算子),并对它说:“仅使用这些积木,构建出最好的推荐引擎。”这就是神经架构搜索(Neural Architecture Search, NAS)。问题在于,机器人只能构建那些符合它手中积木规格的东西。它无法发明一种新型积木,也无法在指令错误时修改使用这些积木的方法。

随后,一种新的趋势出现了:由大语言模型(LLM)驱动的代码进化。这就像是递给机器人一块空白画布和一支神奇的画笔,并告诉它:“写出你自己的代码!”机器人现在可以发明新的积木了。但有一个陷阱:机器人仍然是根据一个单一且枯燥的数字(比如考试分数)来接受评分。如果分数下降了,机器人就会盲目猜测:“也许我应该改变这个数字?”然后重试。这就像是在蒙着眼睛投掷飞镖。它并不知道自己为什么没中靶心。是因为推荐的内容太大众化了吗?还是因为它忽略了用户对复古袜子的奇特品味?机器人只知道分数掉了,于是就开始惊慌失措。

Self-EvolveRec 登场了,它是一个拥有两位特殊助手的超级智能教练。

两位助手:评论家与医生

Self-EvolveRec 不仅仅是看一个测试分数,它使用了一个用户模拟器(我们称之为“评论家”)和一个模型诊断工具(我们称之为“医生”)。

评论家是一组具有不同性格的虚拟购物者。其中一位可能是一个讨厌昂贵电子产品的精打细算的大学生;另一位则可能是追求潮流、想要最新科技产品的追随者。当机器人做出推荐时,评论家不仅仅会说:“分数:4/5。”她还会说:“我腻了!你连续给我推荐了三个游戏机。我需要多样性!”或者“这个商品太贵了,超出了我的预算。”这给了机器人方向性反馈:一张关于“哪里错了”以及“为什么错”的清晰地图。

医生则是一名检查引擎内部状况的机械师。当评论家在抱怨用户体验时,医生在检查引擎的内部健康。他可能会发现一些用户无法察觉的问题,比如“嵌入坍缩”(Embedding Collapse)。想象一下,如果机器人关于“鞋子”和“凉鞋”的所有想法都挤在了它大脑中同一个微小的角落,导致它认为这两者完全一样。医生会通过数学手段测量这一点并说:“嘿,你的大脑变糊涂了,你的想法变得过于雷同了。”

魔法循环:协同进化

这里是最酷的地方。通常情况下,如果机器人学会了一个新技巧(比如一种新的价格处理方式),旧的医生可能不知道如何检查它。他会像这样说:“我没有针对这种新引擎部件的工具!”

Self-EvolveRec 通过 诊断工具 - 模型协同进化 解决了这个问题。随着机器人的进化和学习新技巧,医生也会随之进化。如果机器人发明了一个新的“价格编码器”,医生会自动发明一个新的“价格检查”工具来衡量它。如果评论家抱怨“缺乏多样性”,医生就会发明一个新的数学公式来衡量多样性,并验证机器人是否真的解决了这个问题。他们共同成长,确保机器人始终被正确的工具进行检测。

结果:不仅仅是猜测

作者在来自亚马逊(CDs、电子产品、办公用品)和 MovieLens 的真实数据上测试了该框架。他们将 Self-EvolveRec 与旧有的“乐高积木”方法以及“蒙眼投掷飞镖”式的代码进化方法进行了对比。

结果显示,Self-EvolveRec 始终优于其他方法。例如,在 CDs 数据集中,从一个基础模型开始,Self-EvolveRec 将 NDCG@5(衡量前列推荐质量的指标)提升到了 0.3865,而表现最好的“蒙眼投掷”竞争对手仅达到了 0.3610。在 HR@5(命中率)方面,Self-EvolveRec 达到了 0.5274,击败了竞争对手的 0.4870

但真正的胜利不仅仅在于数字。当他们要求独立的 AI 评委对机器人编写的代码质量进行评估时,Self-EvolveRec 在创造力(8.04 对比次优者的 7.50)和洞察力(8.16 对比次优者的 7.40)方面得分最高。这表明机器人不仅仅是在瞎猜,它实际上理解了问题并发明了聪明的解决方案,比如添加“类别感知硬负样本”(Category-Aware Hard Negatives)来防止反复推荐同样无聊的内容。

他们还运行了一个“用户满意度”模拟。在一个虚拟用户决定是继续浏览还是退出程序的测试中,Self-EveolveRec 让用户保持了更长时间的参与。在 CDs 数据集上,其深度(用户查看的页面数)达到了 2.048,而次优方法为 1.952。这表明其推荐内容感觉更具人性化,而非机械化。

它不是什么

值得注意的是,本文并未声称某些内容。作者谨慎地指出,虽然他们的“用户模拟器”非常擅长模仿人类行为,但它仍然是一种模拟。他们明确表示,要完全验证这些改进在现实世界用户中的效果,需要进行实际的 A/B 测试,这是他们留给未来工作的课题。他们还发现,如果移除“评论家”(用户模拟器)而仅使用“医生”(诊断工具),机器人虽然仍能进步,但幅度并不大。两者的结合才是让魔法发生的原因。

简而言之,Self-EvolveRec 表明,要构建一个真正优秀的推荐系统,你不能仅仅盯着分数看。你需要一位能告诉你失败原因的教练,一位能检查你内部齿轮的机械师,以及一个让你与他们共同学习和成长的系统。它将混乱的“猜测与尝试”过程转变为了一场有引导的探索之旅。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →