CatalogAgent: A Supervisor-mediated Self-Learning System Enabling Context Engineering for GenAI Models
本文介绍了 CatalogAgent,这是一个由监督者介导的自学习系统,通过利用记忆库将监督者决策聚合为上下文工程化的见解,来解决生成器与评估器大语言模型在电子商务目录增强过程中的冲突,从而使模型准确率自主提升了超过 13%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个你最喜欢的在线商店由一群非常聪明但有点丢三落四的机器人助手运营的世界。这些机器人的任务是将数百万种产品(从 T 恤到烤面包机)整理到整齐的数字货架上。为此,它们需要填写特定的细节,比如“颜色”、“材质”或“尺寸”。这就是生成式人工智能(Generative AI,简称 GenAI)的工作——它是一种可以阅读文本和图像以创造新信息的计算机程序。但问题在于,这些机器人并不完美。有时它们会猜错,有时它们还会为正确答案是否一致而互相争论。如果商店保留这些错误,顾客会感到困惑,卖家也会感到沮丧。该领域的科学家面临的一个大问题是:我们如何教这些 AI 机器人识别自己的错误,并在不需要人类时刻手把手指导的情况下,让它们更好地完成工作?
于是,出现了 CatalogAgent,这是由亚马逊研究人员设计的一个新系统,它扮演着一个超级聪明的“老板机器人”的角色,旨在解决这个难题。你可以把这个系统想象成一个在繁忙仓库中工作的三人小组。首先,你有一个生成器(Generator),它通过查看产品的标题和描述来猜测其属性(比如猜一件衬衫是“棉质”的)。其次,有一个评估器(Evaluator),它是一个持怀疑态度的机器人,负责复核生成器的猜测,看它是否合理。通常情况下,它们意见一致,工作便完成了。但当它们产生分歧,或者当人类卖家说“嘿,那不对!”时,第三个机器人就会介入:监督员(Supervisor)。
监督员是全场的明星。它就像一个拿着放大镜并配备了各种工具库的侦探。当生成器和评估器发生争执,或者卖家投诉时,监督员就会展开调查。它不仅仅是选出一个胜者,它还会弄清楚为什么会出错。是生成器凭空捏造了一个虚假的品牌名吗?是评估器要求得太严苛了吗?还是卖家混淆了“版型”与“裤长”?监督员会记录下每一次争执中所学到的教训。
但神奇之处在于:该系统并不只是把这些教训存档。它还有一个记忆总结器(Memory Summarizer),一位聪明的图书管理员,它会阅读成千上计的这些侦探报告并寻找规律。也许它注意到,对于“手机壳”,机器人总是会编造型号名称;或者对于“手提包”,它们总是需要查看第二张照片才能看到内部情况。总结器将这些模式转化为新的指令,即“上下文工程(context engineering)”,并将其反馈给生成器和评估器。这就像机器人正在阅读一份由它们自己的老板编写的学习指南,帮助它们从过去的错误中学习,从而不再重蹈覆辙。
论文显示,这种自我学习循环的效果极其出色。通过使用这种方法,该系统将生成器的准确率提高了 15.24%,将评估器的准确率提高了 13.98%。然而,研究人员非常谨慎,没有让机器人变得过于自信。他们建立了一个名为**回归约束(Regression Constraints)**的安全网。这就像是一个质量控制检查,确保机器人不会因为过度专注于修复新错误,而导致原本已经掌握的简单任务出错。他们在 489 万对产品数据上进行了测试,发现虽然系统积极地修复了困难案例,但仍保持了其在整体人群中的性能稳定。
简而言之,CatalogAgent 证明了 AI 系统可以实现自我监管。通过让一个聪明的监督员来调解冲突,并将这些冲突转化为教学时刻,该系统创造了一个循环,让机器人每天都变得更聪明,而无需人类去重写它们的代码。这是一种从“修理机器人”到“教机器人如何自我修复”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。