MemoHarness: Agent Harnesses That Learn from Experience
MemoHarness 是一个自适应智能体优化框架,它通过将控制层分解为六个维度,并利用源自过往执行的双层经验库为每个案例动态定制控制架配置,从而在无需测试时标签或额外搜索的情况下增强大语言模型在多样化任务中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个才华横溢、超级聪明的机器人助手。你给它布置一项任务,它尝试去解决。但问题在于:机器人不仅需要聪明,它还需要知道“如何”使用它的头脑。它需要一套指令来组织自己的思绪、决定何时查找信息、如何寻求帮助,以及在给出答案前如何检查自己的工作。在人工智能的世界里,这套指令和工具被称为“智能体框架”(agent harness)。你可以把它想象成汽车的仪表盘、方向盘和 GPS。引擎(AI 模型)可能非常强大,但如果仪表盘坏了或者 GPS 卡在了旧地图上,这辆车是无法带你去到目的地的。长期以来,科学家们一直试图通过把引擎做得更大来让这些机器人变得更聪明。但这篇论文提出了一个不同的问题:如果我们只是修好仪表盘呢?如果我们能教会机器人从自身的错误中学习,并针对每一次行程调整其驾驶风格,而不是对所有事情都使用那套僵化、一成不变的指令呢?
这正是 MemoHarness 背后的研究人员想要做的事情。他们意识到,目前大多数 AI 智能体就像是拥有固定方向盘的汽车:无论是一个简单的转弯还是复杂的公路汇入,它们都使用同一套设置。该团队构建了一个全新的系统,充当一名“学习型驾驶员”。它不再仅仅是寻找一套可以永久使用的完美指令,而是让智能体从过去的行程中学习。它保留了一份详细的日记,记录了什么起作用了、什么失败了,以及为什么。当新任务出现时,智能体不仅仅是在猜测;它会查阅自己的日记,寻找相似的过去情境,并根据特定挑战即时调整自己的指令。
论文介绍了一种巧妙的方法,将“框架”分解为六个不同的部分,就像调节控制面板上的不同旋钮一样:智能体如何收集信息(上下文/Context)、它使用什么工具(工具/Tool)、它如何思考和表达(生成/Generation)、步骤的顺序(编排/Orchestration)、它记住了什么(记忆/Memory),以及它如何最终确定答案(输出/Output)。通过将这些视为独立的、可编辑的层面,系统可以精确诊断到底哪里出了问题。是它忘了看地图?是它开得太快了?还是它忘了记住某个关键细节?
在实验中,团队在三种截然不同的任务类型上测试了这个系统:充当计算机终端来修复软件、编写代码以及解决复杂的金融推理谜题。结果令人振奋。在计算机终端测试中,MemoHarness 将成功率从 0.722 提升到了 0.806,击败了他们对比过的所有最佳固定设置。它还展示了这些习得的习惯可以“迁移”到新的、未见过的任务中,甚至可以在不需要重新训练的情况下在不同类型的 AI 模型上表现良好。例如,当他们将在一个模型上学到的框架应用于其他六个模型时,平均成功率提升了 +0.098。
作者指出,这种方法是让 AI 变得更具适应性的一种实用方式,而无需每次都构建一个新引擎。然而,他们也谨慎地指出,虽然结果很强,但这是基于特定的测试和模拟。他们并不声称已经解决了所有问题,或证明了这在每一个现实世界的场景中都能完美运作。他们还发现,虽然系统使用更多的数据来“阅读”其日记,但大部分数据都可以进行缓存(存储以备快速复用),从而保持了具有竞争力的成本。简而言之,MemoHarness 表明,赋予 AI 反思自身经验并调整自身控制面板的能力,可能是让其真正变得有用的关键,从而将一个僵化的机器转变为一个灵活的、学习型的伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。