optimize_anything: A Universal API for Optimizing any Text Parameter
本文介绍了"optimize_anything",这是一个基于大语言模型的通用优化框架,通过将基于文本的搜索与多任务迁移及可操作侧信息相结合,在智能体架构设计、云成本降低和 CUDA 内核生成等六个不同领域实现了超越专用算法的最先进成果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢的大厨(即大型语言模型,或 LLM),他非常擅长撰写食谱,却不会实际烹饪。通常,为了得到一道佳肴,你需要为每一道菜聘请不同的专家:甜点师负责甜点,烧烤大师负责牛排,副主厨负责汤品。
这篇论文介绍了一种名为 optimize_anything 的新系统,它就像一个通用的“品尝与指导”循环。它声称,你无需为每项工作聘请不同的专家。相反,你可以使用这一单一系统来改进任何基于文本的解决方案,无论是计算机程序、一套指令、机器人的“大脑”,甚至是一幅画作。
以下是其工作原理,分解为简单的概念:
1. 核心理念:“文本制品”
作者们意识到,几乎任何问题都可以转化为一段文本。
- 代码只是文本。
- 机器人的指令只是文本。
- 数学公式只是文本。
- 一幅画(如 SVG 格式)也只是文本代码。
类比:将“文本制品”想象成故事的一个草稿。系统的任务是拿过这份草稿,阅读它,评估其效果如何,然后请这位 AI 大厨重写它,使其变得更好。
2. 秘诀:“侧面信息”(教练的笔记)
过去,如果你要求 AI 改进某物,它只能得到一个分数(例如,“这段代码得了 60 分”)。它不知道为什么失败了。这就像学生考试得了"C",却没有收到关于哪些题目做错的反馈。
optimize_anything 改变了规则。系统不仅给出分数,还提供侧面信息(SI)。
- 类比:想象一位教练在观看运动员跑步。教练不只是说“你跑了 10 秒”,而是说“你跑了 10 秒,但你在第三个跨栏时绊倒了,因为你的鞋带松了,而且你向左倾斜得太厉害了”。
- 如何起作用:AI 利用这些具体的笔记(如错误消息、崩溃日志或视觉描述)来修复确切的问题。论文表明,这使得 AI 的学习速度快了 4 到 6 倍,并且取得的分数远高于仅拥有简单分数的情况。
3. 三种玩法
该系统有三种不同的模式,就像视频游戏中的不同游戏模式:
- 单任务模式(单人玩家):你给系统一个具体问题来解决,例如“将 26 个圆打包进一个正方形”。AI 只尝试解决这一件事。
- 多任务模式(学习小组):你给系统一批相关的问题,例如“编写 30 个不同的计算机程序以加速数学运算”。AI 一起解决所有这些问题。
- 魔法之处:如果 AI 为问题 #1 想出了一个技巧(例如“使用更快的内存技巧”),它可以立即将同样的技巧应用到问题 #15 上。这就像一个学生在代数课上学到了数学捷径,并将其用于精通微积分。论文发现,这种模式比逐个解决问题要好得多。
- 泛化模式(大师班):你给 AI 一个训练集和一个测试集。目标是创建一个能解决新的、未见过的问题的解决方案。
- 示例:AI 学会了为编程机器人编写“技能指南”。它在一系列编程任务上进行训练,然后变得如此擅长编写指南,以至于它帮助机器人解决了全新的、它从未见过的编程任务。
4. 他们实际取得了什么成就?
论文在六种截然不同的问题类型上测试了该系统。以下是发生的情况:
- 机器人“大脑”(智能体架构):他们给 AI 一个非常简单的、10 行代码的机器人“大脑”。该系统将其进化为一个复杂的 300 多行代码的“大脑”。结果如何?该机器人在一个高难度逻辑谜题(ARC-AGI)上的准确率从 32.5% 跃升至 89.5%。
- 云成本:他们要求 AI 为云服务器编写调度计划。与标准方法相比,新调度计划节省了 40% 的费用。
- 计算机速度(CUDA 内核):他们要求 AI 编写代码以加快显卡速度。87% 的 AI 编写代码的速度与最佳人类编写的代码一样快,甚至更快。
- 数学谜题:他们改进了数学考试提示,将 AI 的分数从 46.6% 提升至 60%。
- 圆打包:他们要求 AI 尽可能紧密地打包圆。AI 发现了一个优于著名先前 AI(AlphaEvolve)的解决方案,并且使用的计算能力更少。
- 3D 模型:在“无种子”模式(AI 必须从零开始,没有任何代码)下,它成功生成了一个独角兽的 3D 模型。
5. 为什么这很重要
在此之前,如果你想优化一个机器人,你需要一位机器人专家。如果你想优化云服务器,你需要一位云专家。
optimize_anything 声称是首个“通用 API"。它说:“给我文本,给我评分规则,剩下的交给我。”它将这些不同的领域统一在一个简单的接口之下。
注意事项(局限性):
- 它仅适用于可以写成文本的事物。
- 它需要一个“评分器”(评估器)来告诉它文本表现如何。
- 结果的质量取决于 AI“大厨”有多聪明。
- 有时,如果你要求它一次性解决太多完全不同的问题(例如打包不同大小的圆),它会感到困惑。当问题相关时,它的效果最好。
总结
optimize_anything 是一个工具,它让单一 AI 系统能够学习成为几乎任何文本内容的优化大师。通过向 AI 提供详细的反馈(而不仅仅是分数),并让它从多个问题中同时学习,它能够发现往往优于人类专家为特定工作构建的专用工具的解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。