Reinforced Graph of Thoughts: RL-Driven Adaptive Prompting for LLMs
本文提出了强化思维图(RGoT),这是一个自动化框架,利用强化学习动态调整思维图提示中的操作图结构,从而克服人工定义结构的僵化性,以更好地处理复杂的问题解决任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明但有时有些散漫的助手(大型语言模型,或称 LLM),它擅长撰写故事,但在处理复杂数学或整理杂乱数据方面却力不从心。如果你只是让它“解决这个问题”,它可能会感到困惑或犯错,尤其是当问题非常庞大时。
为了帮助它们,研究人员通常会为它们提供一份“食谱”或分步计划:
- 思维链(Chain of Thought): 就像一条直线指令:“先做 A,再做 B,然后做 C。”
- 思维树(Tree of Thoughts): 就像家谱树,助手尝试不同的分支,观察哪一条看起来可行,如果遇到死胡同则回溯。
- 思维图(Graph of Thoughts, GoT): 这是最先进版本。想象一张地铁线路图。助手可以将一个问题拆分成不同的线路,分别解决,然后将结果合并。这对大问题非常有效,但使用起来很困难。你,作为人类,必须在助手开始工作之前亲手画出整张地铁线路图。如果你画错了地图,助手就会失败。
问题所在:“静态地图”
最初的“思维图”就像一张僵硬的、预先画好的地铁线路图。如果问题完全符合你的预期,它能完美运行。但如果问题变得更大或更复杂(例如,数字列表的长度是你预期的两倍),你固定的地图就会失效。助手会迷路,因为地图没有考虑到新的规模。
解决方案:强化思维图(Reinforced Graph of Thoughts, RGoT)
这篇论文的作者 Manuel Noah Riesen 和 Peter Alfred von Niederhäusern 构建了一个名为RGoT的系统。与其由你来画地图,他们赋予助手一个在驾驶过程中学习的 GPS。
以下是其工作原理,使用一个简单的类比:
“求和”游戏
想象任务是加总一个非常长的数字列表。
- 旧方法: 你告诉助手:“把这些数字加起来。”如果列表有 5 个数字,它们能完成。如果有 50 个,它们就会困惑并给出错误答案。
- RGoT 方法: 系统拥有一个基本动作的工具箱:
- 拆分(Split): 将大列表切成两个小列表。
- 求和(Sum): 加总一个小列表。
- 合并(Merge): 将两个小结果合并为一个大结果。
与其由你决定何时拆分或合并,系统使用一个强化学习(RL)代理。把这个代理想象成一个试图通关的电子游戏角色。
- 游戏: “关卡”就是数字列表。
- 动作: 角色可以选择“拆分”、“求和”、“合并”或“停止”。
- 奖励: 如果最终答案正确,角色得分;如果失败,则扣分。
学习的魔力
起初,这个代理一无所知。它可能会尝试一次性加总 100 个数字的列表并失败。但因为它在玩一个“游戏”(使用强化学习),它能从错误中学习。
- 它意识到:“嘿,当列表巨大时,如果我尝试一次性加总,我会受到惩罚。但如果我先拆分,然后求和这些小部分,最后合并它们,我会获得巨额奖励!”
- 随着时间的推移,代理学会在运行时构建自己的“地铁线路图”(操作图),完美适配问题的规模。
他们实际做了什么
研究人员在几项任务上测试了这种方法:
- 列表求和: 加总数字。
- 列表排序: 将数字按顺序排列。
- 统计关键词: 找出某个词在文本中出现的次数。
- 合并文档: 将多篇文本合并为一篇,且不重复信息。
他们并没有直接使用真实的 AI 模型进行训练(因为这太昂贵且缓慢)。相反,他们创建了一个模拟环境。他们计算出 AI 在处理 10 项、20 项、50 项等列表时出错的可能性,并将这些概率编程到游戏中。代理在这个模拟环境中学习,然后他们在真实的 AI 上进行了测试。
结果
论文声称:
- 适应性: 代理学会了根据问题的难度自动调整策略。如果列表很短,它就执行简单的求和。如果列表巨大,它会自动决定先拆分。
- 优于基础方法: 与直接要求 AI“一次性完成”(即“输入 - 输出”方法)相比,该代理解决复杂问题的可靠性要高得多。
- 泛化能力: 即使他们给代理一个它在训练期间从未见过的列表规模(例如,它只在最多 30 项的列表上练习过,却给它一个 60 项的列表),它仍然能制定出良好的策略。
核心结论
这篇论文提出了一种使高级 AI 问题解决自动化的方法。不再需要人类专家确切知道如何构建复杂任务,系统利用“学习代理”为任何给定的问题规模找出最佳的分步计划(即图)。它将一个僵硬的、手动过程转变为一个灵活的、自我调整的过程。
注:该论文完全专注于这些特定任务(数学、排序、计数、合并),并未声称该方法适用于医疗诊断、法律建议或这些定义逻辑问题之外的其他现实世界应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。