← 最新论文
🤖 AI

Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents

本立场论文认为,若要推进软件工程智能体的发展,需要从反应式设计转向结构化、具备状态感知能力且具备执行落地能力的推理,从而有效地处理长程任务并在不断演进的证据中保持连贯的理解。

原作者: Tse-Hsun, Chen

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Tse-Hsun, Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对该论文进行的解释。

核心理念:从“健忘的聊天机器人”到“有组织的工程师”

想象一下,你正在雇佣一位非常聪明的助手来修理一台复杂的机器,比如汽车引擎。目前的“软件工程智能体”(即编写代码的 AI 机器人)表现得就像一个健忘的聊天伙伴

它们目前的工作方式(“反应式”问题):
每当你向它们提问或它们运行测试时,它们只关注你说的最后一句话以及最近的聊天记录。它们没有一个笔记本来记录自己的计划、猜测或所学到的知识。

  • 类比: 这就像是在试图通过每天阅读书的一新页来解开一个谜团,但每当你翻页时,之前的页面就会消失。如果故事变得很长,侦探(AI)就会忘记谁是反派,忘记昨天发现了什么线索,或者忘记自己为什么做出某个特定的猜测。它们可能会解决一个问题,然后因为忘记了自己已经修复过,而立即撤销了自己的工作。

作者的提议(“结构化”解决方案):
Tse-Hsun (Peter) Chen 认为,要解决这个问题,我们不能再把这些 AI 智能体仅仅视为简单的聊天机器人,而应该开始把它们视为拥有结构化思维模型的人类工程师

他提出了三个主要的升级方向:

1. 显式结构(“蓝图”)

智能体不应只是在聊天,而应该维护一个正式的“蓝图”或“地图”来记录其思考过程。

  • 类比: 想象一位侦探不仅在大声说话,还维护着一块实体的证据板。在这块板上,他们钉上了:
    • 假设: “我认为刹车管断了。”
    • 不变性(Invariants): “引擎必须始终保持冷却。”
    • 依赖关系: “如果我修好了刹车,我下一步必须检查轮胎。”
    • 状态: “当前状态:等待测试结果。”
    • 为什么有效: 当智能体获得新信息时,它不需要重新阅读整个对话。它只需更新证据板上的特定图钉即可。这保持了逻辑的清晰,并防止智能体产生混乱。

2. 状态感知(“活着的记忆”)

智能体需要记住它的“当前理解”是一个不断变化的生命体,而不仅仅是一串过去的文字列表。

  • 类比: 想象一个电子游戏角色。在糟糕的游戏中,每当角色移动时,游戏都会忘记他正拿着钥匙,导致他不得不重新寻找。而在优秀的游戏中,角色拥有“状态”(物品栏:钥匙、地图;生命值:80%)。
  • 论文的观点: 当前的 AI 智能体会丢失它们的“物品栏”。它们会忘记自己的假设。Chen 表示,智能体需要一个持久的“状态”来保存其当前的信念。如果一项测试证明某个信念是错误的,智能体应该更新其“物品栏”中那个特定的信念,而不是惊慌失措地从第一关重新开始整个游戏。

3. 基于执行的推理(“现实世界反馈循环”)

当智能体尝试运行代码时,它会获得反馈(例如错误消息或测试结果)。目前,AI 将这种反馈仅仅视为聊天中的又一句话。

  • 类比: 想象一位厨师在品尝汤的味道。
    • 当前的 AI: 厨师品尝了汤,听到“太咸了”,然后立即忘记了自己最初为什么要加盐。他们可能会盲目地加入糖。
    • 提议中的 AI: 厨师有一张食谱卡(结构)。他们看到“太咸了”的反馈,并立即划掉添加过多盐的那一步。他们更新了对这道菜的思维模型:“好吧,汤太咸了,所以我需要加水,而不是加糖。”
  • 论文的观点: 智能体需要将“反馈”(错误消息)直接连接到导致该错误的特定“假设”(猜测)上。这能防止智能体进行盲目猜测,并帮助它准确学习自己在哪里出了错。

为什么这很重要?

论文指出,随着软件任务变得越来越长且越来越复杂,目前的“仅限聊天”模式会导致 AI 失效。这会导致:

  • 不一致性: 做同样的事情两次却得到不同的结果。
  • 遗忘: 修复了一个 Bug,却因为忘记了已经修复过而意外地重新引入了它。
  • 浪费时间: 当发生一个小错误时,不是去修复那一个步骤,而是重新开始整个过程。

路线图

Chen 并不是说我们现在已经有了完美的解决方案。他提出的是一个路线图。他希望研究人员构建出能够做到以下几点的 AI 智能体:

  1. 不再仅仅依赖对话历史。
  2. 开始使用结构化记忆(例如假设和状态的数据库)。
  3. 执行反馈(测试结果)视为更新其内部模型的数据,而不仅仅是用来阅读的文本。

简而言之: 我们需要将 AI 智能体从“反应式聊天机器人”(在几次对话后就会忘记一切)转变为“结构化工程师”(能够维护一个运行中的、有组织的项目思维模型),从而使其能够解决复杂的长期问题,且不会迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →