TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development
本文介绍了 TraceML,这是一个通过配对 134 场机器学习竞赛中的人类与智能体轨迹而构建的综合数据集和模式,它揭示了当前智能体之所以无法达到人类水平,并非由于编码错误,而是因为它们缺乏人类专家所展现出的战略规划和迭代探索行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,编写一个正确的句子与构建一个能从数据中学习的复杂机器之间存在着显著的区别。大型语言模型——这些能够起草电子邮件或为孤立任务编写代码的强大计算机程序——在前者方面已经变得异常熟练。然而,当被要求扮演自主工程师的角色时——即加载杂乱的数据、选择合适的数学模型、对其进行训练,然后根据结果反馈进行数小时的方案调整——它们往往会跌跌撞撞。它们可以产生一个最终答案,但在应对通往该答案的漫长且曲折的探索之路时却显得力不从心。这种差距不仅仅在于最后是否得到了错误的数字,更在于工作的过程本身。人类专家可能会尝试十几种不同的策略,舍弃失败的方案,并回到曾经看起来很有希望的旧想法上;而这些自动化代理则经常陷入狭窄的循环,不断重复微小的调整,却从未真正改变方向。
卡内基梅隆大学的研究人员致力于理解这种崩溃究竟发生在何时以及为何发生。他们创造了一种观察人类专家和人工智能代理工作的新方式,将他们的整个开发过程视为一个单一且连续的故事,而非仅仅是一个最终得分。他们收集了数千条关于人类如何解决机器学习竞赛的记录,捕捉了他们每一次保存新版本代码、每一次更换模型以及每一次调整数据的时刻。随后,他们将这些记录与两个不同类型的自动化代理在处理相同问题时的表现进行了对比。通过将这些历史记录并排排列,他们不仅能看到谁赢得了比赛,还能看到每一方在整个竞赛过程中是如何思考、行动以及对失败做出反应的。
研究发现,两组人在处理问题的方式上有着明显的鸿沟。人类专家的动作呈现出一种流畅且具有适应性的节奏。他们会花时间清洗数据,然后转向测试新模型,接着退后一步验证结果,有时在遇到瓶颈时,他们甚至会回到几天前放弃的一个想法上。他们将这一过程视为一系列实验,当证据表明需要新路径时,他们愿意彻底转型。相比之下,自动化代理的行为就像是被困在同一个房间里。其中一类依赖于标准命令行界面的代理,几乎把所有时间都花在对其已找到的单一解决方案进行细微且重复的调整上,就像是在不断重新称量同一组食材的重量,却从未尝试过新的食谱。另一类使用搜索方法同时尝试多种变体的方法的代理,虽然频繁更换模型,却无法将这些变化整合为连贯的策略。它在不同想法之间跳跃得过于频繁,以至于从未取得实质性的进展,而且几乎从未返回到之前的方案上去进行改进。
研究人员发现,这些代理不仅速度较慢,而且还缺失了一项关键的人类能力:记忆与回顾的能力。当人类专家意识到当前路径是死胡同,他们可以回溯自己的历史,找到当天早些时候一个看似有前景的“死胡同”,并尝试修复它。然而,这些代理似乎对其自身的历史毫无记忆。它们可以通过微调当前模型来从糟糕的分数中恢复,但无法重新开启一条早已搁置的工作线。这种记忆的缺失意味着它们一直在原地踏步或徒劳无功,无法从过去的尝试中汲取教训。研究显示,尽管代理在某些情况下从挫折中恢复的速度比人类更快,但它们缺乏那种能够放弃失败策略并稍后回归更好策略的战略耐心。
为了测试这种行为是否仅仅是因为没有给予代理更好的指令,研究人员尝试了一种新方法。他们制定了一套基于人类专家实际工作方式的准则,指示代理在不同类型的任务之间切换,停止对同一事物进行反复微调,并更频繁地尝试新模型。当他们向代理提供这些指令时,行为确实发生了变化,但仅限于特定方面。代理开始遵循关于何时切换任务以及如何构建模型组合的规则,其得分在几项竞赛中也有所提高。然而,其工作的底层节奏依然没有改变。它们仍然没有返回旧想法的做法,也仍然不具备那种让渡人类得以在漫长开发过程中游刃有余的深度、灵活的记忆。指令可以告诉代理该做什么,但无法教会它们如何思考自己的历史。
这项研究得出结论,该领域人类智能与人工智能之间的差距不仅在于原始计算能力或编写代码的能力。它关乎搜索本身的架构。这些代理缺少将过去的工作视为可挖掘资源,而非仅仅作为执行步骤列表的能力。虽然简单的指令可以修复一些表层行为,但更深层次的问题需要对这些系统的设计方式进行根本性的变革。它们需要一种能够记住自身旅程、识别何时陷入循环,并有信心去尝试另一条路径的方法。在它们具备这种能力之前,它们仍将是那些能够遵循地图,却难以成为绘制地图的探险家们的强大工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。