MUSE: An Interactive Meta-Agent for Understanding and Steering LLM-powered Data Science Systems
本文提出了 MUSE,一种交互式元智能体(meta-agent),它通过动态重构执行轨迹、实现上下文感知反馈并支持混合主动控制,增强了用户对大语言模型驱动的数据科学系统的理解与控制,并在一项用户研究中证明了其能够提高任务效率和用户信心。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
数据科学是将原始数字转化为解释世界的叙事艺术。几十年来,这项工作一直是一个缓慢且迭代的过程,专家们需要清洗杂乱的数据、编写自定义计算机代码,并不断检查自己的工作以确保结果符合逻辑。这是分析师与数据之间的一场对话,一个问题引发另一个问题,随着新模式的出现,早期的决策也经常会被重新审视。最近,被称为大语言模型的强大计算机程序开始作为这一领域的助手出现。这些数字代理可以听取一个简单的请求,例如“预测哪些客户会停止购买我们的产品”,然后自动编写代码、清洗数据,并构建回答该问题所需的数学模型。虽然这有望让复杂的分析变得人人可用,但一个新的问题出现了:当这些自动化助手出错时,人类极难发现问题出在哪里,或者告诉机器如何修复。计算机的内部思维过程通常是一串由代码和技术日志组成的混乱流,在非专业人士看来如同乱码,导致用户在过程偏离轨道时无法进行引导。
普渡大学和微软研究院的研究人员开发了一个名为 MUSE 的新系统,旨在解决透明度和控制力的问题。MUSE 扮演着智能翻译器和监督者的角色,位于人类用户与自动化数据科学代理之间。MUSE 不会向用户展示混乱的代码墙和错误信息,而是将代理的活动重新组织成清晰的、分步骤的叙事。它将复杂的工作流分解为五个不同的详细程度级别,从用纯英文进行的关于代理正在做什么的简单摘要,一直到它编写的具体代码行。这使得用户可以先看大局,然后仅针对他们想要理解的具体步骤进行深入查看,就像读一本书,只有在句子令人困惑时才去查阅脚注一样。
该系统不仅仅是进行总结;它还会主动监视代理是否出现问题。当自动化助手工作时,MUSE 会实时监控其行为。如果代理做出了可疑的动作,例如删除重要数据或使用有缺陷的方法来训练模型,MUSE 会立即用警告标记出该特定步骤。至关重要的是,它不仅仅是说“出错了”,它还会用自然语言解释为什么该步骤存在问题,并为用户提供一种直接在对话中修复它的方式。用户只需将标记出的步骤拖入聊天框,要求系统解释问题,或者从建议的修复列表中进行选择。这消除了用户在数小时的日志中寻找错误,或编写复杂指令来纠正错误的必要性。该系统还帮助用户验证结果,生成简单的检查项,以确认代理生成的数字确实是正确的。
为了测试这种方法是否真的对人类有所帮助,研究人员对十五名具有不同技术经验的参与者进行了研究。他们要求这些用户使用三种不同的设置来完成数据科学任务:一种是只能看到原始、混乱的日志;第二种是可以看到结构化的摘要但必须手动修复错误;第三种是使用完整的 MUSE 系统。结果显示,新系统具有明显的优势。使用 MUSE 的参与者完成任务的速度显著加快,平均耗时十七分钟,而那些查看原始日志的人则需要二十六分钟。他们还表示对最终结果感到更加自信。研究发现,该系统帮助用户快速发现错误并在不陷入技术细节的情况下进行修复,有效地将一个令人困惑的“黑箱”变成了一个透明的、协作的伙伴。
研究人员观察到,人们使用 MUSE 时,其交互方式发生了巨大的变化。没有它时,用户倾向于在代码行中无休止地滚动,希望能发现错误,这是一个缓慢且令人沮丧的过程。有了 MUSE,他们停止了搜索,转而开始检查。他们利用系统的警告直接跳转到问题区域,并使用内置工具提出问题或请求更改。研究表明,使用自动化数据科学工具的主要障碍不是编写代码的能力,而是理解并引导自动化过程的能力。通过将计算机的输出重构为人类可读的步骤,并提供直接干预的方式,MUSE 弥合了人类意图与机器执行之间的鸿沟,使强大的数据分析变得对更广泛的人群开放。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。