Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks
本文介绍了一个开源框架,该框架证明了可本地部署的开源权重大型语言模型(具体为 31-35B 参数模型)能够在消费级硬件上有效地实现纵向数据准备任务的自动化,从而为涉及敏感个人数据的研究提供了一种符合治理规范的、替代云端 AI 的可行方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但在你甚至开始查看线索之前,你必须先花三个月的时间整理一个堆满了旧箱子、撕碎的笔记和错乱文件的杂乱阁楼。在科学领域——尤其是研究人们生活如何随时间变化的研究中——研究人员需要花费大量时间做这种“清理阁楼”的工作。他们必须处理来自调查问卷的原始数据、修正拼写错误、匹配不同年份的答案,并将混乱的代码转化为清晰的数字。这很枯燥,耗时极长,而且如果你犯了一个微小的错误,你的整个调查结论都可能出错。
最近,被称为“大语言模型”(LLMs)的智能计算机程序在自动编写代码完成此类清理工作方面已经变得非常出色。但问题在于:大多数这些超级智能的程序都住在云端,就像一座遥远的巨大图书馆。如果你正在研究关于真实人物的敏感信息(例如健康记录或私密调查答案),规则规定你不能将这些数据发送到遥远的云端图书馆。这就像是被禁止将你的日记寄给一个陌生人一样。因此,科学家们一直处于困境之中,无法使用这些有用的工具,因为他们不能离开自己安全的本地计算机。这篇论文提出了一个简单但棘手的疑问:我们能否构建一个完全运行在我们自己的计算机上、绝不向外发送数据的“智能助手”,并且依然能完美地完成清理研究数据的繁琐工作?
本文的作者决定通过为这些本地AI助手建立一个特殊的测试赛道来寻找答案。他们创建了一个“地面真值”(ground truth)数据集,这就像是一把万能钥匙或一份完美的标准答案,它是基于一项名为“Next Steps”的英国青少年长期追踪研究的真实数据构建的。他们将清理这些海量数据的庞大任务分解为20个具体的任务,例如结合不同年份的信息来确定一个人的职业史,或者计算一个人的身体质量指数(BMI)。然后,他们设置了一个“智能体”(agent)——一个由可以在普通消费级计算机(如高性能游戏笔记本电脑或高端Mac)上运行的开源模型驱动的小型AI机器人——并观察它尝试编写代码来清理数据。
结果非常令人振奋。表现最好的AI模型(它们规模较大且需要强大的硬件)成功完成了约87.9%的任务,使其“基本正确”,并且在无需任何人工帮助的情况下,仅凭一次尝试就完全完成了75%的任务。研究发现,这些本地模型在处理具有明确、通用定义的任务(如计算BMI或识别性别)时表现得极其出色。然而,在面对复杂的、特定于调查问卷的难题时,它们则显得有些吃力,比如理清复杂的住房情况,或是根据当年调查特定规则变化的收入类别。
至关重要的是,本文表明虽然AI正变得越来越优秀,但它尚未达到完美。研究人员发现,即使AI生成的数据在表面上看是正确的,细微的隐藏错误仍可能溜进来。例如,一个较弱的模型不小心将一个“缺失”代码替换成了“零”,这完全改变了关于收入的研究结果,将一个负面趋势扭转成了正面趋势。这表明,虽然这些本地AI工具强大到足以作为“编程副驾驶”来加速工作,但它们仍然需要人类研究员来检查它们的作业。论文得出结论:我们不需要为了寻求帮助而将敏感数据发送到云端;只要拥有合适的本地硬件和开源模型,我们就可以在保持数据安全和隐私的同时,利用AI来承担繁重的准备工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。