这篇论文就像是一份**“科学家使用 AI 写代码的体检报告”**。
想象一下,现代科学家(无论是研究生物、物理还是社会学的)现在都得像程序员一样写代码来处理数据。但很多科学家并没有受过专业的编程训练,就像让一个擅长做菜的厨师突然去修汽车引擎,虽然能凑合,但心里没底。
这时候,生成式 AI(比如 ChatGPT) 出现了,它像个“超级助手”,能帮科学家自动生成代码。这篇研究调查了 868 位这样的“科学家程序员”,看看他们怎么用这个助手,以及他们觉得自己变得多高效。
以下是用大白话和比喻总结的核心发现:
1. 谁最爱用这个“超级助手”?
- 新手和年轻学生是主力军: 就像刚学开车的人最喜欢用“自动驾驶”功能一样,编程经验越少的科学家,越依赖 AI。
- 老手反而比较克制: 那些编程经验丰富的“老司机”,使用频率反而低一些。
- 领域差异大: 搞计算机和信息技术的人用得最多,而搞生物、社科的人用得相对少一些。
2. 大家喜欢用什么工具?
- 大家都爱“聊天”: 绝大多数科学家(超过 75%)喜欢用通用的聊天机器人(如 ChatGPT),就像在微信里找人聊天一样,直接问问题、要代码。
- 专业工具遇冷: 只有少数人(约 15%)使用专门为程序员设计的工具(如 GitHub Copilot),这些工具像插在 IDE 里的插件,更专业但门槛稍高。
- 原因很简单: 聊天界面更自然,大家觉得“问它”比“在代码里点插件”更顺手。
3. 真的变高效了吗?(核心发现)
这是论文最有趣也最让人警惕的部分。研究发现,觉得自己“效率爆棚”的人,往往也是风险最高的人。
- “越不懂,越觉得爽”: 编程经验越少、平时越不写测试代码、越不找同事审查代码的科学家,越觉得自己用 AI 后效率提高了。
- 比喻: 就像一个刚学做饭的人,用了“自动炒菜机”觉得太神了,因为以前连火都点不着;而一个老厨师知道自动炒菜机可能会把菜炒糊,所以反而觉得“也就那样”。
- “吞下多少代码”是关键指标: 研究发现,一次接受 AI 生成的代码行数越多,科学家越觉得自己高效。
- 比喻: 这就像有人觉得“我一次能吞下 10 个包子,所以我吃饭效率真高”。但问题是,你吞下去的包子,有没有嚼碎消化(检查代码)?
- 论文指出,很多科学家可能把“生成代码的速度”误当成了“产出成果的质量”。他们可能直接复制粘贴了一大堆 AI 生成的代码,却没时间仔细检查里面有没有逻辑错误。
4. 为什么有人拒绝用 AI?
对于那些拒绝使用 AI 的科学家,研究问了他们为什么。主要有五大理由:
- 怕变“废”了(自我依赖): “如果我让 AI 帮我写,我就学不到真本事了,以后离开 AI 我就不会干活了。”
- 道德担忧: 担心 AI 训练过程破坏环境,或者觉得 AI 公司偷了别人的代码,心里过意不去。
- 没必要: “我的代码很简单,自己写也就几分钟,用 AI 反而麻烦。”
- 太慢/太笨: “我让 AI 写个代码,结果全是错,我花更多时间去修 bug,还不如自己写。”
- 不准: "AI 经常胡说八道(幻觉),给出的代码根本跑不通。”
5. 总结与警示
这篇论文想告诉我们一个**“甜蜜的陷阱”**:
生成式 AI 确实能让科学家(尤其是新手)更快地写出代码,让他们感觉生产力爆棚。但是,这种“高效”可能是虚假的。
- 风险在于: 如果科学家只关注“生成了多少代码”,而忽略了“验证了多少代码”,那么科学研究的根基可能会动摇。就像盖房子,如果砖头砌得再快,但没检查砖头是不是裂的,房子迟早会塌。
- 建议: 科学家在使用 AI 时,不能只做“搬运工”,必须做“质检员”。特别是那些编程经验不足的人,更需要建立**“检查机制”**(比如写测试代码、找人审查),否则可能会因为过度依赖 AI 而陷入“以为自己懂了,其实一塌糊涂”的幻觉中。
一句话总结: AI 是个很好的“副驾驶”,但如果你完全把方向盘交给它,自己连看都不看路,那这辆车开得越快,离悬崖可能就越近。
这是一份关于《科学家编程中生成式 AI 的采用与感知生产力调查》(A survey of generative AI adoption and perceived productivity among scientists who program)的详细技术总结。
1. 研究背景与问题 (Problem)
现代科学研究高度依赖编程,但大多数科学家缺乏足够的软件开发培训。生成式人工智能(GenAI)工具(如代码生成模型)的出现被视为一种潜在的变革力量,但也带来了风险:
- 过度依赖风险:用户可能不加批判地接受生成的代码,导致概念理解、代码阅读和调试能力下降。
- 验证缺失:科学软件历史上就存在验证不足的问题,GenAI 生成的代码若缺乏严格审查,可能导致科学结论错误甚至误导研究方向。
- 数据空白:尽管 GenAI 在软件开发领域影响巨大,但关于科学家群体在科研编程中采用 GenAI 的模式、工具偏好及其对感知生产力影响的数据非常匮乏。
本研究旨在回答三个核心问题:
- 科学家在科研编程中采用 GenAI 的普遍程度如何?偏好哪些工具?
- 哪些因素(如经验、开发实践)与使用 GenAI 的感知生产力相关?
- 为什么部分科学家拒绝使用 GenAI 进行编程?
2. 研究方法 (Methodology)
- 调查对象与样本:
- 通过专业网络(如 US-RSE、pyOpenSci 等)和定向邮件列表招募。
- 最终有效样本量为 868 名 从事科研编程的科学家。
- 样本特征:以早期职业研究者为主(33% 为研究生研究助理),主要集中在美国高校,涵盖生命科学、工程、社会科学等多个领域。
- 调查设计:
- 使用 Qualtrics 平台进行匿名调查,耗时约 10-15 分钟。
- 核心模块:
- 人口统计学:职位、研究领域、编程年限。
- 开发实践:版本控制、代码测试、代码审查、持续集成的熟悉度与使用频率。
- GenAI 体验:工具选择、使用频率、主要工具。
- 感知生产力:改编自 SPACE 模型(Satisfaction, Performance, Activity, Communication, Efficiency)的量表,包含 9 个陈述项,采用 5 点李克特量表。
- 非采用原因:针对未使用 GenAI 的受访者进行开放式文本分析。
- 数据分析:
- 定量分析:使用 R 语言进行相关性分析、线性回归模型(检验经验、开发实践与感知生产力的关系)。
- 定性分析:对 210 份非采用原因的开放式回答进行主题编码(Thematic Coding)。
3. 关键贡献 (Key Contributions)
- 填补了特定人群的数据空白:提供了首个针对“科研编程人员”这一特定群体的大规模 GenAI 采用与生产力感知的实证数据。
- 揭示了工具偏好差异:发现科学家更倾向于使用通用对话式工具(如 ChatGPT),而非专为开发者设计的工具(如 GitHub Copilot)。
- 量化了“感知生产力”的驱动因素:识别出编程经验不足、缺乏标准开发实践(如测试、审查)与高感知生产力之间的关联,并提出了“代码生成量”作为最强预测因子的发现。
- 揭示了非采用者的深层动机:系统归纳了科学家拒绝 GenAI 的伦理、技能发展和准确性担忧。
4. 主要研究结果 (Results)
4.1 采用模式与工具偏好
- 采用率:大多数受访者至少尝试过 GenAI,但高频使用(“总是”或“大部分时间”)的比例约为 30%-40%。
- 人群差异:
- 学生和低经验程序员采用率最高。
- 计算机科学领域的采用率显著高于其他领域。
- 性别差异:女性报告的使用频率低于男性(部分原因是女性尝试后放弃的比例较高)。
- 工具偏好:
- 压倒性偏好通用工具:64.2% 的首选工具是 ChatGPT,其次是 GitHub Copilot (11.7%)。
- 访问方式:77.5% 的用户通过网页浏览器使用通用聊天工具,仅 14.4% 使用集成在 IDE 中的专用开发工具。
- 原因:通用工具更易上手,且符合科学家现有的工作流;专用工具用户通常具有更长的编程经验(中位数 9 年 vs 6 年)。
4.2 感知生产力与影响因素
- 总体感知:使用 GenAI 的受访者普遍报告较高的感知生产力(平均分 3.9/5)。
- 核心发现:
- 经验与生产力呈负相关:编程经验越少,感知生产力越高。
- 开发实践与生产力呈负相关:较少使用代码测试、审查和版本控制等标准开发实践的受访者,感知生产力更高。
- 交互作用:在缺乏开发实践的环境中,经验对感知生产力的负面影响更为显著。这表明正式的开发实践可能部分弥补了经验不足带来的风险,或者反过来,缺乏这些实践的人更倾向于高估 GenAI 带来的收益。
- 最强预测因子:
- 单次接受的代码行数是感知生产力的最强预测指标(r=0.31)。
- 接受生成代码行数越多(尤其是 >100 行),报告的感知生产力越高。
- 推论:科学家可能通过“生成的代码量”而非“代码的验证质量”来衡量生产力。
4.3 非采用原因 (定性分析)
针对 210 份非采用/放弃使用的回答,归纳出五大主题:
- 自我依赖 (Self-Reliance, 21.4%):担心 AI 阻碍编程技能的习得和深入理解。
- 伦理担忧 (Ethics, 21.4%):包括环境影响(训练能耗)、版权侵犯、数据隐私以及对 AI 公司商业道德的不信任。
- 无需求 (No Demand, 20%):现有工作流已足够,代码过于简单或熟悉,无需 AI。
- 低效 (Inefficiency, 19.5%):调试 AI 生成的错误代码比直接写代码更耗时。
- 准确性问题 (Accuracy, 19%):生成的代码充满 Bug 或幻觉,不可靠。
5. 意义与讨论 (Significance & Discussion)
- 潜在风险:研究结果表明,科学界可能存在自动化偏见(Automation Bias)。缺乏经验且缺乏标准开发实践(如测试、审查)的科学家,可能因为过度依赖 GenAI 生成的代码而忽视了验证工作,从而增加科学软件出现严重错误的风险。
- 生产力定义的偏差:科学家似乎倾向于用“产出速度”(代码行数)而非“产出质量”来定义生产力。如果缺乏补偿性的验证机制,这种生产力的提升可能是虚假的。
- 工具生态的隐患:科学界过度依赖闭源的通用聊天工具(如 ChatGPT),而非专为软件工程设计的工具。这可能导致科学家无法利用 AI 在代码审查、重构等高级功能上的潜力,同时也带来了机构层面的依赖风险(数据隐私、供应商锁定)。
- 未来方向:
- 需要开发针对科学家的 GenAI 工具,强调验证和可解释性。
- 在科研教育中加强软件开发实践(测试、审查)的培训,以平衡 GenAI 带来的效率提升与质量风险。
- 未来的研究应关注 GenAI 对科学软件实际质量(而非感知质量)的影响。
总结:该研究揭示了 GenAI 在科学编程领域的快速渗透,但也发出了警示:在缺乏适当开发实践和批判性思维的情况下,GenAI 可能通过“幻觉”和“过度自信”损害科学研究的严谨性。科学家需要重新审视如何平衡生成式 AI 带来的效率与科学验证的必要性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。