想象一下你正在经营着一个繁忙的厨房(一个 Scrum 团队),厨师、服务员和经理们齐心协力,旨在快速端出美味佳肴(软件项目)。你正在阅读的这篇论文就像是一份来自巴西 70 名厨房工作人员的成绩单,他们被问到一个问题:“你们是如何利用这些全新的、超级智能的 AI 助手(大语言模型,简称 LLM)来协助管理厨房的?”
以下是研究结果的故事,分为几个简单的部分:
1. 背景设定:谁在用 AI?
研究人员询问了 70 名巴西软件专业人士。大约一半的人(49 人)实际上在使用 Scrum 方法(即该厨房组织工作的方式)。在这些人中,有 33 人表示他们已经在利用 AI 助手(如 ChatGPT 或 Gemini)来协助处理管理任务。
这些人并非只是在玩闹的技术极客,而是严肃的使用者。
- 经验: 大多数人对 AI 非常熟悉。85% 的人表示自己是“中级”或“高级”用户。
- 习惯: 这已成为他们的日常工作。超过一半的人(52%)每天都会使用它,通常持续一到两个小时。
- 工具: 几乎所有人都在使用 ChatGPT,紧随其后的是 Gemini 和 Copilot。
2. 他们是如何使用的?(“做什么”)
论文发现,AI 被当作一个功能强大的副厨或智能笔记本在使用,但不是作为主厨。AI 协助完成特定任务,但重大决策仍由人类做出。
- 学习菜单(探索 Scrum): 这是最受欢迎的用途。人们利用 AI 来询问:“这条 Scrum 规则是如何运作的?”或者“你能解释一下这个概念吗?”这就像拥有了一本会说话的百科全书。
- 编写订单(交付物): AI 非常擅长书写。人们利用它来起草“产品待办事项”(构建清单)或完善“冲刺目标”。这就像 AI 是一个快速的打字员,帮助整理待办事项列表。
- 总结会议(事件): 在团队会议结束后,AI 帮助总结会议内容。它就像一名秘书,负责记录笔记并提炼重点。
- 他们尚未做的事: AI 很少被用于涉及团队“灵魂”的部分。人们对于让 AI 来决定“产品愿景”(项目的宏伟蓝图)或制定“工作协议”(团队如何对待彼此)仍持谨慎态度。这些工作需要人类的同理心和判断力,而目前的 AI 还无法胜任。
3. 好的一面(益处)
工作人员反馈称,AI 是一个巨大的效率提升工具。
- 速度: 78% 的人表示它提高了他们的生产力。
- 减少琐碎工作: 75% 的人表示它减少了枯燥、重复性的工作。
- 更好的笔记: 78% 的人表示他们书面文档(如需求文档)的质量得到了提升。
- 大脑减负: 它能帮助他们思考问题而不至于卡壳,扮演着“思考伙伴”的角色。
4. 坏的一面(风险与警告)
尽管 AI 非常有用,但工作人员也非常谨慎。他们将其视为一种需要人类监督的工具。
- “看似正确”的陷阱: 最大的抱怨(81%)在于 AI 给出的答案看起来很正确,但存在细微且危险的错误。这就像一个副厨,切菜切得完美无缺,却忘了洗菜。你必须检查每一项工作。
- 幻觉: 59% 的人表示 AI 有时会凭空捏造事实(幻觉)。
- 秘密: 63% 的人担心隐私问题。他们不想不小心将公司的机密数据粘贴到公开的 AI 对话框中。
- 信任问题: 由于 AI 的表现质量参差不齐,你不能仅仅让它掌控全局。你必须时刻盯着它。
5. 宏观结论
论文得出结论:巴西的 Scrum 团队将 AI 视为一个可靠但古怪的助手。
- 他们喜欢它用于: 写作、组织、学习和总结。
- 他们担心它用于: 做出战略决策、处理秘密或保证 100% 的准确性。
黄金法则: AI 是一个加速工作的优秀工具,但人类团队必须始终保持“主厨”的角色。他们需要检查 AI 的工作,保护秘密,并确保最终的决策是由人而非机器做出的。
简而言之: AI 是一个强大的新厨房小工具,能帮你干活更快,但在把食物端给顾客之前,你仍然需要亲自尝尝味道。
技术摘要:大语言模型在 Scrum 管理中的应用
问题陈述
尽管大语言模型(LLMs)已在技术性软件工程活动(如编码、测试、调试)中展现出显著影响,但关于其在 Scrum 管理活动中应用的实证证据仍然匮乏。敏捷管理本质上是知识密集型的,依赖于模糊性、协商、优先级排序和人类动态。现有的文献主要集中在技术任务上,或者局限于原型设计和教育场景。因此,组织在采用 LLM 进入管理领域时,存在基于“炒作”而非证据进行决策的风险,这可能导致过度依赖、偏见输出的传播、机密性泄露以及团队共同问责制的削弱。本研究通过调查软件专业人员目前如何将 LLM 融入其 Scrum 管理实践(特别是针对代表着庞大且快速增长市场的巴西软件行业),旨在填补这一空白。
研究方法
本研究采用了遵循软件工程调查系统指南(Wagner 等人)的基于调查的研究设计。
- 目标受众: 具有 Scrum 项目实际经验的专业人员。
- 抽样策略: 结合便利抽样和雪球抽样的非概率方法。招募通过 LinkedIn 敏捷社区、专业邮件列表以及学术/行业联系进行。
- 工具: 一个托管在 Google Forms 上的九部分调查问卷,围绕基于目标-问题-度量(GQM)框架衍生的四个研究问题(RQs)构建。该工具包括闭口问题(李克特量表、频率测量)和开放式问题。
- 数据收集: 调查于 2025 年 10 月至 11 月期间进行。
- 样本量: 70 名巴西专业人员完成了人口统计部分。其中,49 名在过去六个月内从事过 Scrum 项目,33 名表示在 Scrum 实践中积极使用基于 LLM 的助手。分析重点针对这 33 名活跃用户。
- 分析: 将定量分析(频率、百分比、均值)与定性编码(混合演绎-归纳方法)相结合,用于处理开放式响应。两名研究人员独立对子集进行编码以确保可靠性。
核心贡献
本文提供了对 LLM 在 Scrum 管理中使用的首次实证特征描述之一,提供了三个主要洞察:
- 绘制当前实践图谱: 详细分类了巴西专业人员如何在 Scrum 工件、事件和角色中应用 LLM。
- 量化感知收益: 识别了切实的价值领域,例如生产力提升和文档改进。
- 识别障碍与风险: 揭示了关键挑战,包括信任问题、机密性风险和不可靠的输出,这些对于指导负责任的采用至关重要。
结果
RQ1:知识水平与使用程度
- 熟练度: 用户群体相对成熟。在活跃用户中,85% 表示具有中级或高级熟练度(61% 为“合格”,21% 为“精通”)。
- 频率: 使用行为属于常规性而非探索性。52% 每天使用 LLM,18% 每周使用。
- 工具: 采用集中在主流生态系统中:ChatGPT (100%)、Gemini (82%) 和 Copilot Chat (67%)。
- 治理: 组织政策呈现碎片化;36% 的人报告没有政策,36% 有正式政策,45% 遵循既定流程,这表明采用过程主要由从业者驱动。
RQ2:在 Scrum 实践中的采用情况
LLM 主要被用作辅助认知工具,而非人类决策的替代品。采用强度因类别而异:
- 探索 Scrum: 最高采用率(65–85% 当前或计划使用)。从业者使用 LLM 来澄清概念、探索实践并寻找资源。
- 工件: 显著采用(72–87% 当前或计划使用)。在文本密集型任务方面接受度较高,如编写产品待办事项项目 (PBIs)、定义非功能性需求 (NFRs) 以及优化 Sprint 目标。
- 事件: 选择性采用。总结与综合(例如 Sprint 复盘反馈)较为常见 (64–68%),而解释性任务(如设计议程或识别阻碍因素)的采用率较低,因为这些任务需要语境细微差别。
- 其他管理任务: 谨慎采用 (20–50%)。从业者抵制将 LLM 用于驱动价值或涉及共识的活动,例如定义产品愿景或改进工作协议。
RQ3:感知收益
- 生产力与质量: 78% 的受访者提到提高了生产力和提升了工件质量。
- 减轻负担: 75% 的人报告在重复性任务中减少了手动工作量。
- 知识工作: 59% 指出改善了文档记录和知识共享;50% 报告支持决策制定。
- 角色差异: 开发人员报告的效用最高 (84%),其次是 Scrum Master (56%)。产品负责人 (PO) 的看法褒贬不一,反映了其职责的战略性质。
RQ4:风险与挑战
- 可靠性: 被引用最多的问题是接收到的输出**“几乎正确但不完全正确” (81%)**。59% 的人报告了幻觉现象,63% 认为输出质量具有高度变异性。
- 安全与伦理: 63% 对机密性和隐私表示担忧;56% 提到了法律和伦理的不确定性。
- 人类影响: 对于过度依赖可能侵蚀对 Scrum 流程理解(接近 30%)或模糊问责制(23%)存在中度担忧。
意义与主张
本文声称为理解 LLM 集成到敏捷管理中提供了实证基础,超越了理论推测。它强调,虽然 LLM 在处理文本密集型、分析型和探索型任务时是有效的“认知辅助工具”,但在战略性或共识驱动的 Scrum 活动中,它们尚未获得自主决策的信任。
作者强调,负责任的采用需要:
- 人类监督: 团队必须保留对协商、优先级排序和决策的掌控权,以防止问责制的削弱。
- 组织治理: 需要明确关于数据共享、内容验证和可接受用途的指南,以减轻机密性和法律风险。
- 批判性验证: 从业者应将 AI 输出视为需要验证的草稿,特别是考虑到“几乎正确”错误的高频发生。
研究结论认为,虽然 LLM 在效率和认知减负方面带来了明显的收益,但其在 Scrum 管理中的集成目前是一种人机混合工作流,其中人类元素在管理模糊性和确保共同意义方面仍然处于核心地位。建议未来的研究可以探讨随着这些工具的演进,团队学习和问责制发生的纵向变化。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。