想象一下,你是一名由两名建筑师组成的团队,正试图为一所大学设计一个新的、安全的自行车停车场。你有一份基本规则清单(例如“人们需要找到停车位”和“人们需要留下评价”),但你可以自由地确定具体细节。现在,想象你有一位超级聪明、语速极快的机器人助手,它能即时绘制蓝图并提出建议。
这正是本文中的研究人员所做的。他们观察了 18 对软件设计师执行类似任务:设计一个自行车停车应用程序。有些配对使用了机器人助手(大型语言模型,即 LLM),而有些则没有。目标并非考察机器人能否编写代码,而是观察当人类与机器人协作时,创造力在何处以及如何产生。
以下是他们的发现,分解为简单的概念:
1. 人类是“火花塞”
尽管机器人助手在场,但真正的创造力源自人类。将人类想象成乐队的指挥,而机器人则是一位能演奏你要求的任何音符的极速音乐家。
- 人类:他们利用过往经验、同理心(将自己想象成用户)以及类比(将应用程序与谷歌地图或 Yelp 等事物进行比较),提出了宏大而令人惊喜的创意。
- 机器人:它擅长在这些创意基础上进行扩展,或提出细微的新细节,但它很少能独自提出“巨大的飞跃”。
2. 机器人有时是“减速带”
机器人并不总是有帮助的。有时,它就像一个令人分心的导游。
- 好的一面:它能快速完成枯燥、重复的工作(如编写标准代码或列出基本功能)。这释放了人类的大脑,使其能够思考那些艰难的创造性问题。
- 坏的一面:有时,机器人会提出过于复杂的解决方案,或者让人类就他们已决定的事情争论不休。这就像一位导游,在你试图前往主要景点时,却不停停下来谈论一条小巷。这有时会扼杀创造力的流动。
3. “食谱”与“厨师”
研究人员注意到各团队使用机器人的方式有一个有趣的现象:
- “食谱”型团队:有些团队给机器人一份非常严格、详细的清单(就像一份严格的食谱)。机器人完美地遵循了食谱,但产出的菜肴枯燥且可预测。这些团队的创造力较少。
- “厨师”型团队:其他团队给机器人一个模糊、开放式的提示(例如“给我弄点酷的东西”)。这些团队更有可能获得令人惊喜的创意。
- 教训:如果你把机器人当作严格的计算器,它就会给出计算器的答案;如果你把它当作头脑风暴的伙伴,它可能会让你感到惊喜。
4. 即使不“刻意尝试”,创造力也会发生
研究人员并没有告诉参与者:“今天请发挥创造力。”他们只是说:“完成这个设计。”
- 结果:创造力在每一对参与者中自然涌现,即使他们并没有刻意追求创造力。
- 结果:18 对中有 13 对产出了至少包含一个“哇”因素(新颖、令人惊喜且有用)的最终设计。然而,机器人并不能保证这一点。有两对完全没有使用机器人的参与者仍然想出了富有创意的设计,而一些确实使用了机器人的配对却想出了枯燥的设计。
5. “迷你 C"与“大 C"创造力
该论文指出,他们观察到的创造力主要是“迷你 C"或“专业 C”(个人创造力或专业创造力)。
- 这意味着:设计师们提出了出色的、实用的改进(例如添加追踪自行车盗窃的功能,或加快应用程序的速度)。
- 这不是:他们没有提出“大 C"创造力(改变世界、突破性的发明)。机器人并没有突然发明一种关于自行车停车的全新思维方式;它只是帮助完善了当前的想法。
核心结论
将 LLM 视为工具箱中强大的工具,而非建造者本身。
- 人类是建造者,他们决定建造什么、如何解决难题,以及何时忽略工具。
- 机器人擅长递给你锤子或建议一种新型钉子,但如果你让它主导施工,你可能会建出一栋与街区上其他所有房子一模一样的房子。
为了获得最佳结果,该论文建议设计师要有意识地行动:利用机器人处理枯燥的事务,以便他们能专注于深度思考,但不要让它的首要建议阻碍他们探索其他更好的想法。
以下是论文《探索人机协作软件设计中的创造力》的详细技术摘要。
1. 问题陈述
尽管大型语言模型(LLM)在加速软件开发任务(如代码生成、调试)方面的能力已得到广泛研究,但在理解 LLM 如何影响软件工程中的协作创造力方面仍存在显著差距。软件设计本质上是一种创造性的问题解决活动,需要生成新颖、出人意料且具有价值的产物。作者探讨了 LLM 是作为创造力的催化剂,还是仅仅自动化了常规任务,从而可能通过将设计师锚定在常规解决方案上或导致无生产力的离题而阻碍创造过程。
研究问题: 在使用 LLM 进行设计时,创造力是如何以及在何处自然出现的?
2. 方法论
作者进行了一项受控实验室研究,模拟远程工作环境。
- 参与者: 18 对具有设计经验的软件专业人士(N=36,经验范围从 5 年到 20 年以上)。招募成对参与者以模仿现实世界的团队动态。
- 任务: 每对参与者有 90 分钟时间,根据产品需求文档(PRD)为“自行车停放应用程序”制作一份软件设计文档。PRD 包含了具体功能(例如:查找停车位、评论、导航),但为架构和功能扩展留出了空间。
- 条件:
- LLM 访问权限: 所有配对均可访问自定义 LLM 封装器(OpenAI 的 ChatGPT 3.5 Turbo),但不被要求必须使用它。
- 启动效应: 参与者未被指示要具有创造力;他们被告知设计将基于完整性进行评判。这确保了创造力的自然涌现,而非被强迫产生。
- 数据收集:
- 设计会话的屏幕录像和退出访谈。
- 最终设计文档。
- 所有 LLM 提示和响应的日志。
- 分析框架:
- 过程分析: 使用 Dorst 和 Cross 的**“创造性事件”**概念(即问题和解决方案空间通过“飞跃”或洞察共同演变的时刻)。
- 产物分析: 使用 Boden 的创造力定义:产物必须是新颖的、出人意料的且有价值的。
- 编码: 两名研究人员对转录稿和设计产物进行定性编码,以识别创造力的来源(人类发起 vs. LLM 辅助)。
3. 主要贡献
该论文为人机交互(HCI)和软件工程领域做出了三项主要贡献:
- 自然创造力的实证证据: 它证明了即使没有明确的启动提示,创造力也会在协作软件设计中自然涌现,既出现在设计过程中,也出现在最终产品中。
- 来源归因: 它提供了创造力来源的细粒度分类,区分了人类驱动的洞察(经验、同理心、类比)和 LLM 驱动的贡献(激发、阐述、提供)。
- LLM 的“双刃剑”效应: 它揭示了虽然 LLM 可以自动化常规工作以释放认知空间进行深度思考,但它们也可能通过引入复杂性、将设计师锚定在次优解决方案上或导致无生产力的离题而阻碍创造力。
4. 主要结果
A. 创造力的普遍性
- 过程: 创造力(以创造性事件的形式)存在于所有 18 对参与者中。
- 产物: 18 对中有 13 对制作了包含至少一个创造性元素(新颖、出人意料且有价值)的设计文档。
- LLM 使用情况: 两对未使用 LLM。三对使用它生成了整个设计。其余的将其用于特定任务(信息寻求、部分生成)。
B. 创造力的来源(“谁”和“如何”)
研究确定了创造性元素的8 个来源(论文中的表 1):
- 人类发起(主导):
- 先验知识/经验: 最常见的来源(例如,应用行业标准以确保安全性或可扩展性)。
- 同理心: 设计师将自己想象为用户(例如,添加“主屏幕固定”以便快速访问)。
- 类比: 将问题与现有应用程序(例如 Google Maps、Yelp)进行比较以解决设计挑战。
- 模糊性与潜在目标: 解释模糊的需求或关注根本问题而不仅仅是既定需求。
- LLM 辅助(少数):
- LLM 激发: LLM 的响应触发了新的人类想法(例如,建议 CDN 引发了性能洞察)。
- LLM 阐述: LLM 扩展了人类发起的想法(例如,充实成本指标)。
- LLM 提供: LLM 直接提出了新颖的想法(例如,内容审核)。
统计发现: 在最终设计中识别出的 29 个创造性元素中,15 个由人类发起,5 个由人机共同完成,9 个由 LLM 直接提供。人类特质(经验、同理心)是主要驱动力。
C. LLM 对设计过程的影响
- 积极影响: LLM 通常自动化了“样板”工作(例如 API 定义、数据模型),释放了认知空间,使设计师能够参与更深层次的问题解决和战略思考。
- 消极影响:
- 锚定效应: 设计师有时接受 LLM 的第一个解决方案而不探索替代方案。
- 离题: LLM 的响应偶尔会引发无生产力的讨论(例如,重新辩论已经解决的用户账户问题)。
- 过度复杂化: LLM 有时会建议过于复杂的架构(例如,混合多个云提供商),设计师不得不对其进行简化。
D. 产物创造力发现
- 新颖性 vs. 惊喜: LLM 生成的想法相对于 PRD 通常是“新颖”的,但很少是“出人意料的”或突破性的。它们往往是商品化功能(例如,标准的内容审核)。
- “固定需求”陷阱: 将完整 PRD 粘贴到 LLM 提示中的配对倾向于产生受限的、缺乏创造力的设计。相反,使用开放式提示或依赖自身判断的配对产生了更具创造性的结果。
- 非 LLM 成功: 有趣的是,未使用 LLM的两对参与者仍然制作了富有创造力的设计,证明了 LLM 的可用性并不能保证创造力。
5. 意义与启示
- 以人为本的创造力: 该研究重申,人类洞察仍然是软件设计的核心。LLM 充当人类创造力的放大器,而非替代品。
- 提示工程策略: 为了促进创造力,从业者应使用开放式、扩展性的提示,并尽量减少上下文,而不是僵化地向 LLM 输入详细需求。这可以防止 LLM 限制解决方案空间。
- 认知卸载: 使用 LLM 处理常规任务(样板代码、文档)是有益的,因为它创造了进行深度、创造性思考所需的“空间”。
- 批判性参与: 设计师必须对 LLM 输出保持批判态度,以避免锚定偏差和无生产力的离题。
- 未来工具: 作者建议需要构建基于 LLM 的“创造力支持工具”,这些工具专门设计用于鼓励对问题空间的探索、缓解设计固着并保持人类能动性。
结论:
该论文得出结论,虽然 LLM 可以通过生成新颖想法和阐述人类概念来支持协作软件设计,但它们本身并不能驱动高级创造力。最重要的创造性飞跃来自人类设计师利用经验、同理心和类比。有效整合 LLM 需要有意为之的参与策略,优先考虑人类能动性和批判性思维,而非被动接受 AI 建议。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。