How Many Interviews Are Enough in a Software Engineering Study? Preliminary Findings on Sample Size and Saturation
本文通过分析 2016 年至 2025 年间发表的实证软件工程研究发现,访谈样本量通常在 13 到 24 名参与者之间,而对于样本充分性和饱和度的解释仍然报告得不一致,且往往依赖于隐性推理而非显性的方法论讨论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图为一个解开谜团的讨论组寻找最完美的规模。你需要的是一个由三位专家组成的精锐小队,还是一个由五十人组成的庞大军队?来自加拿大、美国和巴西的大学研究团队决定调查这个确切的问题,但他们看的不是解谜者,而是使用访谈法来研究人们如何构建技术以及如何与技术协作的软件工程师。
他们并不只是凭空猜测;他们对 2016 年至 2025 年间最重要的软件工程会议和期刊进行了一场数字“寻宝之旅”。他们筛选了数千篇论文,过滤掉噪音,最终找到了 429 项实际使用了访谈法的研究。这些研究总共采访了 7,444 人。
访谈的“金发姑娘”区间(适中区间)
当研究人员观察数据时,他们发现并没有一个单一的“魔力数字”来规定你需要采访多少人。这不像烤蛋糕那样必须使用恰好两个鸡蛋。相反,小组规模完全取决于你正在烹饪什么样的“食谱”。
然而,如果你必须选出一个最常见的规模,研究人员发现,对于大多数软件工程研究来说,“甜点位”(即最理想的区间)是在 13 到 24 名受访者之间。这是最频繁出现的范围,出现在他们研究的 152 篇论文中。
但这个范围也非常宽泛!
- 有的研究规模很小,只采访了一个人(就像是对某位黑客或特定经理进行的深度挖掘)。
- 有的研究规模很大,采访了超过 100 人。
- 平均每项研究采访了大约 17.35 人。
研究人员建议,如果你正在规划一项研究并需要一个起点,瞄准 13 到 24 这个范围可能是一个稳妥的选择,因为这也是其他研究人员普遍的做法。但他们非常明确:这并不是一条硬性规则。如果你研究的是一个超级专业化的群体(比如资深安全专家),而这些人很难找,那么只有少于 5 人的小组也是完全正常且可以接受的。
“停止信号”之谜
在访谈的世界里,有一个概念叫做饱和度(saturation)。把它想象成在往水桶里注水。你不断地注水(提问),直到水桶满了(没有新的信息/想法能再挤进去)为止。一旦达到那个点,你就停止。
研究人员发现,许多软件工程师在说明何时达到这个“水桶满盈”时刻时,表达得有些模糊。
- 好消息是: 大多数研究都解释了他们为什么选择这些人(例如“我们需要来自安全团队的人”或者“我们想看看不同类型的公司”)。
- 缺失的一环: 许多研究并没有清楚地解释他们何时决定停止采访。他们往往只是停止了,却没有说明:“好了,我们连续听到了同样的内容三次,所以我们完成了。”
研究人员注意到,关于这种“停止点”的清晰讨论主要出现在使用一种名为**扎根理论(grounded theory)**的特定方法的研究中。在其他类型的研究中,停止决策往往只是基于直觉,或者是基于实际限制(比如时间或资金耗尽),而不是基于严格的方法论规则。
这篇论文对什么说“不”
了解这篇论文没有说什么是非常重要的。
- 它并不是说规模较小的研究(例如只有 5 到 12 人的研究)不好或“太软弱”。研究人员认为,如果你有充分的理由(比如研究稀有的专家),规模较小的群体完全没问题。
- 它并不是说你必须使用特定数量的人才能成为一名“真正的”科学家。他们明确反对认为存在一个适用于每一个研究的通用数字的观点。
- 它并不声称已经永久解决了如何确定样本量的问题。相反,他们认为这些发现是初步的且是不断演进的。它们就像是地图的第一稿,展示了大致的地形,但也承诺未来会进行更多的探索。
总结
核心信息是,在软件工程领域,“正确”的访谈人数是一个灵活的概念。它取决于你在和谁交谈、他们有多难找,以及你想要学习什么。
研究人员建议,与其担心是否达到了某个“魔力数字”,科学家们应该更诚实地说明他们为什么选择该样本规模,以及他们是如何知道自己已经完成的。他们希望该领域能从僵化的规则转向清晰的解释,这样,一项针对 3 位专家的研究将因其深度而非仅仅是人数而被评判,而一项针对 50 人的研究则会因其广度而被评判。
目前,数据表明 13 到 24 是最常见的路径,但通往目标的旅程仍有许多不同的路线可供选择。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。