← 最新论文
💻 computer science

Ethics in Online Software Experimentation: A Body of Knowledge and the Cactus Model

本文通过建立一个包含16个因素、48个问题和53个解决方案的全面知识体系,并引入仙人掌模型(Cactus Model)来指导专家在实验规划过程中识别伦理疑虑、权衡取舍并证明决策合理性,从而探讨了在线软件实验中的伦理挑战。

原作者: Milene Elizabeth Rigolin Ferreira Lopes, Breno Bernard Nicolau de França

发布于 2026-09-28✓ Author reviewed ⓘ
📖 1 分钟阅读☕ 轻松阅读

原作者: Milene Elizabeth Rigolin Ferreira Lopes, Breno Bernard Nicolau de França

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,公司不断微调其软件,以使其变得更好、更快或更具吸引力。他们可能会改变按钮的颜色,重新排列菜单,或者测试一种新的显示价格的方式。为了观察这些变化是否奏效,他们经常进行所谓的在线实验。在这些测试中,真实的人在使用软件,但并不总是知道自己是研究的一部分。一种常见的方法是向一组用户展示版本 A 的功能,向另一组用户展示版本 B,然后比较他们的行为。这种方法有助于企业了解人们的需求,但也让普通用户处于一种其选择和数据被操纵以测试假设的情境中。虽然这种做法推动了创新,但也提出了一个隐蔽但严肃的问题:仅仅因为一家公司能够进行这些测试,他们就应该这样做吗?如果他们这样做,又该如何确保不伤害那些让软件成为可能的人们呢?

两位来自巴西的研究人员着手通过观察这种数字测试的伦理层面来回答这些问题。他们注意到,尽管许多公司都在进行这些实验,但关于公平对待人们的规则往往是模糊、零散或完全被忽视的。研究人员想要建立一个软件团队可以实际使用的清晰指南。他们不仅仅列出了关于对与错的抽象概念;相反,他们收集了实验过程中发生的具体问题,并将它们与解决问题的实际方法相匹配。他们的目标是创建一个模型(即“仙人掌模型”),帮助专家在启动任何测试之前,先思考其道德后果。

为了构建这个指南,研究人员查阅了广泛的现有资料。他们首先搜索了专门针对持续性与在线实验(如 A/B 测试)中伦理问题的研究,但发现相关的文献非常少。意识到仅靠这些论文无法解决如此宏大的问题,他们扩大了搜索范围。他们研究了来自人工智能、通用计算机科学甚至医学研究等相关领域的伦理规则。他们阅读了行为准则、技术指南和学术论文,以寻找共同的主题。从这海量的资料库中,他们确定了十六项关键的伦理原则,例如诚实、公平以及尊重个人的自主选择权。随后,他们进行了更深入的研究,发现了四十个在现实世界中违反这些原则的具体方式。例如,一种违规行为可能是向用户隐瞒测试的真实目的,或者是设计一个诱导人们做出对自己不利决定的系统。

在列出问题之后,研究人员找到了五十三种解决方法。他们并没有将这些方法仅仅作为一个随机列表;而是将它们全部连接在一起。他们展示了哪种特定的解决方案可以解决哪个特定的问题,以及该解决方案如何支持底层的伦理原则。这创建了一个结构化的知识图谱。这是一个工具,它会说:“如果你看到了这个问题,这里有你可以采取的具体行动,以及这里是你所保护的价值。”这个图谱是他们主要贡献的基础——一种被称为“仙人掌模型”(Cactus Model)的新型思维方式。

仙人掌模型旨在帮助负责这些实验的人员做出更好的决策。这个名字源于仙人掌的概念,即一种通过拥有保护层在恶劣条件下生存的坚韧植物。同样地,该模型为快速、高压的软件开发环境中的伦理决策提供了一个保护性结构。它不会告诉团队具体该做什么,但它提供了一种思考其选择之后果的循序渐进的方法。该模型由四个协同工作的层级组成。

第一层是关于仔细审视实验以发现潜在问题。团队会问:“可能会出什么问题?”他们使用伦理问题图谱来检查其设计。他们可能会询问测试是否透明、是否公平对待所有用户,或者是否尊重用户说“不”的自由。他们会对问题的发生可能性以及受影响的人数进行评估。这一步将模糊的担忧转化为具体、可识别的问题。

第二层是关于权衡后果。在这里,团队会审视发现的问题,并问:“为什么我们可能会想忽略它们?”通常,存在着商业层面的理由,比如节省时间或赚取更多利润,这些理由会诱使团队跳过伦理保障措施。该模型强制要求他们写下这种诱惑,然后将其与可能造成的伤害进行直接对比。他们会观察对用户信任、隐私和福祉的影响。这一步确保了决策的进行不仅仅是一种直觉,而是一种经过推理的选择,其中权衡过程是清晰可见的。

第三层是关于采取行动。一旦团队权衡了风险与收益,他们就会决定该怎么做。他们可以选择按原计划进行实验,也可以修改设计以修复问题,或者干脆取消实验。如果他们决定继续进行,模型会引导他们从图谱中挑选特定的解决方案来保护用户。例如,如果他们发现了不公平对待的风险,他们可能会增加一条规则以确保所有用户群体受到平等对待。这一步将他们的伦理推理转化为软件或测试流程中的具体改动。

最后一层是关于从经验中学习。实验结束后,团队会回顾所发生的情况。他们会审查自己做出的选择,并查看自己的预测是否正确。他们会记录下学到的经验,以便下次进行测试时能做得更好。这一步至关重要,因为它将单次实验转化为整个组织的教训,帮助他们在未来避免同样的错误。

研究人员用一个涉及某外卖应用想要测试不同定价策略的真实案例测试了这个模型。他们展示了一个团队如何利用该模型发现:为不同用户改变价格可能会让人感到不公平或困惑。通过遵循这些层级,团队意识到他们需要更诚实地说明价格是如何设定的,并确保脆弱用户不会被不公平地针对。随后,他们利用图谱中的具体解决方案调整了计划,增加了对用户的清晰解释,并为参与测试的人群设定了限制。这个例子表明,该模型不仅适用于单个测试,也适用于同时进行的系列测试,允许团队在无需每次都从头开始的情况下,将相同的伦理标准应用于许多不同的项目。

研究得出结论,虽然进行这些实验的工具很强大,但引导这些实验走向伦理的工具一直处于缺失状态。研究人员提供了一套知识体系和一种思维模型来填补这一空白。他们强调,这并不是一个能永远解决所有伦理困境的终极方案。相反,它是一个让“不可见”变为“可见”的起点。它为软件团队提供了一种可以用处理代码和数据的方式来讨论伦理的语言。通过使伦理推理过程变得清晰且结构化,该模型有助于确保创新的驱动力不会以牺牲技术使用者为代价。这项工作表明,有了正确的框架,公司可以在继续从用户身上学习的同时,依然给予他们应有的尊严和尊重。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →