From Trustworthy AI Principles to Verifiable System Requirements: A Multi-Stakeholder Engineering Framework for Clinical Decision Support Systems
本文提出了一个可复现的三阶段工程框架,该框架系统地将多方利益相关者的需求与监管约束转化为符合 ISO/IEC/IEEE 29148 标准及 FUTURE-AI 分类法的正式、可验证的系统需求,并通过在 AI4HF 项目中为一个高风险临床 AI 系统创建公开可用的需求语料库展示了这一过程。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医院中,一种新型工具正在成型:这种软件通过学习患者数据,在紧急情况发生前预测健康风险。这些通常被称为人工智能的系统,承诺帮助医生做出更快、更准确的决策。然而,在技术应有的宏伟理想与运行在服务器上的实际代码之间,存在着一道深刻的分歧。我们对于医疗人工智能必须具备公平、安全和可理解性有着广泛共识,但这些理念往往像“要善良”或“要诚实”一样模糊。如果没有一条清晰的桥梁,开发者可能会构建出技术上可行但无法满足人类护理严苛安全规则的系统,甚至可能构建出忽视其原本旨在服务的受助人群的系统。挑战不仅在于说明什么是正确的,还在于如何将机器必须如何表现以被视为“正确”这一行为,精确地书写下来,并使其具有可测试性和可验证性。
一组研究人员搭建了跨越这一分歧的桥梁。他们创建了一种循序渐进的方法,将医生、患者和监管机构那些模糊的愿景转化为一套严谨、可检查的软件指令清单。这项工作在一个旨在预测慢性心力衰竭患者风险的真实项目上进行了测试,在这种疾病中,一次错误的判断可能导致死亡。研究人员从六个不同的群体中收集了意见,包括患者本身、将使用该工具的医生、伦理学家以及法律专家。他们将会议中提出的担忧——例如患者担心计算机可能会区别对待自己与他人,或者医生需要了解预测是如何做出的——转化为软件工程师可以遵循的形式化语言。其结果是一份包含 173 条具体规则的文件。每条规则都以严格的格式编写,不留任何歧义,明确规定了系统“必须做”(must)什么、“应该做”(should)什么以及“可能做”(might)什么。至关重要的是,每一条规则都附带了一个定义的测试来证明其有效性,从而确保最终产品能够根据最初的安全与公平承诺得到验证。
该过程始于倾听相关人员的声音。在欧洲、南美洲和非洲举行的研讨会上,患者分享了他们的求医历程,而医生则描述了他们的日常工作流程。研究人员还研究了法律的硬性约束,例如将医疗人工智能归类为高风险等级的欧洲法规。他们将这些自下而上的故事与自上而下的法律要求相结合,创造了一个统一的需求清单。在将这些需求转化为代码之前,团队使用了一种共识方法来决定哪些是必要的,哪些是可选的。随后,他们应用了一套严格的工程标准来重写这些需求。与其说“系统应该是公平的”(这很难测试),他们写道:“无论临床医生是否依赖该预测,系统都应提供关于负责任决策的通知。”这种从模糊概念向具体行动的转变是其成就的核心。它将一个道德原则转化为一个功能性需求,使测试人员可以通过运行特定的检查来验证它。
在编写完这 173 条规则后,团队根据一个名为 FUTURE-AI 的全面可信人工智能框架对清单进行了检查。该框架将“可信度”的概念分解为三十个具体的子原则,涵盖了从数据隐私到系统如何解释其推理逻辑的所有方面。研究人员将他们的 173 条规则映射到这些原则上,以确保没有遗漏。他们发现,他们的清单覆盖了每一个子原则,证明了其方法能够捕捉问题的完整复杂性。规则的分布揭示了有趣的见解:虽然许多规则侧重于系统如何运作(功能性需求),但令人惊讶的是,有超过百分之四十的规则侧重于系统的质量,例如安全性、速度和处理错误的能力。这凸显了对于医疗人工智能而言,“非功能性”方面与计算本身同样关键。
研究人员还检查了他们计划如何证明每条规则得到满足。他们为每一个需求分配了特定的验证方法。对于大约一半的规则,证明将来自于真实的人员对系统进行测试,通过调查来观察解释是否易于理解或界面是否易于使用;而对于其他规则,证明将来自于自动化的检查,通过扫描代码来寻找安全漏洞或合规性问题。这种结合确保了系统不仅在技术上是健全的,而且在人类层面也是可接受的。团队发现,仅仅依赖自动化测试是不够的;信任的人文要素需要人类的验证。通过将每一条规则与一项测试配对,他们创建了一个不留猜测空间的蓝图。
这项工作并不声称已经解决了医疗人工智能中的所有问题,也不暗示编写这些规则是一件容易的事。研究人员承认,他们的方法是在一个针对心力衰竭的具体项目上进行的测试,将该方法应用于其他疾病或不同类型的人工智能将需要进一步的研究。他们还指出,将这些高层级的规则转化为实际计算机代码是一个独立的挑战。然而,他们已经证明,可以将来自多元化群体的复杂且往往相互冲突的声音以及法律的严格要求,编织成一套单一且连贯的指令。通过这样做,他们提供了一条可复制的路径供其他团队遵循,从而确保下一代医疗人工智能不仅是智能的,而且是安全的、公平的,并建立在可以被信任的基础之上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。