← 最新论文
📊 statistics

Factorial multistratum designs for building, optimising or evaluating multilevel interventions embedded in learning systems: A taxonomy of factorial cluster-randomised trial designs and their variants

本文借鉴农业和工业研究中的多层概念,为析因集群随机对照试验设计提出了一种全面的分类法,旨在对现有的临床案例进行分类,利用一个理论性的肥胖干预方案来阐释十种设计变体,并强调优化多层级医疗干预措施所面临的实际挑战。

原作者: REA Walwyn, EL Turner, B Copsey, B Goulao, R Foy, AA Montgomery, SG Gilmour, SH Richards

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: REA Walwyn, EL Turner, B Copsey, B Goulao, R Foy, AA Montgomery, SG Gilmour, SH Richards

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图烤出一个完美的蛋糕,但你不仅仅是在混合面粉和糖,你是在试图修复一整家面包店。你必须决定如何培训面包师、在菜单上放入哪些食谱,以及如何布置烤箱。但棘手的部分在于,你不能一次只测试一件事。如果你只改变烤箱温度,你可能会错过“面包师需要一种不同类型的围裙才能让蛋糕膨胀”这一事实。这就是医疗保健和教育领域中“复杂干预措施”(complex interventions)的世界。科学家们正试图解决大型且混乱的系统问题——比如医院、学校或整个社区——在这些系统中,许多不同的部分都在相互作用。为了做到这一点,他们使用了一种特殊的工具,叫做“随机对照试验”(randomised controlled trial),这就像是一个科学实验,通过抛硬币来决定谁获得哪种版本的帮助。但当你需要同时测试一个系统的许多部分时,而且这些部分属于不同的群体(比如学生在教室里,教室在学校里,学校在学区里),数学就会变得极其复杂。这就像是在解一个魔方,其中每一层都是不同的颜色和大小,而你必须弄清楚哪一次旋转能修复整个谜题,而不破坏其他部分。

这篇论文是一本解开这个魔方的指南。作者们是一个由统计学家和研究人员组成的团队,他们注意到,虽然科学家们几十年来一直在农业和工厂中使用这些复杂的、多层级的实验,但从事医学和社会研究的人往往会被专业术ole(jargon)搞糊涂。他们将这些设计称为“析因多层设计”(factorial multistratum designs),这听起来像是一串冗长的技术术语,但它基本上意味着在系统的不同层级上同时测试几件事。这篇论文并不是发明了一种新的灵丹妙药,也不声称已经解决了医疗保健中的所有问题。相反,它提出了一个新的、更清晰的“分类法”(taxonomy)——这是一个高级词汇,意为分类系统或地图——来帮助研究人员描述这些棘手的实验。通过观察44个现实世界的试验,并创造了一个关于应对学校儿童肥胖问题的理论案例,作者们建议了一种描述这些设计的方法标准。他们认为,如果我们使用这种共同语言,我们就能更好地理解如何构建、改进和测试那些在多个层级上同时起作用的干预措施,从个体患者一直到国家政策层面。

大局观:为什么我们需要一张应对混乱系统的地图

让我们从问题开始。想象你是一位试图阻止孩子们体重增加的校长。你可以只是告诉他们要吃得更好。但也许问题不仅仅在于孩子;也许是学校食堂、体育课,甚至是整个城镇设立的学区规则。一种“多层级干预措施”就是当你试图同时修复所有这些环节时。你可能会改变午餐菜单(针对学校)、培训老师(针对课堂),或者开展针对家长的宣传活动(针对社区)。

麻烦在于,你如何知道哪一部分真正起到了作用?孩子们体重减轻是因为新菜单、老师培训,还是因为那是一个阳光明媚的春天?在过去,科学家们可能会一次只测试一件事,就像一场平行赛跑,一组人得到菜单,另一组人什么也得不到。但这既缓慢又浪费。这就像是通过分别测试发动机、轮胎、然后是车漆来寻找最好的车,而不是看它们是如何协同工作的。

这就是“析因设计”(factorial design)。把这想象成一份超级高效的品鉴菜单。与其分别测试发动机和轮胎,不如同时测试四种组合:

  1. 旧发动机,旧轮胎。
  2. 新发动机,旧轮胎。
  3. 旧发动机,新轮胎。
  4. 新发动机,新轮胎。

这不仅能告诉你新发动机是否好用,还能告诉你新轮胎是否与新发动机配合得更好。这就是“多阶段优化策略”(Multiphase Optimisation Strategy,简称 MOST),这是一种流行的构建最佳干预措施的方法,以便在大规模推广前进行测试。

但在这里,事情变得混乱了。在一个简单的实验中,你为每个人抛一次硬币。在“集群随机对照试验”(cluster-randomised trial, CRT)中,你为整个群体抛硬币,比如一整个学校或一整个医院。为什么要这样做?因为如果你告诉学校里的一个孩子要吃沙拉,而下一个孩子要吃披萨,第一个孩子可能会直接去拿第二个孩子的披萨。为了避免这种“污染”(contamination),我们会对整个学校进行随机化。

现在,假设你想测试菜单(针对学校)以及老师培训(针对课堂)以及家长简报(针对学区)。你不能只抛一枚硬币。你必须为学区抛一枚硬币,为学校抛另一枚,再为教室抛一枚。这创造了一个“多层级”(multistratum)设计。这就像是一个俄罗斯套娃式的随机化过程。问题在于,研究这些设计的人(主要是农民和工厂管理者)使用一种医生和老师听不懂的“秘密语言”。教科书里全是农业案例,而不是医院案例。这篇论文的作用就是将这种秘密语言翻译成通俗易懂的英语。

论文的任务:建立一个通用翻译器

由 Rebecca Walwyn 领导的作者团队致力于创造一种用于这些复杂试验的共同语言。他们并没有仅仅坐在实验室里空想理论;他们研究了44个已经完成的真实临床试验。他们还基于一个现实世界的场景构建了一个“理论案例”:一项旨在减少学校儿童肥胖症的运动。

在他们的案例中,他们想象了一个拥有三个层级的系统:

  • 学区: 大老板。
  • 学校: 中层管理者。
  • 教室: 前线。

他们想要测试四个不同的“成分”(处理因子):

  1. 培训: 针对老师。
  2. 政策: 学区制定的规则。
  3. 菜单: 学校提供的食物。
  4. 活动: 体育课上发生的事情。

该论文的主要发现是,根据你如何抛硬币以及你在哪里应用你的成分,存在着 十种截然不同的方式 来安排这些实验。他们创建了一个“分类法”(即地图)来命名和描述这十种设计。

与其说“我们做了一个裂区设计”(split-plot thing),这听起来像是在园艺,他们提议使用一个清晰的三部分描述方法来描述每一次试验:

  1. 处理结构(Treatment Structure): 我们在测试什么?(例如,一个 2x2 设计意味着两个成分,每个成分有两个版本:“开启”或“关闭”)。
  2. 单元结构(Unit Structure): 谁参与了实验?它是一个层级结构(孩子在教室里,教室在学校里)还是一个时间周期与学校交叉混合的结构?
  3. 随机化设计(Randomisation Design): 我们是如何抛硬币的?我们是随机化了整个学校,还是仅随机化了学校内部的教室?

十种设计:实验室之旅

作者将各种可能性分为三个主要家族,并使用他们的肥胖症案例来展示其运作方式。

家族 1:层级设计(嵌套娃娃)
这些是最常见的。想象一个学校系统,孩子在教室里,教室在学校里,学校在学区里。

  • 设计 A(简单型): 你为整个学校抛一枚硬币。学校同时获得新菜单和新的教师培训。这是一个标准的“2x2”测试,但整个学校是基本单位。
  • 设计 B(裂区设计/Split-Plot): 这是最聪明的地方。你为学校抛一枚硬币来决定菜单。但是,在同一个学校内部,你为每个教室抛出另一枚硬币来决定教师培训。这就像是一个“裂区设计”。它很高效,因为你不需要为每一个教室都改变整个学校的菜单,但你仍然可以单独测试培训。
  • 设计 C & D(深度探索): 这些更加复杂。设计 C 增加了一个层级,即结果是在个体学生身上测量的,而不仅仅是教室。设计 D 增加了第三个成分(学区政策),并在顶层(学区)、中层(学校)和底层(教室)分别进行随机化。这是一个“裂裂区设计”(split-split-plot design)。它允许你准确看到系统的哪个层级在发挥主要作用。

家族 2:交叉分类设计(时间旅行者)
这些设计增加了一个转折点:时间。想象学校是相同的,但实验运行了12个月。

  • 设计 E: 学校接受一种处理(如一项新政策)并保持12个月。你每月测量一次孩子的情况。
  • 设计 F: 这是一个“交叉”(crossover)设计。学校先尝试处理 A 三个月,然后尝试处理 B 三个月,然后又是 A,然后又是 B。这就像是一个拉丁方阵舞会,每个学校都会随着时间的推移尝试每种组合。
  • 设计 G & H: 这些设计更加混杂。也许学区得到一项持续12个月的政策,但时间周期内每个月都有不同的培训。或者也许学校每月更换菜单,但学区政策保持不变。这被称为“条带设计”(strip-plot design)。它非常适合观察系统如何随时间“学习”。

家族 3:混合设计(终极混合体)
这些是重量级选手。它们结合了家族 1 的嵌套性和家族 2 的时间交叉性。

  • 设计 I & J: 想象一个系统,学区政策固定一年,但学校菜单每月更换,且教室活动每周更换。或者培训可能每月更换。这些设计允许研究人员在四个不同的层级上测试四个不同的成分,同时追踪系统如何学习和适应。

这篇论文说了什么(以及没说什么)

作者非常明确地说明了他们做了什么以及没有做什么。他们建议使用这种新语言会让研究人员更容易规划这些试验,并让统计学家更容易分析它们。他们发现已经存在 44 个符合这些类别的真实临床试验,证明了这些复杂的设计不仅仅是理论上的——它们目前正应用于初级保健、学校和医院中。

然而,论文并未声称这些设计总是最佳选择。事实上,他们强调了四个重大的实际挑战:

  1. 系统是混乱的: 真实的医院和学校并不是完美的盒子。它们会合并、拆分和改变规模。你无法总是获得完美的“平衡”实验。
  2. 污染(Contamination): 如果你将某种处理随机分配给一个教室,另一个教室的孩子可能会发现并模仿它。这种“溢出效应”可能会破坏实验,但有时它也是一件好事(比如疫苗保护了整个群体)。
  3. 携带效应(Carryover): 如果你在一月份测试了一种处理,然后在二月份切换到另一种,一月份的效果可能仍会影响到二月。这是基于时间的模型中的一个风险。
  4. 沟通: 向医生或学校校长解释为什么需要如此复杂的方案是很困难的。他们可能只想得到一个简单的答案。作者指出,让所有人达成共识需要耐心和清晰的沟通。

底线

这篇论文是一个工具包,而不是一根魔杖。它并没有告诉你要用哪种干预措施来阻止肥胖或治愈疾病。相反,它提供了一种让研究人员更好地提出问题的方法。通过提供一个包含十种不同方式的清晰地图,来描述这些多层级、多时间实验,作者们希望消除那些让这些强大的工具隐入阴影之中的“不透明语言”和困惑。

他们认为,如果我们使用这种共同语言,我们就能构建出更好的、能够量身定制以适应现实世界的干预措施,因为在现实世界中,问题并非孤立发生,而是会通过家庭、学校和社区产生连锁反应。论文指出,测试复杂干预措施的未来在于拥抱这种复杂性,而不是回避它。作者说,下一步是确定这些实验究竟需要多大规模以及如何分析数据,但就目前而言,我们已经有了地图。有了地图,即使是最纠缠不清的魔方也会变得可以解决。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →