← 最新论文
📊 statistics

An integration of decision trees into latent class modeling with covariates

本文提出了一种将决策树集成到潜在类别分析中以建模协变量对类别归属影响的新颖方法论,为难以处理复杂交互作用和设定偏误的传统逻辑回归模型提供了一种具有可解释性的替代方案。

原作者: Johan Lyrvall, Felix Clouth

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Johan Lyrvall, Felix Clouth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

隐藏的群体与混乱的地图

想象你是一名正在试图破解谜团的侦探,但你的目标不是寻找单一的罪犯,而是试图寻找行为方式相似的隐藏群体。在统计学世界中,这被称为潜在类别分析(Latent Class Analysis)。你可以把它想象成一个神奇的显微镜,观察一堆数据——比如关于健康或习惯的调查回答——然后说:“啊!这些人并不只是随机分布的;他们属于一个‘高风险’俱乐部,而另一些人则属于‘低风险’俱乐部。”这些俱乐部是“潜在”的,意味着你无法直接看到它们,只能通过指向它们的线索(数据)来发现它们。

但棘手之处在于:一旦你找到了这些隐藏的俱乐部,你还想知道为什么某人最终会进入其中一个俱乐部而不是另一个。是因为年龄大吗?是因为吸烟吗?还是因为锻炼?通常,科学家会使用一种名为**逻辑回归模型(logistic model)*的标准工具来回答这个问题。把这个工具想象成一把直的、僵硬的尺子。它试图通过线性累加的方式来测量年龄、吸烟和锻炼的影响。如果世界是简单的,它表现得很好;但现实生活是混乱的。有时,变老本身并不重要,除非你同时也*在吸烟。有时,保持活跃只有在你是年轻人时才会有帮助。这些被称为“交互作用(interactions)”,而试图将它们强行塞进一把直尺中,往往会导致尺子折断,或者让数学计算变得极其复杂,以至于没人能理解结果。这正是 Johan Lyrvall 和 Felix Clouth 试图解决的难题。

数据中生长出的树

在他们的新论文中,Lyrvall 和 Clouth 提出了一个聪明的转折点:与其使用一把直尺来预测一个人属于哪个隐藏群体,不如使用决策树(decision tree)。你可能在“选择你的冒险故事”类书籍或电子游戏中见过这些。你从顶部开始,提出一个问题:“角色是否超过 60 岁?”如果是,就向右走;如果不是,就向左走。然后根据你落到的位置提出下一个问题。这是一个循序渐进的过程,最终导向一个答案。

作者建议直接在潜在类别分析内部构建这样一种树。与其去猜测年龄、性别和习惯之间复杂的组合关系,不如让计算机观察数据并询问:“哪一个单一的问题能最好地划分这些群体?”它可能会发现“年龄”是最重要的第一个问题。接着,对于“60 岁以下”的群体,它可能会问:“你是否经常运动?”对于“60 岁以上”的群体,它可能会问:“你是否吸烟?”这创建了一张能够自然处理那些混乱交互作用的地图,而无需写下成千上万个复杂的数学公式。

研究人员使用来自 4,546 名美国成年人的真实健康数据测试了这个想法。他们想看看能否预测谁属于“健康状况较差”组,谁属于“健康状况较好”组。首先,他们使用标准方法,根据八种不同的健康问题(如哮喘、心脏病或高血压)来定义这两个健康组。他们发现 63% 的人属于“健康状况较好”组,37% 的人属于“健康状况较差”组。

然后,他们让这棵新的决策树生长起来。树的起点是询问:“此人是否 60 岁或以上?”这是最佳的分裂点。

  • 如果你在 60 岁以下: 树会问:“你是否经常运动?”如果你经常运动,你属于“健康状况较差”组的概率仅为 10%。如果你不常运动,这一比例跳升至 17%。
  • 如果你在 60 岁或以上: 树变得更加具体。如果你经常运动,你处于“健康状况较差”组的概率为 73%。但如果你不常运动,情况则取决于你的性别和吸烟习惯。不常运动的老年女性风险最高,达到 85%。对于不常运动的老年男性,树再次进行了分裂:如果他们吸烟,风险为 78%;如果他们不吸烟,风险则为 63%。

作者发现,这种树状结构比传统的数学公式更容易阅读和理解。它清晰地展示了不同因素是如何结合在一起改变概率的。例如,它揭示了对于老年男性来说,吸烟似乎与较低的“健康状况较差”风险相关联。作者指出,这听起来很奇怪,但表明这可能是由于“幸存者偏差”(也许只有最健康的吸烟者才活到了高龄),或者是因为有些人觉得状态良好,觉得没必要戒烟。

论文指出,这种方法是一个强大的新工具。它不需要任何古怪的新假设;它只是使用了统计学家已经信任的标准数学工具,但将其排列成树状结构。作者承认,他们目前的版本最适合处理简单的“是或否”问题(二元数据),比如“你是否超过 60 岁?”或“你是否吸烟?”他们建议,未来的工作需要研究如何处理更复杂的问题,比如“你的确切年龄是多少?”或“你的收入是多少?”

他们还警告说,构建这些树有点像一步步攀登高山。计算机根据它当前所处的位置来选择下一步,而不一定是整个旅程中的最佳路径。这是决策树的一个常见特征,而非他们创造的新问题。为了确保树不会仅仅是在死记硬背数据(一个被称为“过拟合”的问题),他们测试了两种修剪树的方法:一种是基于分裂是否具有统计学意义(而非仅仅是随机运气),另一种是基于一个被称为 BIC 的评分,该评分在模型的拟合程度与简洁度之间取得了平衡。

简而言之,这篇论文提出了一种方法,让决策树引导我们穿过决定我们属于哪个隐藏群体的复杂因素网络。它将混乱的交互作用纠缠转化为清晰、循序渐进的路径,使研究人员更容易看到隐藏在数据中的故事。虽然这仍然是一个需要更多测试和扩展的新想法,但它提供了一种新鲜、直观的方式,让我们观察生活方式和习惯是如何塑造我们所属的群体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →