A General Framework for Stability Assessment of Non-Deterministic Prediction Models
本文通过引入能够克服现有方法在处理单个测试对象及对数据组成敏感性方面局限性的基于数据和基于模型的稳定性度量,提出了一个用于量化非确定性预测模型在度量、分类及定序结果上稳定性的通用框架。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试预测天气。你向一位非常聪明的气象学家询问预报,他说:“明天会下雨。”但随后,你要求他使用完全相同的数据再次运行完全相同的计算,而这一次他说:“明天是晴天。”如果你问第三次,他可能会说:“也许会有小雨。”这并不是因为气象学家糊涂了,而是因为他们的大脑运作起来有点像老虎机。每当你拉动杠杆(运行模型)时,都会发生一次微小的、随机的旋转,从而稍微改变结果。在计算机科学领域,这被称为“非确定性”(non-deterministic)模型。这是一个高级说法,意思是指计算机使用了一点随机性来做出决策,这对于做出聪明的猜测其实是一件好事,但也带来了一个令人头疼的问题:如果每次询问时答案都在变化,你又该如何信任它呢?
这正是研究人员托马斯·马丁·兰格(Thomas Martin Lange)、阿明·奥托·施密特(Armin Otto Schmitt)和费利克斯·海因里希(Felix Heinrich)正在解决的难题。他们从事的是预测建模领域的工作,在这种领域中,计算机通过学习过去的数据来猜测未来的结果——比如农场会生长多少玉米、病人可能会病到什么程度,或者股市会如何变动。他们要解决的核心问题是“稳定性”。如果你构建了一个预测机器,每次开启时给出的答案都不一样,它还可靠吗?旧的检查可靠性的方法就像是通过观察一整袋硬币来测量单次抛硬币的稳定性。在某些情况下它们还算凑合,但当你只有一个东西可以预测(比如单个未来事件)或者当答案非常复杂(比如将事物按“极早”到“极晚”进行排序)时,这些方法就会失效。
本文作者构建了一个更灵活的新型“尺子”,用来衡量这些摇摆不定的预测机器到底有多稳。他们不仅找到了一把更好的尺子,还发明了两种使用它的新方法。第一种方法,他们称之为“基于数据的稳定性”(data-based stability),它在问:“与我们在训练数据中看到的答案的多样性相比,这个模型的答案波动了多少?”这就像是在检查一名飞镖选手投掷出的轨迹相对于整个飞镖盘的范围来说是否过于狂野。第二种方法,“基于模型的稳定性”(model-based stability),则提出了一个更深层的问题:“模型的内部逻辑波动了多少?”这就像是在检查一名飞镖选手的投掷轨迹相对于其个人平均水平来说是否过于狂野,而不管飞镖盘本身有多大。
研究人员利用一个数字游乐场测试了这些新尺子,他们在其中模拟了成千上万种场景。他们创建了用于作物产量或疾病评分等方面的伪造数据,然后反复运行他们的预测模型,同时改变“决策树”(模型的脑细胞)的数量,从几百个增加到一万个。他们发现这些新尺子表现得非常出色。不同于旧有的尺子在面对不平衡的测试数据(例如“晴天”比“雨天”多得多)或只有一个对象可预测时会变得混乱或给出奇怪的结果,新尺子保持了稳定。它们展示了一条清晰且平滑的曲线:随着你向模型中添加更多的“脑细胞”,预测结果变得更加稳定,就像向合唱团中增加更多人会让歌声听起来更加一致一样。
然而,论文也警告我们,并非所有的尺子都是平等的。在模拟实验中,他们发现旧的方法有时会撒谎。例如,如果一个模型对所有人预测的结果都一样(这是数据不平衡时常见的问题),旧的尺子会认为该模型是完美稳定的,即使该模型其实只是在偷懒。新的尺子识破了这一点,显示出模型之所以稳定是因为其具有一致性,但它是以一种符合数学逻辑的方式呈现的。他们还发现,当你拥有一个极小的测试组(比如只有两三个对象)时,旧的尺子会变得疯狂,上下剧烈跳动。而新的尺子,尤其是“基于模型的”那把,即使在面对极小的群体时也能保持冷静和可靠。
作者们并不仅仅停留在理论层面;他们还构建了一个名为“APS”的工具包,供任何使用 R 语言的人用来检查自己的模型。他们建议,虽然我们通常只关心模型是否“准确”(是否得到了正确答案?),但我们也应该关心它是否“稳定”(是否每次都能得到同样的正确答案?)。他们的工作表明,通过使用这些新的衡量标准,我们可以找到模型复杂度的“甜点区”(sweet spot)——即既能增加足够的复杂度使其变得聪明,又不至于让它变成一个神经质的混乱体。这提醒我们,在人工智能的世界里,一致性与正确性同样重要,而现在,我们终于有了一种更好的衡量方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。