GEAR: Generative Expansion and Real Anchoring for Two-Stage Distillation of Tabular Foundation Models
该论文提出了 GEAR,一种模块化的两阶段蒸馏框架,通过结合合成查询扩展与真实数据重锚定,将资源密集型表格基础模型转换为适用于商用 CPU 的轻量级、高性能预测器,从而在准确性和效率方面较监督基准实现了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数据科学领域,信息通常以电子表格的形式呈现:行与列中的数字和类别,描述着从贷款申请到患者健康记录的一切。几十年来,在这些表格中寻找模式最可靠的方法是针对特定数据训练专门的计算机程序。这些程序通过实例学习,不断调整其内部设置,直到它们能够根据之前看到的模式来预测新一行的结果。然而,新一代的模型已经出现,其工作方式截然不同。这些“基础模型”并不学习固定的规则集,而是像一位全能专家一样,只需阅读提供的上下文,就能瞬间观察一张有标签的表格并预测接下来的情况。虽然这种方法极其强大且准确,但也付出了沉重的代价。为了进行预测,模型必须将整个原始表格保存在其内存中,并且每次都要对其进行处理,这既缓慢又昂贵,对于日常设备来说往往是无法实现的。
研究人员长期以来一直寻求一种既能保留这些强大专家的智能,又能摆脱其沉重负担的方法。目标是教给一个小型、快速且简单的计算机程序以模仿专家的行为,使其能够在不需要原始表格或庞大模型的情况下独立进行预测。一组科学家现在推出了一种名为 GEAR 的方法来解决这个问题。他们的方法并不试图强迫小程序一次性学会所有知识,而是将过程分为两个截然不同的步骤。首先,他们生成数千个看起来像真实数据的合成新数据点,并利用它们来教小程序如何思考专家。然后,他们将程序带回真实数据中进行微调,以确保其理解始终立足于现实。这个两步走的过程使得小程序能够在实际使用时无需再次见到专家,便能掌握专家的奥秘。
研究人员面临的核心挑战是,用于训练的真实数据往往非常有限。如果小程序只从它拥有的少量行数据中学习,它可能会错过专家所掌握的更广泛的模式。为了解决这个问题,团队的第一步涉及创建大量模仿现实世界结构的虚假新数据。他们将这些合成行输入给强大的专家模型,观察其预测结果,然后教小程序去模仿这些预测。这扩展了小程序的经验,使其能够在一个比仅靠真实数据更广泛的场景中进行练习。然而,仅仅依赖虚假数据是有风险的;小程序可能会在虚假数据上过度模仿专家,从而在面对混乱的实际记录时失败。
为了解决这个问题,研究人员增加了第二步,称之为“真实锚定”(real anchoring)。一旦小程序从合成数据中学习完毕,他们就会将其带回到真实的原始表格中。在这里,他们并不让程序简单地记忆答案。相反,他们使用了一种巧妙的技术,让程序从专家从未见过的模型数据中学习预测。这防止了程序依赖于它本应学习而非死记硬背的答案。通过将真实答案与专家的指导相结合,小程序可以纠正它在学习合成数据时产生的错误。其结果是一个既拥有合成训练带来的广泛经验,又具备现实世界精确度的模型。
团队在广泛的任务上测试了这种方法,从类似于“是或否”的二元选择到具有许多可能结果的复杂分类任务。他们发现,通过这种两步法训练的小程序比仅在真实数据上训练的小程序表现要好得多。在二元任务中,这种新方法比标准训练提高了近两个百分点,而在更复杂的任务中,仍获得了超过一个百分点的提升。即使研究人员使用了不同类型的小程序(包括工业界常用的决策树),这些改进依然成立。这些小模型不仅更准确,而且效率极高。在速度方面,新方法进行的预测比原始大型模型快了 57 到 2,866 倍。它还将预测所需的计算机内存减少了近三倍,使得这些强大的工具可以在标准计算机处理器上运行,而无需昂贵的专用硬件。
研究人员还探讨了究竟需要多少合成数据。他们发现,增加虚假数据确实在初期有所帮助,但仅限于一定限度内。一旦小程序看到了足够的合成示例,再增加数据并不会提高性能,如果虚假数据与真实世界不完全匹配,甚至会产生负面影响。这证实了第二步——回归真实数据——是至关重要的。如果没有这一步,小程序将困在合成数据的世界里,无法处理现实世界的细微差别。研究表明,仅仅延长训练时间或使用不同的预训练模型并不能产生同样的结果。将通过合成数据扩展训练范围与通过真实数据进行落地验证相结合,才是成功的关键。
这项工作证明,将大规模、依赖上下文的模型智能转化为轻量级、独立的工具,而不损失其大部分能力是可行的。该方法不要求小程序在预测时刻能够访问原始专家或训练数据。这为在对速度和隐私要求极高的环境下部署这些先进模型打开了大门,例如在移动设备或无法共享数据的安全环境中。研究人员展示了通过仔细平衡生成数据的使用与现实世界的验证,我们可以创造出既聪明又实用的模型。研究结果表明,未来强大的数据分析可能不在于构建更大的模型,而在于教导较小的模型如何像巨人一样思考——利用想象力与现实的结合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。