← 最新论文
🤖 machine learning

TypiCore: A Hybrid Active Query Strategy for Class-Incremental Learning on Time Series

本文介绍了 TypiCore,一种用于时间序列类增量学习的新型混合主动查询策略,该策略通过在基于典型性和多样性的样本选择之间进行交替,来构建具有代表性的记忆缓冲池,从而在标签效率和性能方面实现了较现有方法的显著统计学提升,并以极小比例的标注预算达到了与全监督结果相匹配的效果。

原作者: Gabor Szucs, Samuel Jacsev, Marcell Nemeth, Davide Dalle Pezze, Gian Antonio Susto

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabor Szucs, Samuel Jacsev, Marcell Nemeth, Davide Dalle Pezze, Gian Antonio Susto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:用于时间序列主动类增量学习的 TypiCore

问题定义

本文研究了针对多元时间序列分类的主动类增量学习 (Active Class-Incremental Learning, ACIL)。这一设定结合了两个具有挑战性的约束:

  1. 类增量学习 (Class-Incremental Learning, CIL): 模型必须随时间顺序学习新类别,同时保留对所有先前已见类别的分类能力,且在推理阶段无法获取任务标识符。
  2. 有限的标注预算: 与标准 CIL 假设(数据流是完全标记的)不同,现实世界的时间序列应用(如医疗保健、工业监控)通常具有自动化的数据采集能力,但需要昂贵的、由专家驱动的人工标注。

核心挑战在于设计一种查询策略,从无标签样本中选择一小部分进行标注,使得生成的记忆缓冲池能够在严格的标注预算下,同时支持塑性(学习新类)和稳定性(保留旧知识)。

方法论

ACIL 框架

作者提出了一个集成了基于重放(rehearsal-based)的持续学习的主动类增量学习 (ACIL) 框架。每个任务 tt 的过程包括:

  • 初始化: 模型继承前一个任务的参数。
  • 主动学习周期: 将任务的无标签数据集 DtD_t 划分为 qq 个切片。模型执行 NaN_a 个周期,在每个周期中:
    1. 查询策略 (Query Strategy) 从当前的无标签池中选择一批样本 bb
    2. 专家(人类标注员)为这些样本提供标签。
    3. 模型在当前任务的累积已标记集合与来自前序任务的记忆检索批次 (memory retrieval batch) 上进行训练。
  • 记忆巩固 (Memory Consolidation): 在完成一个任务的所有周期后,使用新标记的数据更新记忆缓冲池,以为下一个任务做准备。

该框架评估了两种底层的重放机制:

  • 经验重放 (Experience Replay, ER): 使用均匀随机采样进行记忆检索,并使用水库采样 (reservoir sampling) 进行记忆更新。
  • ASER (Adversarial Shapley Value Experience Replay): 使用基于 Shapley 值的重要性驱动选择来进行检索和更新,以优先选择信息丰富的样本。

被评估的基准查询策略

论文系统地评估了三类查询策略:

  1. 基于不确定性的方法 (Uncertainty-Based): 选择模型最不确定的样本(熵、边际、最小置信度)。
  2. 分布感知(多样性)(Distribution-Aware/Diversity): Core-Set,利用贪心 k-中心算法来最大化特征空间的几何覆盖范围。
  3. 分布感知(典型性)(Distribution-Aware/Typicality): TypiClust,选择高密度、原型化的样本以确保代表性。

提出的方法:TypiCore

作者发现没有任何单一策略能在稳定性与塑性之间实现稳健的平衡。因此引入了 TypiCore,这是一种混合查询策略,它在单个任务内的多个主动学习周期中,在基于典型性的选择和基于多样性的选择之间进行交替:

  1. 初始化 (TypiClust): 新任务的第一周期从 TypiClust 开始。由于模型尚未见过新类别的标记样本(冷启动问题),选择具有原型性质的高密度样本可以提供一个稳定的基础。
  2. 交替 (Core-Set): 后续周期与 Core-Set 选择交替进行。这一步骤旨在识别能使特征空间几何覆盖最大化的样本,确保记忆缓冲池能够捕捉到多样化的区域和欠代表区域。

这种严格的交替确保了记忆缓冲池既是具有代表性的(捕捉类别的核心结构),又是具有多样性的(覆盖更广泛的特征空间),防止了记忆向狭窄的子集坍缩或仅由边界样本组成的风险。

关键结果

实验在 TSCIL 基准测试集上进行,包含四个多元时间序列数据集:UCI-HARUWaveGRABMyoWISDM

基准方法的表现

  • 基于不确定性的方法: 始终无法表现出优于随机选择的效果。在许多情况下(例如 GRABMyo 和 WISDM 上的熵方法),它们的表现显著低于随机基准,这表明专注于边界的样本选择并不符合基于重放学习在低预算下的需求。
  • 分布感知方法:
    • Core-Set: 实现了较高的塑性(学习准确率),但遭受了严重的灾难性遗忘(高平均遗忘率),因为记忆被填充了非典型的、靠近边界的样本。
    • TypiClust: 实现了高稳定性和低遗忘率,但在需要最优塑性时有时缺乏多样性,尤其是在与 ASER 机制结合时。

TypiCore 的表现

  • 优越性: TypiCore 在多个数据集上均实现了相对于所有基准方法的统计学显著提升。
  • 平衡的权衡: 它始终占据 塑性 vs. 稳定性 权衡图表的右上角区域,证明了它能够在不牺牲旧知识保留能力的情况下,有效地学习新任务。
  • 与全监督对比: 在多个数据集上,TypiCore 在仅使用极小比例可用标签(例如 1% 到 30% 的标注预算)的情况下,达到了甚至超过了全监督持续学习方法(后者拥有所有标签)的性能。
  • 与重放机制的交互: 一个一致的发现是,当结合主动学习策略时,ER(简单的随机重放)的表现优于 ASER(复杂的基于重要性驱动的重放),特别是在严苛的标注预算下。当标记池较小且在早期周期中可能不具代表性时,ASER 的复杂性显得不够稳健。

意义与主张

本文声称 TypiCore 为标签稀缺场景下的时间序列持续学习提供了一种新颖的解决方案。其意义在于:

  1. 揭示了标准策略的局限性: 研究表明,标准的基于不确定性的方法在 ACIL 设置中是有害的,且单一目标的分布感知方法(纯多样性或纯典型性)是不充分的。
  2. 混合策略的有效性: 证明了在典型性和多样性选择之间进行动态交替,可以创建既能抵御遗忘、又能捕捉数据复杂性的稳健记忆缓冲池。
  3. 实际应用价值: 该方法使得在显著降低标注成本的情况下,实现高性能的时间序列持续学习成为可能,这对于专家标注成为瓶颈的现实领域具有重要意义。

作者得出结论,智能的标签选择起到了一种隐式正则化的作用,过滤掉了可能导致学习过程不稳定的噪声或冗余样本;此外,简单的重放机制(ER)可能比复杂的价值驱动机制(ASER)更兼容主动学习的约束。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →