Divide and Contrast: Learning Robust Temporal Features without Augmentation
本文介绍了 Divide and Contrast(Di-COT),这是一种高效的无监督时间序列表示学习框架,它通过在窗口内对比重叠子块来实现多项任务上的最先进性能,从而消除了对数据增强、多次编码器前向传播以及依赖序列长度计算的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人仅通过观看一个人移动的视频来识别不同的人类活动。通常,要想把机器人教得这么好,需要一位人类教师观看视频的每一秒,并说出“这是走路”、“这是跑步”、“这是摔倒”。这既昂贵又缓慢,因为它需要大量的人工标注。
本文介绍了一种名为Di-COT(分而治之与对比)的新方法,它无需人类教师、无需使用棘手的“技巧”来伪造数据,也无需耗费漫长时间进行训练,就能教会机器人。
以下是其工作原理,分解为简单的概念:
1. 当前方法的问题
大多数现有的时间序列数据(如心跳、股票价格或运动传感器数据)人工智能方法试图通过以下方式学习:
- 数据增强:它们将视频模糊化、加速或上下翻转,以创建“伪造”版本,然后尝试教导人工智能,使其认为原始版本和伪造版本是相同的。作者认为,这就像教一个孩子认狗,方法是给他们看戴着帽子的狗、被涂成蓝色的狗以及倒立的狗。这种方法虽然有效,但杂乱无章且计算负担沉重。
- 逐步比较:一些方法将视频的每一秒与下一秒进行比较。本文认为,这就像试图通过比较每一个字母与其紧邻的字母来学习一个故事。如果故事从“猫坐着”变成了“狗跑了”,将“猫”中的't'与“狗”中的'd'进行比较是没有意义的。这会造成混淆。
2. Di-COT 解决方案:“分而治之与对比”
Di-COT 不使用观察整个视频或每一秒的方法,而是采用“分而治之与对比”策略。
类比:拼图块方法
想象你有一条长长的电影胶片条(即时间序列数据)。
- 旧方法:你一次性查看整条胶片,或者单独查看每一帧。
- Di-COT 方法:你拿一把剪刀,将胶片剪成几个重叠的拼图块(子块)。
- 你不是将它们完美地切成两半,而是让它们稍微重叠,就像洗牌一样。
- 然后你问人工智能:“如果我给你看这个拼图块,来自同一条电影胶片的哪个其他拼图块紧接在它之前?”
为什么这更好?
- 无需伪造数据:人工智能从真实的电影胶片中学习,而不是从模糊或翻转的版本中学习。
- 避免混淆:通过使用拼图块(时间块)而不是单帧(秒),人工智能学习到了上下文。它理解一个“走路”片段后面跟着另一个“走路”片段,而不是被两个步伐之间的微小过渡所迷惑。
- 速度:因为它只将这些少数拼图块相互比较,数学运算要简单得多,速度也更快。这就像比较 5 个拼图块,而不是比较 1,000 个单独的像素。
3. 人工智能如何学习(游戏)
人工智能玩一个“猜前驱”的游戏。
- 它取一段数据,将其切成 5 到 10 个重叠的块。
- 它查看第 3 块,并问:“哪个块紧接在你之前?”
- 它猜测是第 2 块。
- 如果猜对了,就得一分。如果猜的是第 5 块或第 1 块,它就意识到自己错了并加以学习。
通过玩数百万次这个游戏,人工智能学会构建一张心理地图,其中相似的活动(如“跑步”)被归为一组,而不同的活动则相距甚远,整个过程无需被告知“这是跑步”。
4. 结果:快速且准确
作者在六个巨大的真实世界数据集(如心脏监测仪、睡眠追踪器和活动传感器)以及许多较小的基准测试上测试了这种方法。
- 竞赛:他们将 Di-COT 与其他顶级人工智能方法进行了比较。
- 获胜者:Di-COT 赢得了竞赛。它在识别活动和将相似数据聚类方面取得了最高的准确率。
- 速度:它是最快的。其训练时间仅为其他方法所需时间的一小部分。
- 类比:如果其他方法像是背着沉重背包(进行额外的数学运算和伪造数据)的马拉松选手,那么 Di-COT 就是背着轻便背包的短跑选手,在保持完美跑姿的同时率先冲过终点线。
5. 为什么这很重要(根据论文)
论文声称,Di-COT 解决了一个主要的权衡问题。通常,你必须在以下两者之间做出选择:
- 高准确率(但耗时很长,需要大量计算能力)。
- 快速度(但人工智能不够聪明)。
Di-COT 声称两者兼得。它学习“鲁棒”特征(意味着它理解数据的核心含义,而不仅仅是噪声),而无需被喂食伪造数据或在计算机上运行多次。
总结:
Di-COT 是一种教计算机理解基于时间的数据(如运动或心跳)的新方法。它不使用技巧,也不查看每一个微小的细节,而是将数据切成重叠的块,并玩一个简单的“之前是什么?”游戏。这使得人工智能比以往的方法更聪明、更快、更高效,而且完全不需要人类来标注数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。