← 最新论文
🤖 machine learning

RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

本文介绍了 RAG-HAR+,这是一个面向人类活动识别(Human Activity Recognition)的成本优化、检索优先框架,该框架利用离线智能体来设计特定数据集的特征,并采用多数投票机制以在保持不同基准测试中具有竞争力的性能的同时,最大限度地减少大语言模型(LLM)的使用。

原作者: Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的身体就像一个繁忙的管弦乐队,而你手腕或衣服上的微型传感器就是指挥家,它们不断聆听着你步伐的节奏、手臂的摆动以及心跳的律动。这个被称为人类活动识别(Human Activity Recognition, HAR)的领域,是计算机学习如何区分你在慢跑、睡觉还是打字的方法。长期以来,教计算机这种能力的最佳方式是强迫它们记忆庞大的标记样本库,就像一名学生为了应付考试而死记硬背图书馆里的每一本书。但这既昂贵又缓慢,而且一旦更换了传感器或活动类型,系统就会失效。最近,出现了一个新想法:与其死记硬背,为什么不让计算机在巨大的数据库中“查找”相似的过往案例,并请一位超级聪明的 AI(即大语言模型,LLM)来协助判断正在发生什么?这就像拥有一位天才图书管理员,能够瞬间找到最相似的故事来帮你解开谜团。但即使是这种新方法也遇到了一个难题:每走一步都向这位天才图书管理员寻求帮助,速度太慢,成本太高,且需要持续的网络连接。

本文介绍了一种名为 RAG-HAR+ 的巧妙升级方案,它通过改变“何时”以及“如何”寻求帮助来解决这个问题。作者发现,之前的方法就像是在为每一个问题都打电话请教顾问,哪怕是那些简单的问题。RAG-HAR+ 更像是一个精明的侦探机构。首先,它在离线状态下使用 AI(在你开始运动之前)来设计一个更好的“归档系统”,为你的特定活动挑选出最重要的线索。然后,当你在运动时,系统会尝试仅通过查看数据库中最相似的过往案例来破解谜团。只有当线索令人困惑且数据库无法达成一致答案时,它才会调用昂贵的 AI 顾问。通过这种方式,该系统变得极其快速、廉价,并且即使在网络信号不佳的情况下也能正常工作,同时其准确度仍与旧的、更慢的方法不相上下。

问题所在:过度求助的侦探

想象你有一个超级聪明的 AI 助手,它通晓人类运动的一切知识。在原始系统(RAG-HAR)中,每当你迈出一步,系统就会停下来,向 AI 发送一条消息并询问:“我正在做什么?”AI 阅读消息,查看一些过往案例,然后做出回答。这虽然可行,但就像雇佣了一位世界闻名的侦探来解决每一个案件——无论是“谁偷了饼干?”还是“谁谋杀了管家?”。这既浪费了侦探的时间,也浪费了金钱。对于“偷饼干”这种小事,没必要请出侦探。此外,如果侦探在另一个国家(云端),你必须等待消息来回传输,这会让整个过程变得非常缓慢。

研究人员意识到,对于大多数步伐,如果能观察到正确的过往案例,答案是不言自明的。你不需要一个天才来告诉你走路看起来像走路;你只需要在数据库中找到几个其他的走路案例即可。旧系统的缺陷在于,它使用了一种“一刀切”的方式来描述动作,这有时会错过让某种活动变得独特的细微线索。

解决方案:智能归档系统与“歧义解析器”

RAG-HAR+ 通过两个主要技巧改变了游戏规则。

1. 离线“归档系统”设计者
在你开始锻炼之前,系统会利用 AI 进行一次性操作,为你的特定数据集设计一个定制的归档系统。你可以把这想象成 AI 扮演了一名图书管理员,它研究了你的图书馆后决定:“好吧,对于这批藏书,我应该按‘颜色’和‘作者’来分类,而不是按‘题材’和‘页数’。”AI 会观察成千上万种描述运动的方式(例如速度快慢、颠簸程度或节奏感),并选出最适合你特定传感器和活动的三个最优线索组。这只发生一次,且在离线状态下完成,因此不会影响你后续的运动速度。

2. “歧义解析器”(智能备选方案)
现在,当你正在运动时,系统不会立即调用 AI。相反,它会将你当前的运动转化为这些定制的线索,并在数据库中搜索前 10 个最相似的过往案例。

  • 多数票决制: 如果 10 个案例中有 8 个都说“你正在跑步”,系统就会直接判定“好的,你在跑步”,然后继续运行。无需 AI 介入!
  • 备选机制: 如果数据库感到困惑——例如,5 个案例说是“跑步”,另外 5 个说是“慢跑”——这时系统才会调用 AI。这个被称为“歧义解析器”的 AI 会观察这些令人困惑的线索和过往案例,从而做出最终的、明智的决策。

这意味着昂贵的 AI 仅在棘手、混乱的时刻才会被调用。对于简单、明显的时刻,系统依靠自身的运行,通过简单的数学计算来进行投票计数。

结果:速度、节省与智慧

研究人员在六个不同的数据集上测试了这个新系统,涵盖了从行走、跑步到复杂的工业组装任务。结果令人印象深刻:

  • 准确度: 新系统的活动识别能力与旧方法一样出色,甚至更好。在某些数据集上,准确度有了显著提升(例如,在 MHEALTH 数据集上,准确度从 96.91% 提升到了 98.35%)。
  • 成本节省: 由于停止了为每个样本都调用 AI,它减少了发送给 AI 的数据量达 89.3% 至 99.9%。在一种情况下(MHEALTH),在 666 个样本中,它竟然只调用了 1 次 AI!
  • 速度: 系统变得更快了。在 MHEALTH 数据集上,识别活动所需的时间从 18.25 秒 降至仅 0.41 秒。这意味着速度提升了超过 44 倍!即使是在最慢的数据集上,它也实现了约 5.7 倍 的提速。

这对未来意味着什么

论文还通过在真实智能手机上构建了一个原型来证明这不仅仅是一个理论。他们将其转化为了健身应用中的一个组件(Widget)。当他们在真实手机上进行测试时,提速效果更加显著——大约快了 15 倍——因为手机不再需要为了每一步都通过互联网与 AI 进行通信。

作者认为,这种方法是迈向开发随处可用、无需完美网络连接且运行成本低廉的智能健康与健身应用的重要一步。它证明了你并不需要对每一件小事都去请教“天才”;有时,一个聪明的归档系统和简单的投票计数就足够了。论文总结道,通过将 AI 的角色从一个持续在线的工作者转变为一个聪明的规划者和备份专家,我们可以让活动识别变得更便宜、更快速,并真正走向现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →