← 最新论文
🤖 machine learning

Attention-Guided Dual-Stream Learning for Group Engagement Recognition: Fusing Transformer-Encoded Motion Dynamics with Scene Context via Adaptive Gating

本文提出了名为 DualEngage 的双流框架,通过融合基于 Transformer 编码的个体运动动态与基于 3D ResNet 的场景上下文,利用自适应门控机制实现了从课堂视频中高精度的小组参与度识别。

原作者: Saniah Kayenat Chowdhury, Muhammad E. H. Chowdhury

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Saniah Kayenat Chowdhury, Muhammad E. H. Chowdhury

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种名为 DualEngage 的新系统,它的任务是通过监控教室里的视频,自动判断学生们在小组活动中是否“投入”(Engaged)

想象一下,你是一位老师,正在观察一个小组讨论。你不仅要看每个人在做什么,还要看整个小组的氛围。以前的方法要么只盯着某个学生的脸(容易受遮挡影响),要么只看整体画面(容易忽略细节)。DualEngage 就像是一个拥有**“双重视力”**的超级观察员,它同时用两种不同的方式来看待课堂。

我们可以把这篇论文的核心思想拆解成三个有趣的比喻:

1. 双重视力:微观与宏观的完美结合

DualEngage 系统有两个“眼睛”(也就是两个数据流),它们分工合作:

  • 第一只眼(微观视角):盯着每个人的“小动作”

    • 比喻:想象你手里拿着一个高倍放大镜,专门盯着每个学生的身体动作。
    • 怎么做:系统先找出每个学生,然后像拍“动作捕捉”一样,计算他们身体移动的光流(Optical Flow)。这不仅仅是看他们坐没坐好,而是看他们身体微小的晃动、点头、转身的速度。
    • 黑科技:它用了一种叫 Transformer 的“时间机器”来理解这些动作。就像你听一首歌,不仅听单个音符,还能听出旋律的起伏。这个系统能记住学生动作的时间顺序,知道他是“突然坐直了”还是“一直在发呆”。
    • 智能筛选:如果小组里有 5 个人,系统不会傻乎乎地把 5 个人的动作平均一下。它有一个**“注意力机制”,就像老师一样,会自动把注意力集中在那些动作最明显、最投入**的学生身上,忽略那些只是随大流的人。
  • 第二只眼(宏观视角):感受整个教室的“气场”

    • 比喻:想象你退后一步,站在教室后面,用广角镜头看整个房间。
    • 怎么做:它不看具体某个人,而是看整个视频片段的整体氛围。比如,大家是不是在同步转头?是不是整个小组都在热烈讨论?还是死气沉沉?
    • 黑科技:它使用了一个预训练的 3D ResNet 模型。这就像一个经验丰富的老教师,能一眼看出“这个小组的化学反应”是积极的还是消极的,哪怕它看不清每个人的脸。

2. 智能大脑:动态的“投票”机制

有了两只眼睛看到的画面,怎么决定最终结果呢?这里有一个非常聪明的**“智能门控融合”**(Softmax-gated fusion)。

  • 比喻:想象系统是一个聪明的裁判,手里有两张选票:一张是“动作票”(微观),一张是“氛围票”(宏观)。
  • 动态调整
    • 情况 A:如果某个学生动作很夸张(比如手舞足蹈),但整个小组很乱,系统会加重“动作票”的权重,因为细节很清晰。
    • 情况 B:如果大家都在安静地看书(动作很少),这时候“动作票”就没用了。系统就会自动把“氛围票”的权重调高,依靠整体画面的同步性来判断大家是否专注。
  • 结果:这种动态调整让系统非常灵活,不会因为某个学生没动就误判,也不会因为整体太吵就忽略细节。

3. 战果如何?

研究人员用中国海洋大学提供的真实教室数据集测试了这个系统。

  • 成绩:它的准确率高达 96.2%
  • 对比:如果只用“放大镜”(只看动作)或者只用“广角镜”(只看氛围),准确率都会跌到 50%-60% 左右。只有把两者结合起来,才能取得这么好的效果。

总结:为什么这很重要?

以前的方法就像是在盲人摸象:有的只摸到腿(只看脸),有的只摸到尾巴(只看整体)。
DualEngage 就像是一个全知全能的观察者

  1. 它知道每个人在做什么(通过光流和 Transformer)。
  2. 它知道大家在一起做什么(通过 3D 网络)。
  3. 它知道什么时候该听谁的(通过智能门控融合)。

这项技术可以帮助老师实时了解小组讨论的效果,自动识别哪些小组需要帮助,从而让教育变得更高效、更公平。虽然目前还需要强大的电脑显卡来运行,但它为未来的“智能课堂”打开了一扇新的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →