Pose Grammar Based Deep Neural Network for 3D Human Pose Estimation
本文提出了 HEpose,一种利用并行线性层和残差层来有效地从 2D 关节位置估计 3D 人体姿态的混合深度学习框架,其准确度较基准方法提升了 50%。
2332 篇论文
本文提出了 HEpose,一种利用并行线性层和残差层来有效地从 2D 关节位置估计 3D 人体姿态的混合深度学习框架,其准确度较基准方法提升了 50%。
本文提出了一种资源高效的机器学习框架,该框架通过结合基于 Transformer 的语义分割与可解释的手工特征,仅利用 400 个样本即可从随手拍摄的智能手机图像中预测城市背景噪声水平,从而实现经过心理声学阈值验证的可扩展的公民科学驱动型声学监测。
本研究在求解非自治微分方程的物理信息神经网络框架内,对九种激活函数进行了实证评估,结果表明 GELU 是最稳健的选择,其在最小化残差损失方面的表现优于其他函数。
该论文提出了 LiteFocus-DEIM,这是一种轻量级上下文感知检测器,它通过集成门控注意力模块、自适应特征融合以及聚焦尺度流网络,能够有效地检测空中电力线路巡检中的小型及遮挡安全防护装备,并在自定义的 HAD 数据集和 VisDrone2019 基准测试上均实现了高精度与高效率。
本文提出了一种级联图卷积网络(CGCN),该网络利用运动感知层次邻接矩阵来动态建模关节相关性,并采用逐步级联架构来逐步对复杂度递增的动作进行分类,从而在多个数据集上实现了识别准确率与计算效率之间的卓越平衡。
本文介绍了 \method{},这是一种针对场景文本识别的无参数化 2D 旋转位置嵌入(Rotary Position Embedding)适配方法,它通过各向异性地分配维度以匹配文本长宽比,并将旋转耦合扩展到编码器-解码器交叉注意力机制,从而解决了现有方法的局限性,并显著提高了在弯曲、旋转及透视畸变文本布局上的准确率。
这项针对 142 项关于用于自动驾驶的 CNN、Transformer 及混合目标检测架构研究的 PRISMA 指导下的批判性综述,识别了现实世界部署证据方面的显著空白,并引入了 AVOD-DRF 框架,旨在实现基于运行就绪度而非仅基于基准性能的可复现、循证的目标检测器选择。
本文提出了一种类感知语义混合数据增强(CSHDA)框架,该框架通过向少数类有选择地应用多样化且经过语义验证的增强技术,有效地缓解了类别不平衡问题,并显著提升了多种基于 Transformer 的模型在不平衡情感分类任务上的性能与鲁棒性。
本文提出了一种通用先验正则化框架,该框架将精选的生物学知识整合到可微因果发现算法中,通过利用现有的领域先验,在基准方法难以处理的高维、小样本转录组数据中,显著提高了图恢复的准确性,从而稳定了学习过程。
本文介绍了一种完全开源、可通过 pip 安装的 CuPy 实现,该实现针对完整的 BM4D 体数据去噪算法,在无需 CUDA Toolkit 或构建步骤的情况下,实现了相比 CPU 参考版本高达 36.6 倍的加速,并保持了与原始方法完全一致的数值保真度。