Cry2Vec: Self-Supervised Pre-training for Infant Cry Recognition
该论文提出了 Cry2Vec,这是一种利用优化的 HuBERT 架构和包含 300 万个无标签婴儿哭声的大规模数据集实现的自监督模型,旨在实现最先进的哭声识别性能,并证明了其在边缘侧部署的可行性。
939 篇论文
该论文提出了 Cry2Vec,这是一种利用优化的 HuBERT 架构和包含 300 万个无标签婴儿哭声的大规模数据集实现的自监督模型,旨在实现最先进的哭声识别性能,并证明了其在边缘侧部署的可行性。
本文提出了一种基于轻量化 YOLOv11n-OBB 的检测方法,该方法通过采用具有 GhostConv_OBB 和 C3k2_GhostConv_OBB 模块的外科精度替换策略,实现了面向边缘设备的高精度、实时螺蛳粉外包装检测,同时在准确率和效率方面显著优于基准模型。
本研究引入了可解释性一致性指数(EAI),这是一种量化慢性创伤诊断中 AI 生成的解释与临床医生推理之间一致性的新颖指标,揭示了尽管当前的 AI 模型具有极高的分类准确率,但往往缺乏临床信任所需的解释性。
该论文提出了 PMDA-Net,一种渐进式多级动态注意力网络,通过具有特征校准、跨尺度交互、密度感知注意力和前景引导优化等新颖架构的设计,增强了人群计数在应对尺度变化、遮挡和背景噪声方面的准确性与鲁棒性。
本文提出了一种超紧凑型两阶段设备端音频级联架构,该架构利用轻量化 2D CNN 进行打鼾检测,并利用改进的坐标注意力机制进行睡眠呼吸暂停事件分类,在实现高准确度的同时,与基准模型相比实现了 93.2% 的参数量缩减。
本文提出了一种系统性的概念框架和算法扩展,用于时空制图概括,该框架通过整合时间特征来保留有意义的变化事件并确保地图的可读性,并通过在数据分类和线简化中的应用进行了验证。
本文提出了一种优化的基于 Monodepth2 的单目视觉测量方法,该方法通过集成语义分割与利用先验几何特征的固定权重空间校正,在建筑场景中实现了亚毫米级的精度,并证明了与传统方法相比误差降低了 96% 以上。
本文提出了一种集成闭环控制系统的轻量化自适应 YOLOv11 检测器,旨在实现高速、高精度的工业缺陷感知与实时分拣,与传统方法相比,显著提升了推理效率与控制稳定性。
本文提出了一个可复现的基准测试,证明了虽然像 DINOv2 这样现成的自监督视觉嵌入能够有效地为开源情报(OSINT)中的表面重识别生成线索,但由于在尺度变化和光滑表面上存在显著的性能退化,它们仍不足以实现无条件的识别。
本研究通过一项受控的实证分析,证明了语义、情感和安全性相关的响应在英语、印地语和法语之间存在显著差异,从而挑战了多语言大语言模型具有语言不变性行为的假设,揭示了行为差异是真实存在的且取决于特定类别,而非严格遵循语言距离的预测。