Interpretable Audio Pattern Discovery in Keyword-Spotting Models via Waveform Optimization and Segment-Level Analysis
本文介绍了 GRADV,这是一种可复现的信号分析工作流,通过优化波形并进行分段级分析,旨在发现并评估关键词检测模型中的目标类别音频模式,在不提出新的语音识别架构的情况下实现了极高的成功率。
927 篇论文
本文介绍了 GRADV,这是一种可复现的信号分析工作流,通过优化波形并进行分段级分析,旨在发现并评估关键词检测模型中的目标类别音频模式,在不提出新的语音识别架构的情况下实现了极高的成功率。
本文提出了一种 Pydantic 模式以及一个少样本小语言模型基准,用于从碎片化、双语且截断的遗留 CNC 工单中提取工程变更追溯性,在展示高模式有效性的同时,揭示了基于上下文的预提示会降低性能,而确定性后置过滤器能在不影响召回率的情况下提高精确度。
OptiVerse AI 是一个利用 EfficientNetB7 和 Grad-CAM 对糖尿病视网膜病变进行分类并从标准眼底图像中重建 3D 视网膜结构的解释性深度学习系统,其准确率超过 95%,旨在增强早期疾病检测和临床决策。
本文介绍了 RECON,这是一种神经符号多智能体架构,它将确定性规则、模糊检测以及大语言模型推理与基于 YAML 的配方系统和防篡改审计相结合,旨在为异构企业仓库中的文档合规性审查提供可复现、可辩护且证据融合的解决方案。
本文证明了对于相关显微成像配准而言,跨模态外观相似性是决定成功的更关键因素,而非视野尺度的处理能力,这可以通过跨模态训练骨干网络的卓越表现,以及朴素的尺度感知封装器无法克服外观差异这一事实得到证实。
本文介绍了一种高性价比、无需训练的傅里叶修正协议,该协议通过量化并调整合成图像与真实建筑图像之间特定的低频幅度失配,在不需要大量无标签目标数据或生成模型的情况下,显著提升了针对稀有安全关键类别的冷启动分割性能。
本文介绍了 CB-SentiLex,这是一个可审计的弱监督框架,也是首个针对南亚一家中央银行的可复现 NLP 基准测试,该框架成功地为孟加拉国银行语料库生成了立场标签,并证明了在面临时间概念漂移挑战的情况下,模型仍具有强大的性能以及与货币政策方向的高度相关性。
本研究引入了伦理场论(Ethical Field Theory)框架,通过大规模模拟证明,在防止多样化多智能体人工智能网络拓扑结构中的递归级联不稳定性方面,自适应定向稳定化比统一调节或无干预措施显著更为有效。
本文提出了一种联合判别算法,通过整合来自 Video Swin Transformer 的时空特征、来自 RAFT 光流的微位移特征以及多任务外观分析,协同识别工业设备视频中的振动状态、结构松动和表面缺陷,从而与单任务模型相比,显著降低了复合异常场景下的漏检率。
本研究采用 PRISMA 2020 系统综述方法对 73 篇同行评审文章进行了分析,旨在弥合技术性零信任实施与组织治理之间的差距,提出了一个将持续验证和以身份为中心的控制措施与增强型风险管理及战略性 IT 目标联系起来的概念框架,同时强调了中小企业采用以及人工智能驱动自动化方面的关键空白。