MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection
MonitorVLM-v2 是一个已部署的框架,它通过符号策略优化和熵驱动的分流机制,将开放式的视觉-语言推理转化为高效的单步符号预测,与人工检查相比,在实时工业安全监控中实现了 19.45 倍的速度提升以及显著更高的违规检测率。
927 篇论文
MonitorVLM-v2 是一个已部署的框架,它通过符号策略优化和熵驱动的分流机制,将开放式的视觉-语言推理转化为高效的单步符号预测,与人工检查相比,在实时工业安全监控中实现了 19.45 倍的速度提升以及显著更高的违规检测率。
RGBA-Net 是一个轻量级、最先进的 RGB-D 显著性目标检测框架,它采用非对称双流编码器、深度可靠性门控和边界感知融合模块,在仅有 349 万个参数的情况下实现了高精度,并有效地缓解了深度噪声和复杂性问题。
本文介绍了 Azra,这是一个用于奥斯曼土耳其语手写文本识别的视觉-语言模型框架,该框架通过在精选数据上进行 LoRA 微调实现了最先进的性能,并证明了自主数据引导可以有效匹配精选方法,同时显著降低标注成本。
本文介绍了基于 SSH 框架的稳定、模块化旅游管理系统的设计与实现,该系统集成了优化的混合推荐算法,以实现高准确度、高负载下的低延迟以及强用户满意度。
本文提出了一个集成离线-在线评估框架(IOEF),该框架将技术检索指标与现有文献中的教育成果证据相结合,旨在证明在高等教育中有效的人工智能应用需要平衡信息检索性能与教学设计,而非仅仅依赖检索基准。
这项研究表明,在受控的合成环境中,关键字段之间的表面距离会显著影响小型字符级 Transformer 的路由准确性,从而验证了在使用此类单元测试来区分真正的查找机制与表面特征利用,以在部署自动化教育系统之前进行辨别。
本文提出了一种基于坐标的曲面交集方法,该方法将交线表示为包含语义和几何元数据的经残差审计的接触框架序列,在处理一系列多样化的基本曲面与复杂曲面交集案例时,证明了其相比于 OpenCASCADE 技术具有更优越的数值精度和鲁棒的布尔闭合性。
本研究表明,虽然教育题库中的全局多样性不足以确保稳健的语言解析,但局部分配策略会显著影响性能,而一旦各组件具备足够的单元格内暴露度,全局图连通性则不再提供额外收益。
DeepGaitLab 是一个基于合成数据训练的开源无标记 3D 运动追踪框架,它能在多种摄像机配置和临床人群中提供高精度的免校准步态分析,有效地填补了研究级生物力学与可扩展临床部署之间的空白。
本文提出了 MEFP-Net,一种利用分层中段融合和双路径骨干网络的跨模态识别算法,旨在有效解决特征不平衡和光照敏感问题,从而显著提升复杂城市交通场景下对小目标和遮挡目标的检测能力。