💻 computer science

Two-Stage Synthetic-to-Real Transfer Learning for Automated Mammography Report Generation Using Vision-Language Models

本文提出了一种两阶段的合成到真实迁移学习框架,该框架利用 400 份经过临床验证的合成报告来预训练视觉-语言模型,与现有的最先进方法相比,显著提高了自动乳腺 X 线摄影报告生成的性能和数据效率,并减少了幻觉现象。

Gani Esen, Marat Nurtas, Jandos Amankulov, Laura La Paglia2026-07-20
💻 computer science

Task-Adaptive Decoder Specialization for Unified Image Coding Toward Human Reconstruction and Machine Classification

本文提出了一种任务自适应解码器特化框架,该框架利用共享编码器和潜表示,通过动态重构的解码器侧适配器,在统一图像编码中(特别是在低比特率下),同时增强用于机器分类的语义判别性和用于人类感知的高频纹理保真度。

Wei Zhang, Xiwu Shang, Mengyao Wang, Xiaoli Zhao, Guozhong Wang2026-07-20
💻 computer science

Predicting Visual Acuity from Fundus Photographs Using a Domain-Pretrained Vision Transformer: Anatomical Alignment of Attention Patterns

本研究表明,通过在超过 21,000 张眼底照片上进行微调的领域预训练 Vision Transformer(RETFound),在预测四分类视力方面实现了显著的一致性,同时发展出了解剖结构有序的注意力模式——从低视力眼睛中的视网膜血管转向正常视力眼睛中的黄斑区——这些模式与分类正确性相关联,并为不确定预测提供了可解释性。

Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee2026-07-17
💻 computer science

Cross-Attention Based Multi-Sensor Fusion for Robust Object Detection in ADAS: YOLOv12 with Spatiotemporal Calibration and iHOA-Tuned Temporal Fusion Transformer

本文提出了一种名为 CAMSF-ADAS 的鲁棒性目标检测框架,用于高级驾驶辅助系统,该框架通过时空校准和交叉注意力融合整合了摄像头、激光雷达和雷达数据,并利用 YOLOv12 进行定位,以及通过改进的河马优化算法调优的时空融合 Transformer 来增强分类。

Raghunath Mallavarapu, Kanaka Raju Pappala, Sattibabu Bhumireddi, G. Krishna Podagatlapalli, Kavitha Chandu, Durga Rao T (…)2026-07-17
💻 computer science

From Infrared to Ultraviolet]{From Infrared to Ultraviolet: A Renormalization Group Approach to Frequency-Aware Progressive Training

本文提出了一种受重整化群启发、具有频率感知能力的渐进式训练策略,该策略通过以递减的学习率顺序激活从低到高频的分支,证明了其在低维、少样本回归任务中的持续改进,同时阐明了其在尺度分离相关性较低的高维或平滑过程场景中,有效性会随之降低。

英熙 朱2026-07-17