B-DENSE: Branching For Dense Ensemble Network Supervision Efficiency

Le papier présente B-DENSE, un cadre novateur qui améliore l'efficacité de l'inférence des modèles de diffusion en utilisant une alignement de trajectoire dense via une architecture à branches multiples, permettant ainsi au modèle étudiant de préserver les informations structurelles intermédiaires et d'obtenir une qualité de génération supérieure par rapport aux méthodes de distillation existantes.

Cherish Puniani, Tushar Kumar, Arnav Bendre, Gaurav Kumar, Shree SinghiWed, 11 Ma🤖 cs.AI

Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1

Cet article présente une approche à double pipeline utilisant des modèles de fondation (Grounding DINO 1.5, YOLOv11 et SAM 2.1) pour la segmentation d'images d'oiseaux, démontrant qu'un mode supervisé fine-tuné atteint des performances record (IoU 0,912) et qu'un mode zero-shot fonctionne efficacement sans données étiquetées, surpassant ainsi les réseaux de segmentation traditionnels.

Abhinav MunagalaWed, 11 Ma🤖 cs.AI

DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis

Le papier présente DOCFORGE-BENCH, le premier benchmark zéro-shot unifié pour la détection de falsification de documents, qui révèle que l'échec actuel des méthodes à être déployées directement est dû non pas à une mauvaise représentation des données, mais à un défaut de calibration des seuils de décision causé par la faible proportion de pixels falsifiés dans les images de documents.

Zengqi Zhao, Weidi Xia, En Wei, Yan Zhang, Jane Mo, Tiannan Zhang, Yuanqin Dai, Zexi Chen, Yiran Tao, Simiao RenWed, 11 Ma💻 cs

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Le papier présente Pri4R, une méthode simple et efficace qui améliore les modèles Vision-Language-Action en leur apprenant implicitement la dynamique du monde via l'entraînement sur des trajectoires de points 3D privilégiées, sans ajouter de surcoût computationnel ni modifier l'architecture lors de l'inférence.

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong KimWed, 11 Ma🤖 cs.AI

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Le papier présente Granulon, un nouveau modèle multimodal fondé sur DINOv3 qui surpasse les approches existantes en améliorant la précision et en réduisant les hallucinations grâce à un contrôle adaptatif de la granularité visuelle permettant un raisonnement unifié allant du pixel aux concepts globaux.

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming JinWed, 11 Ma💻 cs

VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model

Le papier présente VisionCreator-R1, un agent natif de génération visuelle doté d'un mécanisme de réflexion explicite et entraîné via une méthode d'optimisation conjointe plan-réflexion (RPCO) qui surpasse Gemini2.5Pro sur des tâches de génération d'images uniques et multiples.

Jinxiang Lai, Wenzhe Zhao, Zexin Lu, Hualei Zhang, Qinyu Yang, Rongwei Quan, Zhimin Li, Shuai Shao, Song Guo, Qinglin LuWed, 11 Ma💻 cs

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

Cet article présente une évaluation comparative systématique des vulnérabilités aux attaques par patch physique de trois architectures de modèles vision-langage pour la conduite autonome, révélant que ces systèmes actuels sont gravement fragiles face à des menaces adverses dans des environnements réalistes.

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. PeséWed, 11 Ma💻 cs

Multi-Kernel Gated Decoder Adapters for Robust Multi-Task Thyroid Ultrasound under Cross-Center Shift

Cet article propose une famille d'adaptateurs légers côté décodeur, les MKGA, qui améliorent la robustesse des modèles d'automatisation des ultrasons thyroïdiens face aux décalages entre centres en exploitant des champs récepteurs complémentaires et un mécanisme de filtrage sémantique pour atténuer les interférences négatives entre la segmentation et l'évaluation du risque de malignité.

Maziar Sabouri, Nourhan Bayasi, Arman RahmimWed, 11 Ma🔬 physics

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

Le papier présente MedCBR, un cadre de raisonnement basé sur des concepts qui intègre les directives cliniques aux modèles vision-langage pour améliorer l'interprétabilité et la fiabilité des diagnostics médicaux en générant des narratifs cliniques structurés.

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin MousaviWed, 11 Ma🤖 cs.LG