cs.CV articles | Gist.Science

A Lightweight Multi-Cancer Tumor Localization Framework for Deployable Digital Pathology

Ce papier présente MuCTaL, un cadre d'apprentissage profond léger et généralisable entraîné sur quatre types de cancers pour localiser avec précision les tumeurs dans les images de pathologie numérique et générer des cartes de probabilité spatiales.

Brian Isett, Rebekah Dadey, Aofei Li, Ryan C. Augustin, Kate Smith, Aatur D. Singhi, Qiangqiang Gu, Riyue Bao2026-03-11🤖 cs.AI

HECTOR: Hybrid Editable Compositional Object References for Video Generation

HECTOR est un pipeline de génération vidéo innovant qui permet un contrôle compositionnel fin en combinant des références statiques et dynamiques tout en spécifiant explicitement les trajectoires des objets pour respecter des contraintes spatio-temporelles complexes.

Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Alan Yuille, Chongyang Ma2026-03-11💻 cs

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

Cet article présente une évaluation comparative systématique des vulnérabilités aux attaques par patch physique de trois architectures de modèles vision-langage pour la conduite autonome, révélant que ces systèmes actuels sont gravement fragiles face à des menaces adverses dans des environnements réalistes.

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé2026-03-11💻 cs

Towards Visual Query Segmentation in the Wild

Cet article introduit la segmentation de requête visuelle (VQS) comme nouveau paradigme de localisation, accompagné du benchmark à grande échelle VQS-4K et de la méthode VQ-SAM, qui surpassent les approches existantes pour segmenter précisément toutes les occurrences d'un objet dans des vidéos non élaguées.

Bing Fan, Minghao Li, Hanzhi Zhang, Shaohua Dong, Naga Prudhvi Mareedu, Weishi Shi, Yunhe Feng, Yan Huang, Heng Fan2026-03-11💻 cs

Multi-Kernel Gated Decoder Adapters for Robust Multi-Task Thyroid Ultrasound under Cross-Center Shift

Cet article propose une famille d'adaptateurs légers côté décodeur, les MKGA, qui améliorent la robustesse des modèles d'automatisation des ultrasons thyroïdiens face aux décalages entre centres en exploitant des champs récepteurs complémentaires et un mécanisme de filtrage sémantique pour atténuer les interférences négatives entre la segmentation et l'évaluation du risque de malignité.

Maziar Sabouri, Nourhan Bayasi, Arman Rahmim2026-03-11🔬 physics

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

Le papier présente MedCBR, un cadre de raisonnement basé sur des concepts qui intègre les directives cliniques aux modèles vision-langage pour améliorer l'interprétabilité et la fiabilité des diagnostics médicaux en générant des narratifs cliniques structurés.

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi2026-03-11🤖 cs.LG

MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering

Le défi MEGC2026 lance deux nouvelles tâches de question-réponse sur vidéo (ME-VQA et ME-LVQA) pour évaluer les capacités des modèles multimodaux à analyser les micro-expressions faciales, qu'elles soient courtes ou longues, en exploitant leurs puissantes capacités de raisonnement.

Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison2026-03-11💻 cs

TIDE: Text-Informed Dynamic Extrapolation with Step-Aware Temperature Control for Diffusion Transformers

Le papier présente TIDE, une méthode d'extrapolation sans entraînement pour les Transformers de diffusion qui permet de générer des images à des résolutions et des ratios d'aspect arbitraires en corrigeant le déséquilibre entre les jetons de texte et d'image via un mécanisme d'ancrage textuel et en éliminant les artefacts grâce à un contrôle dynamique de la température.

Yihua Liu, Fanjiang Ye, Bowen Lin, Rongyu Fang, Chengming Zhang2026-03-11💻 cs

Using Vision Language Foundation Models to Generate Plant Simulation Configurations via In-Context Learning

Cette étude présente un nouveau cadre utilisant des modèles de vision-langage fondationnels pour générer automatiquement des configurations de simulation de plantes à partir d'images de drones, offrant ainsi une solution évolutive pour la création de jumeaux numériques agricoles.

Heesup Yun, Isaac Kazuo Uyehara, Earl Ranario, Lars Lundqvist, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles2026-03-11🤖 cs.AI

PathoScribe: Transforming Pathology Data into a Living Library with a Unified LLM-Driven Framework for Semantic Retrieval and Clinical Integration

Le papier présente PathoScribe, un cadre unifié piloté par un grand modèle de langage (LLM) qui transforme les archives de pathologie statiques en une bibliothèque vivante et intelligente, permettant la recherche sémantique, la construction automatisée de cohortes et l'aide au diagnostic clinique avec une précision et une efficacité supérieures aux méthodes traditionnelles.

Abdul Rehman Akbar, Samuel Wales-McGrath, Alejadro Levya, Lina Gokhale, Rajendra Singh, Wei Chen, Anil Parwani, Muhammad Khalid Khan Niazi2026-03-11🤖 cs.AI

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

Le papier présente BiCLIP, un cadre simple et efficace qui améliore l'adaptation de domaine des modèles vision-langage en appliquant une transformation géométrique structurée aux caractéristiques multimodales, permettant d'atteindre des performances de pointe sur plusieurs benchmarks avec un nombre minimal de paramètres.

Pranav Mantini, Shishir K. Shah2026-03-11🤖 cs.AI

Can You Hear, Localize, and Segment Continually? An Exemplar-Free Continual Learning Benchmark for Audio-Visual Segmentation

Cet article présente le premier benchmark d'apprentissage continu sans exemples pour la segmentation audio-visuelle, accompagné de la méthode ATLAS qui intègre un conditionnement pré-fusion guidé par l'audio et une ancrage de faible rang pour atténuer l'oubli catastrophique dans des environnements dynamiques.

Siddeshwar Raghavan, Gautham Vinod, Bruce Coburn, Fengqing Zhu2026-03-11⚡ eess

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

Le papier présente SVG-EAR, une méthode sans paramètres qui améliore l'efficacité de la génération vidéo par diffusion via un routage conscient de l'erreur et une compensation linéaire basée sur des centroïdes, permettant d'accélérer considérablement l'inférence tout en préservant la qualité visuelle.

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung2026-03-11💻 cs

SurgCalib: Gaussian Splatting-Based Hand-Eye Calibration for Robot-Assisted Minimally Invasive Surgery

Le papier présente SurgCalib, un cadre de calibration main-œil sans marqueur basé sur le Gaussian Splatting pour les robots chirurgicaux da Vinci, qui surmonte les imprécisions des encodeurs et les contraintes de stérilité en affinant la pose de l'instrument via une optimisation différentiable sous contrainte RCM.

Zijian Wu, Shuojue Yang, Yu Chung Lee, Eitan Prisman, Yueming Jin, Septimiu E. Salcudean2026-03-11💻 cs

SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training

Le papier présente SkipGS, une méthode plug-and-play qui accélère l'entraînement de la 3DGS en sautant sélectivement les passes de rétropropagation lors de la phase de raffinement post-densification lorsque les pertes par vue sont stables, réduisant ainsi le temps d'entraînement global de 23,1 % sans compromettre la qualité de reconstruction.

Jingxing Li, Yongjae Leeand, Deliang Fan2026-03-11💻 cs

Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature Conditioning

Cet article propose un cadre d'authentification multimodal basé sur la diffusion et conditionné par l'identité de l'imprimante, qui surpasse les méthodes traditionnelles pour détecter les contrefaçons de motifs de détection de copie en exploitant les signatures spécifiques des appareils.

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior2026-03-11💻 cs

The Coupling Within: Flow Matching via Distilled Normalizing Flows

Ce papier propose la Normalized Flow Matching (NFM), une nouvelle méthode qui améliore l'entraînement des modèles de flux en distillant des couplages adaptatifs à partir de modèles de flux normalisés pré-entraînés, surpassant ainsi les approches traditionnelles à couplage indépendant ou optimal.

David Berthelot, Tianrong Chen, Jiatao Gu, Marco Cuturi, Laurent Dinh, Bhavik Chandna, Michal Klein, Josh Susskind, Shuangfei Zhai2026-03-11🤖 cs.LG

An accurate flatness measure to estimate the generalization performance of CNN models

Cet article propose une mesure de platitude exacte et architecturalement fidèle pour les réseaux de neurones convolutifs, dérivée d'une expression fermée de la trace de l'Hessienne, qui s'avère être un outil robuste pour estimer et comparer les performances de généralisation de ces modèles.

Rahman Taleghani, Maryam Mohammadi, Francesco Marchetti2026-03-11🤖 cs.LG

WS-Net: Weak-Signal Representation Learning and Gated Abundance Reconstruction for Hyperspectral Unmixing via State-Space and Weak Signal Attention Fusion

Ce papier présente WS-Net, un cadre d'analyse de démixage hyperspectral innovant qui combine la modélisation par espace d'états et une attention dédiée aux signaux faibles pour surmonter l'effacement des réponses spectrales subtiles et améliorer significativement la précision de l'estimation des abondances, même dans des conditions de faible rapport signal sur bruit.

Zekun Long, Ali Zia, Guanyiman Fu, Vivien Rolland, Jun Zhou2026-03-11🤖 cs.AI

Spectral-Structured Diffusion for Single-Image Rain Removal

Le papier présente SpectralDiff, un cadre de diffusion structuré dans le domaine spectral qui intègre des perturbations spectrales et une architecture U-Net à produit complet pour supprimer efficacement les traces de pluie sur une image unique tout en améliorant l'efficacité computationnelle.

Yucheng Xing, Xin Wang2026-03-11💻 cs

← Précédent Suivant →