cs.CV articles | Gist.Science

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

Ce travail présente LMOD+, une nouvelle base de données et un benchmark multimodaux à grande échelle en ophtalmologie, enrichis par rapport à LMOD, qui intègrent des annotations multi-granulaires pour évaluer les performances et les limites des grands modèles de langage multimodaux dans le diagnostic, le stadification et la détection des biais liés aux maladies oculaires menaçant la vision.

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen2026-03-10💻 cs

Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!

Le papier présente REVEL, une nouvelle tâche de manipulation vidéo interactive en flux continu permettant de modifier n'importe quel élément à tout moment, et propose DragStream, une méthode sans entraînement qui corrige la dérive latente et les interférences contextuelles pour assurer une génération vidéo fluide et cohérente.

Junbao Zhou, Yuan Zhou, Kesen Zhao, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang2026-03-10💻 cs

Real-Time Motion-Controllable Autoregressive Video Diffusion

Le papier présente AR-Drag, le premier modèle de diffusion vidéo autoregressif renforcé par apprentissage par renforcement, capable de générer des vidéos à partir d'images en temps réel avec un contrôle précis du mouvement tout en maintenant une haute fidélité visuelle et une faible latence.

Kesen Zhao, Jiaxin Shi, Beier Zhu, Junbao Zhou, Xiaolong Shen, Yuan Zhou, Qianru Sun, Hanwang Zhang2026-03-10💻 cs

Unsupervised Deep Generative Models for Anomaly Detection in Neuroimaging: A Systematic Scoping Review

Cette revue systématique examine l'application des modèles génératifs profonds non supervisés à la détection d'anomalies en neuroimagerie, soulignant leur potentiel pour identifier des pathologies sans annotations tout en mettant en évidence les défis liés à l'hétérogénéité méthodologique et au manque de validation externe.

Youwan Mahé, Elise Bannier, Stéphanie Leplaideur, Elisa Fromont, Francesca Galassi2026-03-10💻 cs

Taming Modality Entanglement in Continual Audio-Visual Segmentation

Cet article propose un nouveau cadre de rééchantillonnage par collision (CMR) pour la segmentation audio-vidéo continue, qui résout les problèmes de dérive sémantique et de confusion entre classes co-occurrentes en sélectionnant des échantillons multimodaux cohérents et en augmentant la fréquence de réentraînement des classes confusables.

Yuyang Hong, Qi Yang, Tao Zhang, Zili Wang, Zhaojin Fu, Kun Ding, Bin Fan, Shiming Xiang2026-03-10💻 cs

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

Le papier présente Dream4Drive, un cadre de génération de données synthétiques qui améliore les performances des modèles de perception pour la conduite autonome en produisant des cas limites multi-vues photoréalistes, tout en introduisant l'ensemble de données 3D DriveObj3D pour faciliter la recherche future.

Kai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei, Xiangyu Guo, Zhenxin Zhu, Kalok Ho, Lijun Zhou, Bohan Zeng, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wentao Zhang2026-03-10💻 cs

MoE-GS: Mixture of Experts for Dynamic Gaussian Splatting

Le papier présente MoE-GS, un cadre unifié pionnier qui intègre une architecture de mélange d'experts avec un routeur de pixels sensible au volume pour améliorer la synthèse de nouvelles vues dans les scènes dynamiques, tout en proposant des stratégies d'optimisation pour atténuer les coûts de calcul inhérents.

In-Hwan Jin, Hyeongju Mun, Joonsoo Kim, Kugjin Yun, Kyeongbo Kong2026-03-10💻 cs

AnyPcc: Compressing Any Point Cloud with a Single Universal Model

Le papier présente AnyPcc, un cadre universel de compression de nuages de points qui surpasse l'état de l'art en généralisation grâce à un modèle de contexte robuste et une stratégie de fine-tuning adaptatif par instance pour gérer efficacement les données hors distribution.

Kangli Wang, Qianxi Yi, Yuqi Ye, Shihao Li, Wei Gao2026-03-10💻 cs

Automated Pest Counting in Water Traps through Active Robotic Stirring for Occlusion Handling

Cet article présente une méthode de comptage automatisé des ravageurs dans des pièges à eau utilisant un bras robotique actif pour réduire les occlusions, où un système de contrôle en boucle fermée adaptatif optimise les motifs de brassage et la vitesse pour améliorer la précision et réduire le temps d'exécution par rapport aux méthodes statiques.

Xumin Gao, Mark Stevens, Grzegorz Cielniak2026-03-10💻 cs

CountFormer: A Transformer Framework for Learning Visual Repetition and Structure in Class-Agnostic Object Counting

Ce papier présente CountFormer, un cadre de comptage d'objets sans exemple qui remplace l'encodeur d'image par le modèle fondation auto-supervisé DINOv2 pour améliorer la cohérence structurelle et réduire les erreurs de surcomptage liées aux répétitions visuelles, tout en obtenant des performances compétitives sur le jeu de données FSC-147.

Md Tanvir Hossain, Akif Islam, Mohd Ruhul Ameen2026-03-10💻 cs

SAGE: Structure-Aware Generative Video Transitions between Diverse Clips

Le papier présente SAGE, une approche zéro-shot qui génère des transitions vidéo cohérentes et structurellement alignées entre des clips divers en combinant guidance structurelle et synthèse générative, surpassant ainsi les méthodes existantes sans nécessiter d'entraînement spécifique.

Mia Kan, Yilin Liu, Niloy Mitra2026-03-10💻 cs

Detecting AI-Generated Images via Diffusion Snap-Back Reconstruction: A Forensic Approach

Cet article propose une nouvelle méthode de détection des images générées par l'IA, appelée « reconstruction par rebond de diffusion », qui analyse la manière dont une image se réorganise sous l'effet d'une perturbation contrôlée par un modèle de diffusion, atteignant une précision exceptionnelle (AUROC de 0,993) pour distinguer les photographies authentiques des synthèses artificielles.

Mohd Ruhul Ameen, Akif Islam2026-03-10💻 cs

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

Ce rapport présente Jr. AI Scientist, un système autonome capable de générer des contributions scientifiques novatrices en suivant un flux de travail de recherche complet, tout en évaluant ses performances supérieures aux systèmes existants et en identifiant les risques et limites critiques nécessitant une supervision humaine.

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa2026-03-10🤖 cs.LG

MUGSQA: Novel Multi-Uncertainty-Based Gaussian Splatting Quality Assessment Method, Dataset, and Benchmarks

Cet article présente MUGSQA, une nouvelle méthode d'évaluation de la qualité basée sur l'incertitude multiple, accompagnée d'un jeu de données et de benchmarks conçus pour mesurer la robustesse des méthodes de Gaussian Splatting et la performance des métriques d'évaluation existantes face aux variations des données d'entrée.

Tianang Chen, Jian Jin, Shilv Cai, Zhuangzi Li, Weisi Lin2026-03-10💻 cs

Counting Through Occlusion: Framework for Open World Amodal Counting

Le papier présente CountOCC, un cadre de comptage amodal qui surpasse les méthodes actuelles en reconstruisant les caractéristiques des objets occlus grâce à une guidance multimodale hiérarchique et une nouvelle tâche d'équivalence visuelle, validé par des performances record sur des jeux de données augmentés avec occlusion.

Safaeid Hossain Arib, Rabeya Akter, Abdul Monaf Chowdhury, Md Jubair Ahmed Sourov, Md Mehedi Hasan2026-03-10💻 cs

Angular Gradient Sign Method: Uncovering Vulnerabilities in Hyperbolic Networks

Cet article propose une nouvelle méthode d'attaque par exemple adversaire pour les réseaux hyperboliques, baptisée « Angular Gradient Sign », qui exploite la géométrie de l'espace en se concentrant sur les composantes angulaires du gradient pour générer des perturbations plus efficaces et révéler des vulnérabilités spécifiques aux représentations hiérarchiques.

Minsoo Jo, Dongyoon Yang, Taesup Kim2026-03-10🤖 cs.LG

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Le papier présente Video2Layout, un cadre qui améliore le raisonnement spatial des modèles multimodaux en reconstruisant des cartes cognitives métriques basées sur des coordonnées continues plutôt que sur des grilles discrétisées, permettant ainsi des calculs quantitatifs plus précis et une réduction de l'ambiguïté dans la description des relations spatiales.

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao2026-03-10💻 cs

Multi-Order Matching Network for Alignment-Free Depth Super-Resolution

Cet article présente MOMNet, un cadre novateur de super-résolution de profondeur sans alignement qui utilise un mécanisme de correspondance multi-ordre pour récupérer et agréger de manière adaptative les informations RGB pertinentes, surmontant ainsi les limitations des méthodes existantes face aux désalignements inhérents aux scénarios réels.

Zhengxue Wang, Zhiqiang Yan, Yuan Wu, Guangwei Gao, Xiang Li, Jian Yang2026-03-10💻 cs

Learning to Think Fast and Slow for Visual Language Models

Ce papier présente DualMindVLM, un modèle de langage visuel qui imite le double système de pensée humain en adaptant dynamiquement la longueur de son raisonnement à la complexité de la tâche, offrant ainsi des performances de pointe avec une efficacité de tokens supérieure.

Chenyu Lin, Cheng Chi, Jinlin Wu, Sharon Li, Kaiyang Zhou2026-03-10💻 cs

Radiative-Structured Neural Operator for Continuous and Extrapolative Spectral Super-Resolution

Cet article propose le Radiative-Structured Neural Operator (RSNO), une nouvelle méthode d'apprentissage profond qui génère des images hyperspectrales continues et physiquement cohérentes à partir d'observations multispectrales en intégrant des contraintes radiatives et une projection angulaire cohérente pour éliminer les distorsions de couleur.

Ziye Zhang, Bin Pan, Zhenwei Shi2026-03-10💻 cs

← Précédent Suivant →