cs.CV artigos | Gist.Science

Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset

O artigo apresenta o Real-IISR, um novo framework autoregressivo unificado e o conjunto de dados FLIR-IISR para super-resolução de imagens infravermelhas em cenários reais, projetados para superar as limitações de simulações anteriores ao reconstruir estruturas térmicas e de fundo com consistência física através de módulos de orientação térmico-estrutural e correção de viés de degradação.

Yang Zou, Jun Ma, Zhidong Jiao + 3 more2026-03-06💻 cs

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

Este comentário de panorama avalia a família GPT-5 como raciocinador clínico multimodal, demonstrando avanços significativos na síntese de dados textuais e de imagem que superam o GPT-4o, mas revelando que, embora represente um progresso em direção ao raciocínio integrado, os modelos generalistas ainda não substituem sistemas especializados em tarefas críticas de percepção como neurorradiologia e mamografia.

Alexandru Florea, Shansong Wang, Mingzhe Hu + 5 more2026-03-06💻 cs

Evaluating and Correcting Human Annotation Bias in Dynamic Micro-Expression Recognition

Este artigo apresenta a arquitetura GAMDSS, uma estratégia inovadora de seleção dinâmica de quadros-chave que melhora o reconhecimento de microexpressões ao mitigar erros de anotação humana, especialmente em cenários multiculturais, sem aumentar o número de parâmetros do modelo.

Feng Liu, Bingyu Nan, Xuezhong Qian + 1 more2026-03-06💻 cs

DSA-SRGS: Super-Resolution Gaussian Splatting for Dynamic Sparse-View DSA Reconstruction

Este artigo apresenta o DSA-SRGS, o primeiro framework de gaussian splatting com super-resolução para reconstrução dinâmica de angiografia por subtração digital (DSA) a partir de vistas esparsas, que integra aprendizado de textura multi-fidelidade e densificação radiativa sub-pixel para recuperar detalhes vasculares finos e superar as limitações de resolução das abordagens existentes.

Shiyu Zhang, Zhicong Wu, Huangxuan Zhao + 7 more2026-03-06💻 cs

MADCrowner: Margin Aware Dental Crown Design with Template Deformation and Refinement

O artigo apresenta o MADCrowner, um framework de geração de malhas dentárias que combina deformação de templates baseada em contexto anatômico e segmentação precisa da margem cervical para superar as limitações de resolução e precisão dos métodos atuais de design de coroas dentárias.

Linda Wei, Chang Liu, Wenran Zhang + 9 more2026-03-06💻 cs

Privacy-Aware Camera 2.0 Technical Report

Este relatório técnico apresenta a Privacy Camera 2.0, um novo framework de percepção que equilibra privacidade e segurança ao transformar imagens brutas em vetores de características abstratos e irreversíveis na borda, permitindo a reconstrução semântica de comportamentos na nuvem sem expor dados visuais originais.

Huan Song, Shuyu Tian, Ting Long + 5 more2026-03-06💻 cs

RMK RetinaNet: Rotated Multi-Kernel RetinaNet for Robust Oriented Object Detection in Remote Sensing Imagery

O artigo propõe o RMK RetinaNet, um detector de objetos orientados para imagens de sensoriamento remoto que supera limitações de campo receptivo, fusão de características e regressão angular através de um bloco de kernel multi-escala, atenção contextual direcional, um caminho bottom-up e um módulo de codificação de ângulo de Euler, alcançando desempenho robusto e competitivo em múltiplas escalas e orientações.

Huiran Sun2026-03-06💻 cs

LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation

O artigo apresenta o framework LAW & ORDER, que utiliza adaptadores espaciais para melhorar a geração de imagens médicas e a segmentação ao corrigir desequilíbrios espaciais, resultando em ganhos significativos de qualidade sintética e precisão de segmentação com custo computacional reduzido.

Anugunj Naman, Ayushman Singh, Gaibo Zhang + 1 more2026-03-06💻 cs

Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper

Esta revisão compara métodos tradicionais e de aprendizado profundo para segmentação e classificação de gliomas cerebrais em imagens de ressonância magnética, concluindo que as arquiteturas de redes neurais convolucionais superam as técnicas convencionais.

Kiranmayee Janardhan, Vinay Martin DSa Prabhu, T. Christy Bobby2026-03-06💻 cs

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

O artigo apresenta o MASQuant, um novo framework de quantização pós-treinamento para Modelos de Linguagem Multimodais (MLLMs) que resolve problemas de desalinhamento e invariância computacional entre modalidades através de suavização específica por modalidade e compensação baseada em SVD, alcançando desempenho competitivo em modelos duais e tri-ais.

Lulu Hu, Wenhu Xiao, Xin Chen + 4 more2026-03-06💻 cs

Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

Este artigo propõe o método DCR (Diffusion Contrastive Reconstruction), que integra sinais contrastivos derivados das imagens reconstruídas em vez das originais no processo de difusão para superar as limitações do CLIP, equilibrando simultaneamente a capacidade discriminativa e a percepção de detalhes na representação visual.

Boyu Han, Qianqian Xu, Shilong Bao + 4 more2026-03-06💻 cs

Meta-D: Metadata-Aware Architectures for Brain Tumor Analysis and Missing-Modality Segmentation

O artigo apresenta o Meta-D, uma arquitetura que utiliza metadados categóricos de exames de ressonância magnética para orientar a extração de características, melhorando significativamente a detecção de tumores cerebrais e a segmentação em cenários com modalidades ausentes ao estabilizar representações e reduzir parâmetros do modelo.

SangHyuk Kim, Daniel Haehn, Sumientra Rampersad2026-03-06💻 cs

Revisiting Shape from Polarization in the Era of Vision Foundation Models

Este artigo demonstra que, ao corrigir lacunas de domínio por meio de um novo conjunto de dados de alta qualidade e aumentação de dados sensível ao sensor, um modelo leve treinado com polarização supera os modelos fundacionais baseados apenas em RGB na estimativa de normais de superfície, oferecendo ganhos significativos em eficiência de dados e parâmetros.

Chenhao Li, Taishi Ono, Takeshi Uemori + 1 more2026-03-06💻 cs

Mitigating Instance Entanglement in Instance-Dependent Partial Label Learning

O artigo propõe o framework CAD (Class-specific Augmentation based Disentanglement), que mitiga o emaranhamento de instâncias no aprendizado de rótulos parciais dependente de instância (ID-PLL) através de regulamentações intra e interclasse para melhorar a clareza dos limites entre classes e reduzir a confusão.

Rui Zhao, Bin Shi, Kai Sun + 1 more2026-03-06🤖 cs.LG

Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction

Este artigo propõe o SADCA, um método de ataque adversarial que melhora a transferibilidade em modelos visão-linguagem através de interações dinâmicas contrastivas guiadas semanticamente e de um módulo de aumento de semântica para gerar perturbações mais robustas e generalizáveis.

Yuanbo Li, Tianyang Xu, Cong Hu + 3 more2026-03-06💻 cs

Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models

Este artigo apresenta o MPCAttack, um novo framework de ataque adversarial colaborativo multi-paradigma que melhora a transferabilidade de exemplos adversariais contra Modelos de Linguagem Grandes Multimodais (MLLMs) ao agregar representações semânticas de imagens e textos para otimização conjunta, superando os métodos existentes em diversos benchmarks.

Yuanbo Li, Tianyang Xu, Cong Hu + 3 more2026-03-06💻 cs

GloSplat: Joint Pose-Appearance Optimization for Faster and More Accurate 3D Reconstruction

O artigo apresenta o GloSplat, um framework que realiza otimização conjunta de pose e aparência durante o treinamento de 3D Gaussian Splatting, preservando rastros explícitos de características SfM como âncoras geométricas para evitar a deriva de pose e alcançar reconstruções 3D mais rápidas e precisas, superando tanto os métodos baseados em COLMAP quanto os que dispensam sua utilização.

Tianyu Xiong, Rui Li, Linjie Li + 1 more2026-03-06💻 cs

On Multi-Step Theorem Prediction via Non-Parametric Structural Priors

Este trabalho propõe o uso de Grafos de Precedência de Teoremas e restrições topológicas explícitas para superar o problema de "Deriva Estrutural" na previsão de teoremas via aprendizado in-context, alcançando desempenho competitivo com modelos supervisionados sem necessidade de otimização baseada em gradientes.

Junbo Zhao, Ting Zhang, Can Li + 3 more2026-03-06🤖 cs.AI

Scalable Injury-Risk Screening in Baseball Pitching From Broadcast Video

Este artigo apresenta um pipeline de vídeo monoculário baseado em DreamPose3D que extrai métricas biomecânicas precisas de transmissões esportivas para permitir a triagem escalável de risco de lesões em arremessadores de beisebol, alcançando desempenho comparável a sistemas de captura de movimento profissionais.

Jerrin Bright, Justin Mende, John Zelek2026-03-06💻 cs

SURE: Semi-dense Uncertainty-REfined Feature Matching

O artigo apresenta o SURE, um novo framework de correspondência de características semi-densa que aprimora a confiabilidade em cenários desafiadores ao prever simultaneamente correspondências e sua incerteza, superando os modelos existentes em precisão e eficiência.

Sicheng Li, Zaiwang Gu, Jie Zhang + 3 more2026-03-06💻 cs

← Anterior Próximo →