cs.CV 편의 논문 | Gist.Science

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

이 논문은 시각 및 촉각 데이터 간의 정교한 공간적 상관관계를 포착하기 위해 로컬 및 글로벌 위치 인코딩을 2 단계로 주입하는 트랜스포머 기반 아키텍처인 ViTaPEs 를 제안하여, 다양한 인식 작업과 로봇 그리핑에서 최첨단 성능과 제로샷 일반화 능력을 입증합니다.

Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert2026-03-10🤖 cs.LG

From Semantic To Instance: A Semi-Self-Supervised Learning Approach

이 논문은 밀집된 작물 이미지에서 수동 주석을 최소화하면서도 형태와 질감에 초점을 맞춘 GLMask 를 도입하여 인스턴스 분할 성능을 획기적으로 향상시키는 반-자기지도 학습 접근법을 제안합니다.

Keyhan Najafian, Farhad Maleki, Lingling Jin, Ian Stavness2026-03-10🤖 cs.LG

Transforming H&E images into IHC: A Variance-Penalized GAN for Precision Oncology

이 논문은 GAN 의 모드 붕괴 문제를 해결하고 구조적 다양성을 강화하기 위해 분산 패널티를 도입한 변형된 피라미드 pix2pix 모델을 개발하여, 비용 효율적이고 확장 가능한 HER2 양성 유방암 진단을 위해 H&E 염색 이미지를 고품질 IHC 이미지로 변환하는 새로운 딥러닝 프레임워크를 제시합니다.

Sara Rehmat, Hafeez Ur Rehman, Byeong-Gwon Kang, Sarra Ayouni, Yunyoung Nam2026-03-10💻 cs

Light of Normals: Unified Feature Representation for Universal Photometric Stereo

이 논문은 조명과 법선 정보를 명확히 분리하고 고주파 기하학적 디테일을 보존하기 위해 '라이트 레지스터 토큰', '교차 어텐션 블록', '웨이블릿 기반 듀얼 브랜치 아키텍처'를 도입하고 대규모 데이터셋 'PS-Verse'를 활용하여 범용 광학 스테레오의 성능을 획기적으로 개선한 'Light of Normals' 모델을 제안합니다.

Houyuan Chen, Hong Li, Chongjie Ye + 11 more2026-03-10💻 cs

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

이 논문은 시각 언어 모델 (VLM) 에서 추출한 특징을 명시적 프롬프트로 활용하여 SAM 을 유도하고, 분류 단계에서 도메인 간극을 해소하기 위해 하드 크롭 대신 알파 채널을 통한 소프트 공간 사전 정보를 제공함으로써, 기존 방법들의 한계를 극복하고 은폐된 객체의 분할 및 분류 정확도를 획기적으로 향상시키는 새로운 캐스케이드 프레임워크를 제안합니다.

Kai Zhao, Wubang Yuan, Zheng Wang, Guanyi Li, Xiaoqiang Zhu, Deng-ping Fan, Dan Zeng2026-03-10💻 cs

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

이 논문은 사전 훈련된 잠재 확산 모델과 다중 모달 이해 모델을 활용하여 데이터셋 없이도 다양한 저해상도 이미지 복원 작업을 통합적으로 수행하는 새로운 제로샷 방법인 LD-RPS 를 제안하고, 반복적 사후 샘플링을 통해 기존 방법들을 능가하는 성능을 입증합니다.

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu2026-03-10💻 cs

Adopting a human developmental visual diet yields robust, shape-based AI vision

이 논문은 인간의 시각 발달 과정을 모방한 '발달 시각 식단 (DVD)'을 통해 AI 가 질감보다 형태에 기반한 견고하고 인간과 유사한 시각 능력을 획득할 수 있음을 보여줍니다.

Zejin Lu, Sushrut Thorat, Radoslaw M Cichy, Tim C Kietzmann2026-03-10🤖 cs.LG

Query-Based Adaptive Aggregation for Multi-Dataset Joint Training Toward Universal Visual Place Recognition

이 논문은 다양한 데이터셋 간의 편차를 해결하고 범용적인 시각적 장소 인식 (VPR) 성능을 극대화하기 위해 학습된 쿼리를 참조 코드북으로 활용하는 새로운 특징 집계 기법인 '쿼리 기반 적응적 집계 (QAA)'를 제안합니다.

Jiuhong Xiao, Yang Zhou, Giuseppe Loianno2026-03-10💻 cs

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

이 논문은 센서 고장이나 개인정보 보호로 인한 불완전한 멀티모달 데이터의 감정 인식 성능 저하 문제를 해결하기 위해, 모달리티 조합별 특성을 고려한 저랭크 적응 기법 (MCLA) 과 표현 공간의 분리 가능성을 기반으로 동적 파라미터 미세 조정을 수행하는 (DPFT) 새로운 프레임워크인 MCULoRA 를 제안하여 기존 방법보다 뛰어난 성능을 입증했습니다.

Xinkui Zhao, Jinsong Shu, Yangyang Wu, Guanjie Cheng, Zihe Liu, Naibo Wang, Shuiguang Deng, Zhongle Xie, Jianwei Yin2026-03-10💻 cs

Unified Medical Image Segmentation with State Space Modeling Snake

이 논문은 다중 스케일 구조적 이질성으로 인한 기존 의료 영상 분할의 한계를 극복하기 위해 상태 공간 모델을 활용한 'Mamba Snake'를 제안하여, 장기 간 위상적 관계와 미세한 윤곽 정제를 동시에 최적화함으로써 최첨단 방법론 대비 평균 3% 의 Dice 점수 개선을 달성했다고 요약할 수 있습니다.

Ruicheng Zhang, Haowei Guo, Kanghui Tian, Jun Zhou, Mingliang Yan, Zeyu Zhang, Shen Zhao2026-03-10💻 cs

$\pi^3$ : Permutation-Equivariant Visual Geometry Learning

이 논문은 고정된 기준 뷰에 의존하지 않고 완전한 치환 등변성을 갖춘 아키텍처를 통해 카메라 포즈 및 깊이 추정 등 다양한 시각 기하학 작업에서 최첨단 성능을 달성하는 새로운 피드포워드 신경망 $\pi^3$ 를 제안합니다.

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong He2026-03-10💻 cs

InsightX Agent: An LMM-based Agentic Framework with Integrated Tools for Reliable X-ray NDT Analysis

이 논문은 X-ray 비파괴 검사에서 기존 딥러닝 방식의 한계를 극복하고, SDMSD 탐지기와 증거 기반 반성 (EGR) 도구를 LMM 에이전트가 조율하여 높은 정확도와 해석 가능성을 갖춘 신뢰할 수 있는 분석을 제공하는 'InsightX Agent' 프레임워크를 제안합니다.

Jiale Liu, Huan Wang, Yue Zhang + 4 more2026-03-10🤖 cs.AI

Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery

본 논문은 손실된 지상 데이터가 부족한 재해 상황에서 TASA 의 EVAP 제품을 보완하기 위해 Sentinel-2 와 Formosat-5 영상을 활용하고 PCA 기반 약지도 학습을 통해 확장된 라벨로 훈련된 비전 트랜스포머 (ViT) 기반 모델을 제안하여 재해 피해 지역 분할의 정확성과 공간적 일관성을 향상시켰음을 보여줍니다.

Yi-Shan Chu, Hsuan-Cheng Wei2026-03-10💻 cs

Empowering Microscopic Traffic Simulators with Realistic Perception using Surrogate Sensor Models

이 논문은 기존 미시적 교통 시뮬레이터의 확장성 한계를 극복하고 현실적인 LiDAR 감지 능력을 추가하기 위해, 고수준 교통 데이터와 기하학적 가시성 분석을 결합한 대리 센서 모델 'MIDAR'을 제안하고 이를 통해 대규모 교통 시뮬레이션의 정밀도와 실시간성을 동시에 향상시켰음을 보여줍니다.

Tianheng Zhu, Yiheng Feng2026-03-10💻 cs

TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation

이 논문은 CNN 의 국소적 특징 추출 능력과 트랜스포머의 전역적 문맥 이해 능력을 결합한 TransUNet-GradCAM 모델을 제안하여, 다양한 외부 데이터셋에서도 견고한 제로샷 성능과 높은 설명 가능성을 갖춘 당뇨병성 발궤양 자동 분할 솔루션을 제시합니다.

Akwasi Asare, Mary Sagoe, Justice Williams Asare, Stephen Edward Moore2026-03-10💻 cs

← 이전 다음 →

cs.CV

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

From Semantic To Instance: A Semi-Self-Supervised Learning Approach

Transforming H&E images into IHC: A Variance-Penalized GAN for Precision Oncology

Light of Normals: Unified Feature Representation for Universal Photometric Stereo

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

Adopting a human developmental visual diet yields robust, shape-based AI vision

Query-Based Adaptive Aggregation for Multi-Dataset Joint Training Toward Universal Visual Place Recognition

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

Unified Medical Image Segmentation with State Space Modeling Snake

$\pi^3$ : Permutation-Equivariant Visual Geometry Learning

InsightX Agent: An LMM-based Agentic Framework with Integrated Tools for Reliable X-ray NDT Analysis

Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery

Empowering Microscopic Traffic Simulators with Realistic Perception using Surrogate Sensor Models

TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation

S $^2$ Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

3D Gaussian Splatting with Fisheye Images: Field of View Analysis and Depth-Based Initialization

Unified and Semantically Grounded Domain Adaptation for Medical Image Segmentation

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

cs.CV

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

From Semantic To Instance: A Semi-Self-Supervised Learning Approach

Transforming H&E images into IHC: A Variance-Penalized GAN for Precision Oncology

Light of Normals: Unified Feature Representation for Universal Photometric Stereo

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

Adopting a human developmental visual diet yields robust, shape-based AI vision

Query-Based Adaptive Aggregation for Multi-Dataset Joint Training Toward Universal Visual Place Recognition

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

Unified Medical Image Segmentation with State Space Modeling Snake

π3\pi^3π3: Permutation-Equivariant Visual Geometry Learning

InsightX Agent: An LMM-based Agentic Framework with Integrated Tools for Reliable X-ray NDT Analysis

Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery

Empowering Microscopic Traffic Simulators with Realistic Perception using Surrogate Sensor Models

TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation

S2^22Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

3D Gaussian Splatting with Fisheye Images: Field of View Analysis and Depth-Based Initialization

Unified and Semantically Grounded Domain Adaptation for Medical Image Segmentation

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

$\pi^3$ : Permutation-Equivariant Visual Geometry Learning

S $^2$ Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation