cs.CV 편의 논문 | Gist.Science

GRAD-Former: Gated Robust Attention-based Differential Transformer for Change Detection

이 논문은 고해상도 위성 영상의 변화 탐지 분야에서 기존 모델의 한계를 극복하고 적은 파라미터로 최첨단 성능을 달성하기 위해 게이트 메커니즘과 차분 어텐션을 활용한 새로운 GRAD-Former 프레임워크를 제안합니다.

Durgesh Ameta, Ujjwal Mishra, Praful Hambarde + 1 more2026-03-03🤖 cs.AI

BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling

이 논문은 기존 방법들의 한계를 극복하고 인간의 미적 선호도와 높은 충실도를 동시에 달성하기 위해, 정교한 선호도 데이터셋과 reward 모델을 구축하고 확률적 드리프트를 보정하는 동적 경로 안내 (DPG) 기법을 도입한 얼굴 보정 강화학습 프레임워크 'BeautyGRPO'를 제안합니다.

Jiachen Yang, Xianhui Lin, Yi Dong + 4 more2026-03-03💻 cs

FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing

이 논문은 편집 영역을 식별하여 주입 강도를 조절하는 '편집 인지 주입 (Editing-aware Injection)' 기법을 도입하고, 이를 정류 흐름 (Rectified Flow) 모델에 적용하여 미세 조정 없이 고품질의 영상이동 편집을 가능하게 하는 'FREE-Edit' 프레임워크를 제안합니다.

Maomao Li, Yunfei Liu, Yu Li2026-03-03💻 cs

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

이 논문은 시각, 텍스트, 오디오 세 가지 모달리티를 프레임 수준에서 적응적으로 융합하는 'TripleSumm' 아키텍처와 대규모 멀티모달 벤치마크 'MoSu'를 제안하여 기존 비디오 요약 방법의 한계를 극복하고 최첨단 성능을 달성했다고 요약할 수 있습니다.

Sumin Kim, Hyemin Jeong, Mingu Kang + 3 more2026-03-03🤖 cs.LG

VP-Hype: A Hybrid Mamba-Transformer Framework with Visual-Textual Prompting for Hyperspectral Image Classification

이 논문은 선형 시간 효율성을 가진 상태 공간 모델 (SSM) 과 관계 모델링이 가능한 트랜스포머를 결합한 하이브리드 아키텍처와 시각 - 텍스트 프롬프팅을 도입하여, 레이블이 부족한 환경에서도 hyperspectral 이미지 분류의 정확도를 획기적으로 향상시킨 VP-Hype 프레임워크를 제안합니다.

Abdellah Zakaria Sellam, Fadi Abdeladhim Zidi, Salah Eddine Bekhouche + 4 more2026-03-03💻 cs

RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

RnG 는 부분적인 2D 관측으로부터 완전한 3D 구조를 추론하기 위해 재구성과 생성 작업을 통합한 새로운 퓨드-포워드 Transformer 로서, 재구성 유도 인과 어텐션 메커니즘을 통해 가시 영역의 정밀한 재구성과 보이지 않는 영역의 타당한 생성을 동시에 수행하여 실시간 고충실도 3D 모델링을 가능하게 합니다.

Mochu Xiang, Zhelun Shen, Xuesong Li + 7 more2026-03-03💻 cs

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

이 논문은 텍스트만으로 해결 가능한 불필요한 시각 데이터를 식별하고 시각적 필요성 점수 (VisNec) 를 기반으로 고품질 학습 샘플을 선별함으로써, 소량의 데이터로도 효율적이고 강력한 멀티모달 지시 미세 조정을 가능하게 하는 프레임워크를 제안합니다.

Mingkang Dong, Hongyi Cai, Jie Li + 4 more2026-03-03🤖 cs.AI

CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling

이 논문은 LLM 기반의 정합을 통해 200 개 이상의 카테고리에 걸친 범용 정합 데이터셋을 구축하고, 이중 분기 아키텍처를 통해 입력 좌표계를 안정적인 정합 공간으로 변환함으로써 개방형 프롬프트 기반 3D 의미 부분 분할의 성능을 획기적으로 개선한 CoSMo3D 를 제안합니다.

Li Jin, Weikai Chen, Yujie Wang + 7 more2026-03-03💻 cs

Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction

이 논문은 손목 카메라의 단안 RGB 이미지와 자연어 입력을 기반으로 VLM 을 미세 조정하여 3D 객체 위치를 추정하는 새로운 접근법을 제시하며, 로봇이 인간과 상호작용할 수 있는 수준의 정밀도 (중앙값 MAE 13mm) 를 달성했음을 보여줍니다.

Ari Wahl, Dorian Gawlinski, David Przewozny + 3 more2026-03-03🤖 cs.LG

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

이 논문은 기존 VLM 기반 안전 장벽이 고정된 정책에만 과적합되는 문제를 해결하기 위해, 다양한 정책 하의 일반화 능력을 평가하는 새로운 벤치마크 'SafeEditBench'를 제안하고, 검증 가능한 보상을 활용한 강화학습 방법 'SafeGuard-VL'을 통해 진화하는 안전 정책에 적응하는 강력한 이미지 가드레일 모델을 개발했습니다.

Caiyong Piao, Zhiyuan Yan, Haoming Xu + 4 more2026-03-03💻 cs

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

이 논문은 대규모 비전 - 언어 모델의 시각 토큰 가지치기에서 주의 (attention) 와 다양성 (diversity) 기반 방법의 한계를 실증적으로 분석하고, 이미지 특성에 맞춰 적응적으로 조정된 하이브리드 가지치기 전략인 AgilePruner 를 제안하여 성능과 환각 (hallucination) 억제를 동시에 개선하는 방법을 제시합니다.

Changwoo Baek, Jouwon Song, Sohyeon Kim + 1 more2026-03-03🤖 cs.LG

The MAMA-MIA Challenge: Advancing Generalizability and Fairness in Breast MRI Tumor Segmentation and Treatment Response Prediction

이 논문은 다기관 데이터를 활용하여 단일 기관 편향을 해소하고, 유방 MRI 종양 분할 및 치료 반응 예측 모델의 일반화 능력과 하위 그룹 간 공정성을 동시에 평가하기 위해 'MAMA-MIA 챌린지'를 설계하고 그 결과를 제시한 연구입니다.

Lidia Garrucho, Smriti Joshi, Kaisar Kushibar + 43 more2026-03-03🤖 cs.AI

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

이 논문은 기존 확산 모델을 재학습시키지 않고도 쉽게 구할 수 있는 보조 영상 모달리티 (예: X 선 CT) 를 활용하여 희소 데이터로 인한 CT 재구성 품질을 획기적으로 향상시키는 크로스-모달 가이드 방식을 제안합니다.

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain + 2 more2026-03-03💻 cs

Certifiable Estimation with Factor Graphs

이 논문은 Shor 의 완화와 Burer-Monteiro 분해가 인수 그래프 구조를 보존한다는 통찰을 바탕으로, 기존 로봇 공학 및 컴퓨터 비전 분야에서 널리 사용되는 인수 그래프 라이브러리를 활용해 신뢰할 수 있는 전역 최적 해를 제공하는 인증 가능한 추정 시스템을 기존 국소 최적화 방법과 동일한 수준의 용이성으로 설계 및 배포할 수 있는 통합 프레임워크를 제시합니다.

Zhexin Xu, Nikolas R. Sanderson, Hanna Jiamei Zhang + 1 more2026-03-03💻 cs

FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration

이 논문은 자율주행의 궤적 예측 정확도를 높이고 계산 효율성을 개선하기 위해 주파수 도메인 분석과 선형 시간 상태 공간 모델을 결합한 'FoSS' 프레임워크를 제안하며, Argoverse 벤치마크에서 기존 최첨단 방법보다 높은 정확도와 낮은 연산 비용을 달성함을 입증합니다.

Yizhou Huang, Gengze Jiang, Yihua Cheng + 1 more2026-03-03💻 cs

← 이전 다음 →

cs.CV