← 최신 논문
🤖 AI

SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model

이 논문은 물리적으로 정확한 합성 데이터셋 생성 프레임워크와 미세 조정된 거대 멀티모달 모델을 결합하여 최첨단 단일 이미지 반사 제거 및 분리 성능을 달성하는 새로운 접근 방식인 SIRR-LMM을 소개한다.

원저자: Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu

게시일 2026-02-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제: 창문에 비친 "유령"

당신이 박물관 안에 걸려 있는 아름다운 그림을 사진으로 찍으려고 한다고 상상해 보세요. 하지만 그림 앞의 유리 케이스에 당신 뒤쪽의 사람들과 조명이 반사되어 보입니다. 카메라는 내가 원하는 것(그림)과 원하지 않는 것(반사된 모습)이 뒤섞인 지저분한 장면을 포착하게 됩니다.

컴퓨터 비전의 세계에서는 이를 **단일 이미지 반사 제거(Single-Image Reflection Removal, SIRR)**라고 부릅니다. 이는 카메라가 단 한 장의 사진만을 가지고 작업해야 하기 때문에 매우 까다로운 퍼즐입니다. 마치 두 개의 서로 다른 노래가 동시에 녹음된 하나의 마이크 소리를 분리해내려는 것과 같습니다.

오랫동안 컴퓨터는 다음과 같은 이유로 이 문제를 해결하는 데 어려움을 겪었습니다:

  1. 실제 데이터를 구하기 어렵습니다: 컴퓨터에게 이 문제를 해결하는 법을 가르치려면 "정답지"(반사가 없는 그림 사진과 그림이 없는 반사 사진)가 필요합니다. 하지만 현실 세계에서 유리를 옮기거나 그림을 움직이지 않고 이런 사진을 찍는 것은 거의 불가능합니다.
  2. 가짜 데이터는 너무 가짜입니다: 이전의 시도들은 단순히 두 사진을 위에 겹쳐 놓는 방식으로 "가짜" 학습 데이터를 만들었습니다. 하지만 실제 유리는 단순히 이미지를 위에 얹어 놓은 것이 아닙니다. 유리는 빛을 굴절시키고, 흐릿한 유령 이미지를 만들며, 각도에 따라 색상을 변화시킵니다. 단순한 레이어 겹치기는 이러한 물리 법칙을 놓치게 됩니다.

해결책: "물리적으로 완벽한" 시뮬레이터

저자들은 초정밀 비디오 게임 시뮬레이터처럼 작동하는 새로운 방식의 학습 데이터 생성법을 구축했습니다.

단순히 사진을 쌓는 대신, 그들은 **경로 추적(path tracing)**이라는 기술을 사용했습니다. 빛의 줄기를 하나의 작은 당구공이라고 상상해 보세요. 시뮬레이터는 이 "빛의 공" 수백만 개를 유리창의 3D 모델에 쏩니다.

  • 어떤 공들은 유리에서 튕겨 나갑니다 (반사를 생성).
  • 어떤 공들은 유리를 통과합니다 (그림을 보는 시야를 생성).
  • 어떤 공들은 유리 내부에서 이리저리 튀어 다니다가 밖으로 나옵니다 (흐릿한 이중 이미지인 "유령" 현상을 생성).

그들은 이러한 물리 시뮬레이션과 실제 세상의 사진을 결합했습니다. 그 결과, 컴퓨터가 과노출된 밝은 지점이나 흐릿한 반사 등 실제 세상에서 빛이 어떻게 행동하는지 정확하게 배울 수 있는 데이터셋을 만들어냈습니다.

두뇌: "다국어 구사" 예술가를 가르치기

그들의 발명품 중 두 번째 부분은 컴퓨터에게 이 퍼즐을 푸는 법을 가르치는 방법입니다. 그들은 처음부터 새로운 컴퓨터를 만든 것이 아니라, **대규모 멀티모달 모델(Large Multimodal Model, LMM)**을 사용했습니다.

LMM은 수십억 장의 사진을 보고 그것을 글로 설명할 수 있는 초능력을 가진 슈퍼 아티스트와 같습니다. 이 아티스트는 이미 수많은 창문 사진을 보았기 때문에 유리가 어떻게 생겼는지 이미 알고 있습니다.

저자들은 이 아티스트에게 특정 업무를 가르치기 위해 영리한 트릭을 사용했습니다:

  1. "샌드위치" 방식: 아티스트에게 지저한 사진을 보여주고 깨끗한 사진을 달라고 요청하는 대신, "샌드위치" 이미지를 입력했습니다. 지저한 사진, 깨끗한 그림, 그리고 반사된 모습을 하나의 거대한 이미지 안에 나란히 붙여 넣은 것입니다.
  2. 비밀 레시피 (LoRA): 거대한 아티스트 전체를 다시 학습시키는 대신(이는 엄청난 시간과 비용이 듭니다), 아티스트의 뇌에 작고 가벼운 "어댑터"(LoRA라고 불림)를 추가했습니다. 이 어댑터는 모델에게 이렇게 가르칩니다: "이 특정한 이미지 샌드위치를 볼 때, 그것들을 분리하는 패턴을 학습하라."

또한 그들은 모델에게 특정 "레시피 카드"(텍젝트 프롬프트)를 주어 작업을 설명했습니다: "여기 유리가 있는 사진이 있고, 여기는 투과된 모습이며, 여기는 반사된 모습이다." 이 특정 레시피를 통해 훈련함으로써, 모델은 매번 일일이 지시받지 않아도 반사 제거의 논리를 학습할 수 있었습니다.

결과: 더 깨끗한 창문, 더 선명한 반사

이 새로운 방법을 기존의 가장 뛰어난 도구들과 비교 테스트했을 때 다음과 같은 결과가 나타났습니다:

  • 더 잘 보입니다: 반사가 너무 밝아 이미지가 하얗게 날아간(과노출된) 사진에서도, 이 방식은 누락된 디테일을 정확하게 "인페인팅(inpaint, 빈 곳 채우기)" 할 수 있었습니다. 예를 들어, 반사된 모습에 빨간색 받침대가 보인다면, 모델은 메인 이미지가 하얗게 날아갔더라도 반사 레이어에 빨간색을 유지해야 한다는 것을 알아냅니다.
  • 더 잘 분리합니다: 기존 방식들은 종종 "유령" 현상이나 흐릿한 얼룩을 남기곤 했지만, 이 방식은 유리 뒤의 물체를 훨씬 더 깨끗하게 보여줍니다.
  • 반사를 복원합니다: 대부분의 도구는 단순히 반사를 지우려고만 합니다. 하지만 이 도구는 반사를 별도의 선명한 이미지로 재구성합니다. 모델은 빛의 원리에 대한 지식을 사용하여, 반사가 거의 보이지 않는 어두운 영역에서도 반사가 어떤 모습일지 예측해 낼 수 있습니다.

요약

요약하자면, 저자들은 다음 두 가지를 통해 "더러운 창문" 문제를 해결했습니다:

  1. 물리 기반 시뮬레이터를 구축하여 완벽한 학습 데이터를 생성했습니다 (따라서 컴퓨터는 단순한 패턴이 아니라 빛의 법칙을 배웁니다).
  2. 사전 훈련된 "슈퍼 아티스트" AI를 사용하고, 여기에 작고 특화된 업그레이드(LoRA)를 가하여 "유령"과 "실제 사물"을 분리하는 법을 배웠습니다.

그 결과, 이 시스템은 창문이 찍힌 단 한 장의 사진만 보고도 마법처럼 두 개의 완벽한 이미지로 나눌 수 있습니다. 하나는 유리 뒤에 무엇이 있는지 보여주는 이미지이고, 다른 하나는 유리 위에 정확히 무엇이 반사되었는지를 보여주는 이미지입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →