← 최신 논문
🤖 AI

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR은 점유 가이드 디스크리미네이터(occupancy-guided discriminator), 불완전한 마스크를 처리하기 위한 알파 헤드(alpha head), 그리고 고품질 학습 데이터를 선별하기 위한 시맨틱 앵커 검증 파이프라인(semantic-anchored verification pipeline)을 도입함으로써 효율적이고 효과 인지적이며 마스크에 강건한 객체 제거를 달로하는 원스텝 확산 모델로서, 다단계 베이스라인보다 현저히 빠른 추론 속도와 함께 우수한 지각적 품질을 결과로 나타낸다.

원저자: Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

게시일 2026-06-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아름다운 해변 사진이 한 장 있다고 상상해 보세요. 그런데 누군가 실수로 낡고 녹슨 낚시용 배를 사진 한가운데에 남겨두었습니다. 당신은 이 배를 지우고 싶습니다.

문제점:
만약 단순히 일반적인 "지우개" 도구를 사용한다면, 배는 지울 수 있겠지만 그 자리에 어울리지 않는 이상한 검은 그림자나 물 위의 반사광이 남을 수 있습니다. 또한, 지우개 원을 직접 그리려고 할 때, 그림자를 아주 조금 놓치거나 실수로 모래 부분을 가려버릴 수도 있습니다.

현재 이 작업을 수행하는 대부분의 AI 도구들은 느리고 생각이 너무 많은 요리사와 같습니다. 배경이 완벽하게 보이도록 수십 단계의 과정을 거치며 이미지를 "요리"하는 데 오랜 시간이 걸립니다. 이들은 강력하지만, 스마트폰에서 실시간으로 사용하거나 빠르게 편집하기에는 너무 느립니다.

해결책: OSOR (One-Step Object Removal, 단일 단계 객체 제거)
이 논문은 OSOR라고 불리는 새로운 방법을 소개합니다. OSOR를 마법 같고 즉각적인 사진 편집기라고 생각해보세요. 이 도구는 단 한 번의 번개처럼 빠른 단계만으로 객체와 그로 인해 발생하는 지저도한 부작용(그림자나 반사광 등)을 동시에 제거할 수 있습니다.

OS-OR가 작동하는 방식은 세 가지 간단한 기술으로 나뉩니다.

1. "스마트 경계" 선생님 (Occupancy-Guided Discriminator, 점유 가이드 판별기)

단 한 단계만으로 무언가를 지우려고 하면, 가장자리가 마치 품질이 낮은 복사본처럼 흐릿하거나 뭉툭해지는 경우가 많습니다.

  • 비유: 학생의 그림을 채점하는 선생님을 상상해 보세요. 일반적인 선생님은 "이 부분은 상자 안이고, 저 부분은 상자 밖이다"라고 말할 뿐입니다. 하지만 OSOR의 선생님은 더 똑똑합니다. 상자의 가장자리를 보고 "이 픽셀은 상자 안에 50% 걸쳐 있으니, 절반만 칠해야 한다"라고 말합니다.
  • 결 result: 이 "분수적(fractional)"인 가르침은 AI가 객체가 어디서 끝나고 배경이 어디서 시작되는지를 정확하게 학습하도록 도와, 흐릿함 없이 날카롭고 깨끗한 가장자리를 만들어냅니다.

2. "추측하는" 조력자 (Alpha Head)

사용자들은 종-종 객체 주변에 완벽한 원을 그리는 데 서툽니다. 당신은 그림자를 포함하지 못해 너무 작은 원을 그릴 수도 있고, 너무 크게 그려서 너무 많은 영역을 가릴 수도 있습니다.

  • 비유: AI를 지워야 할 대상의 대략적인 스케치를 받은 화가라고 생각해 보세요. AI는 단순히 당신이 그린 것만 지우는 것이 아니라, "제6감"(Alpha Head)을 가지고 있습니다. 만약 당신이 배 주변에 작은 원을 그린다면, AI는 물을 보고 "아, 여기 배에 속한 그림자가 있구나, 비록 사용자가 그리지는 않았지만"이라고 판단합니다. 그러고 나서 그 그림자까지 부드럽게 덧칠해 버립니다.
  • 결과: 사용자의 선택 영역이 엉성하거나 불완전하더라도, AI는 나머지 "지저분한 부분"(그림자, 반사광 등)을 스스로 파악하여 자동으로 정리합니다.

3. "팩트 체크" 파이프라인 (SAVP)

이 AI가 이토록 뛰어나도록 가르치기 위해, 연구진은 방대한 양의 "전(Before)"과 "후(After)" 사진 라이브러리가 필요했습니다. 하지만 완벽한 예시를 찾는 것은 어렵습니다. 왜냐하면 많은 예시가 가짜이거나 엉망이기 때문입니다.

  • 비유: 수천 개의 숙제 예시를 보여주며 학생을 가르치려 한다고 상상해 보세요. 어떤 예시는 틀렸을 수도 있습니다. 연구진은 로봇 팩트 체크기(SAVP)를 만들었습니다. 이 로봇은 "전" 사진과 "후" 사진을 비교하여, 변화가 지시 사항(예: "배를 제거하라")과 일치하는지 확인하고, 그림자가 정말로 사라졌는지 검증합니다. 예시가 좋으면 유지하고, 나쁘면 버립니다.
  • 결과: 연구진은 이 로봇을 사용하여 AI가 객체와 그 효과를 완벽하게 제거하는 법을 공부할 수 있도록, 28만 개의 완벽한 예시가 담긴 고품질의 교과서(CORNE)를 구축했습니다.

핵심적인 성과

논문에 따르면 다른 방법들이 사진 한 장을 편집하는 데 6초에서 25초가 걸리는 반면, OSOR는 1초 미만(구체적으로 강력한 컴퓨터에서 약 0.4~0.9초)에 해냅니다.

  • 속도: 기존의 차세대 방법들보다 4배에서 30배 더 빠릅니다.
  • 품질: 객체뿐만 아니라, 빠른 방법들이 자주 놓치는 "유령"(그림자/반사광)까지 제거합니다.
  • 강건성(Robustness): 사용자가 엉성하거나 불완전한 마스크를 그려도 잘 작동합니다.

요약하자면, OSOR는 카메라 셔터의 속도로 작업하면서도 그림자나 반사광이 남지 않도록 완벽하게 처리해 주는 전문 사진 편집자를 고용하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →