← 최신 논문
💻 computer science

Bend the Basics: Degradation-Aware Deformable Tokenization for All-in-One Image Restoration

본 논문은 적응형 패치 변형(adaptive patch deformation)과 새로운 태스크-토큰 드롭아웃(task-token dropout) 전략을 통해 토큰화 파이프라인 전체에 걸쳐 열화 인지(degradation awareness)를 명시적으로 통합함으로써, 다양하고 공간적으로 불균일한 열화에 대해 성능을 향상시키는 통합 이미지 복원 모델인 Flexible Image Transformer (FIT)를 제안한다.

원저자: Zihao He, Yunfeng Wu, Xinchao Wang, Songhua Liu

게시일 2026-08-10
📖 6 분 읽기🧠 심층 분석

원저자: Zihao He, Yunfeng Wu, Xinchao Wang, Songhua Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 지저로 된 방을 치우려고 노력하고 있다고 상상해 보세요. 하지만 그 지저분함은 곳곳마다 똑같지 않습니다. 한쪽 구석에는 젖은 진흙 묻은 옷더미가 있고, 다른 쪽에는 깨진 창문이 있으며, 또 다른 곳에는 두꺼운 먼지 층이 쌓여 있습니다. 만약 당신이 방 전체에 똑같은 쓸개질 패턴을 사용하는 로봇 청소기를 가지고 있다면, 진흙을 놓치거나, 유리를 깨뜨리거나, 혹은 단순히 먼지를 옆으로 밀어버릴 가능성이 높습니다. 이것이 바로 비, 안개, 흐릿함, 또는 어둠으로 인해 망가진 사진을 고치는 데 전념하는 컴퓨터 과학의 한 분야인 '이미지 복원(image restoration)'이 매일 겪는 고충입니다. 수년 동안 이 작업을 수행해 온 가장 똑똑한 도구들은 그 경직된 로봇과 같았습니다. 그들은 이미지를 작은 고정 크기의 정사각형 타일(포스트잇 조각 같은 격자 형태)로 잘게 나누어 분석합니다. 그런 다음 각 타일을 독립적으로 고치려고 시도합니다. 하지만 비가 내리는 줄기가 두 타일 사이의 경계를 가로질러 지나갈 때, 로봇은 혼란에 빠집니다. 로봇은 한 타일에서는 빗줄기의 윗부분을 고치려 하고, 다른 타일에서는 아랫부분을 고치려 하여, 결국 두 조각이 서로 맞지 않아 눈에 띄는 보기 싫은 이음새를 남기게 됩니다.

당신이 읽게 될 이 논문은 바로 이 특정 '이음새(seam)' 문제를 다룹니다. 이 논문은 컴퓨터가 손상된 이미지를 바라보는 방식에 대한 새로운 사고방식을 소개합니다. 이미지를 고정된 격자에 강제로 맞추는 대신, 저자들은 격자 자체가 메스(mess)에 맞춰 휘어지고 변형될 수 있는 시스템을 제안합니다. 딱딱한 판지 상자 대신 유연한 고무판처럼 생각해보세요. 만약 비 줄기가 대각선으로 달린다면, 고무판은 그 빗줄기를 완벽하게 따라가도록 격자를 늘리고 이동시켜서, 컴퓨터가 전체 문제를 한 번에 파악할 수 있도록 합니다. 이렇게 함으로써 컴퓨터는 눈에 띄는 블록 형태의 선들을 남기지 않고 이미지를 복원할 수 있습니다. 연구진은 이 새로운 시스템을 FIT(Flexible Image Transformer, 유연한 이미지 트랜스포머)라고 부르며, 이미지를 '구부림'으로써 이전보다 더 깨끗하고 선명한 사진을 만들어낼 수 있음을 보여줍니다.

문제점: 구부러지지 않는 "격자"

이 새로운 방법이 왜 중요한지 이해하려면, 현재의 이미지 복원 AI가 어떻게 작동하는지 살펴봐야 합니다. 대부분의 현대적인 시스템은 '패치 토큰화(patch tokenization)'라는 기술을 사용합니다. 거대한 퍼즐을 가지고 있는데, 불규칙한 모양 대신 모든 조각이 완벽한 정사각형이라고 상상해 보세요. 흐릿한 사진을 고치기 위해 컴퓨터는 이미지를 이 작은 정사각형들로 자르고, 각각을 연구한 다음, 그림을 재구성하려고 시도합니다.

저자들이 지적하듯, 문제는 현실 세계의 손상은 이러한 정사각형들을 존중하지 않는다는 점입니다. 빗줄기, 움직임에 의한 흐릿함(motion blur), 안개 등은 종종 이 고정된 정사각형의 경계를 가로질러 나타납니다. 컴퓨터가 반은 빗줄기가 있고 반은 맑은 하늘인 정사각형을 고치려고 할 때, 컴퓨터는 혼란을 겪습니다. '나쁜' 픽셀과 '좋은' 픽셀을 뒤섞어 버리는 것입니다. 정사각형을 다시 합칠 때, 이 불일치는 눈에 띄는 '격자 아티팩트(grid artifact)'—즉, 정사각형이 만나는 지점에 생기는 희미하고 부자연스러운 선이나 이음새—를 만들어냅니다. 이는 마치 찢어진 셔츠를 찢어진 결에 맞지 않는 정사각형 천 조각들로 덧대는 것과 같습니다. 수선한 부분이 투박하고 눈에 띄게 보일 것입니다.

저자들은 이 문제를 해결하려는 이전의 시도들이 이미 방을 정사각형으로 다 잘라놓은 후에 로봇 청소기에게 더 똑똑해지라고 가르치는 것과 같다고 주장합니다. 그들은 이미지의 유형(예: "이것은 비다")에 대한 정보를 컴퓨터의 뇌에 주입했지만, 컴퓨터는 여전히 경직된 격자를 통해 세상을 바라보는 상태에 머물러 있었습니다. 컴퓨터가 문제를 어떻게 고칠지 생각하기도 전에 이미 정사각형 안에 손상이 뒤섞여 버린 것입니다.

해결책: 유연하고 형태가 변하는 격자

저자들은 근본적인 변화를 제안합니다: 고정된 격자를 아예 사용하지 마십시오. 대신, 격자가 구부러지게 하십시오.

그들은 **FIT (Flexible Image Transformer)**라고 불리는 시스템을 도입했습니다. 이 시스템이 어떻게 작동하는지 간단한 비유를 통해 단계별로 설명하겠습니다.

  1. "손상 탐정" (Degradation Encoder): 컴퓨터가 이미지 조각들을 보기 시작하기 전에, 정찰병을 보내 사진 전체를 훑어보게 합니다. 이 정찰병은 단순히 "비가 온다"라고 말하는 것이 아니라, 하나의 지도를 만듭니다. 손상의 전역적인 모습(전역 벡터)을 그리고, 손상이 정확히 어디에서 가장 심한지를 보여주는 상세한 지도(공간 맵)를 작성합니다. 이는 마치 소방관이 불타는 건물을 보고 어느 방이 가장 뜨거운지, 불길이 어디로 번지고 있는지를 즉시 파악하는 것과 같습니다.

  2. "구부러지는 격자" (Deformable Tokenization): 이제 마법이 일어납니다. 컴퓨터는 이미지를 경직된 정사각형으로 자르는 대신, 손상 지도를 사용하여 정사각형을 늘리고 이동시킵니다. 긴 빗줄기가 있다면, 컴퓨터는 빗줄기를 따라 격자선을 늘립니다. 이미지의 일부가 매우 흐릿하다면, 격자는 그 흐릿한 픽셀들을 하나로 모으도록 이동합니다.

    • 비유: 케이크를 자른다고 상상해 보세요. 케이크 안에 길고 얇은 딸기가 들어있을 때, 경직된 칼을 사용하면 딸기를 반으로 잘라 조각을 망치게 됩니다. 하지만 딸기의 곡선을 따라 구부러질 수 있는 유연한 칼이 있다면, 딸기를 피해 완벽하게 자를 수 있습니다. FIT는 정확히 이와 같이 작동합니다. 컴퓨터는 "절단선"을 구부려 모든 조각(또는 '토큰')이 깨끗한 픽셀과 지저든 픽셀이 뒤섞인 상태가 아니라, 일관된 부분의 손상을 포함하도록 만듭니다.
  3. "스마트 해결사" (Transformer): 이미지가 이러한 유연하고 손상을 인지하는 조각들로 잘리고 나면, 컴퓨터는 이를 처리합니다. 조각들이 이제 논리적으로 정리되어 있기 때문에(빗줄기는 한 조각에, 맑은 하늘은 다른 조각에 있음), 컴퓨터는 훨씬 더 정확하게 문제를 해결할 수 있습니다.

  4. "역방향 구부림" (Unembedding): 컴퓨터가 조각들을 고친 후, 이를 다시 합쳐야 합니다. 이때 동일한 구부림 지도를 사용하여 조각들을 원래 위치로 워프(warp)시킵니다. 애초에 조각들이 손상에 맞춰 정렬되었기 때문에, 조각들은 완벽하게 맞물리며 눈에 띄는 이음새를 남기지 않습니다.

"드롭아웃(Dropout)" 기술: 추측하는 법 배우기

저자들이 사용하는 또 하나의 영리한 기술은 **태스크 토큰 드롭아웃(Task-Token Dropout)**입니다. 보통 AI에게 사진을 고치는 법을 훈련시킬 때, 우리는 "이것은 비다"라거나 "이것은 흐릿함이다"라고 정확히 알려줍니다. 하지만 현실 세계에서는 무엇이 잘못되었는지 모르는 경우가 많습니다. 그저 나쁜 사진을 볼 뿐이죠.

AI가 이를 견딜 수 있을 만큼 강력해지도록, 저자들은 가끔 레이블(정답)을 무시하도록 훈련시킵니다. 무작위로 AI에게 "이것은 비가 오는 사진이다"라고 알려준 직의에 곧바로 그 레이블을 회수하여, AI가 단순히 정답을 암기하는 대신 사진을 보고 직접 비가 온다는 것을 알아내도록 강제합니다. 이는 학생에게 수학 문제를 풀 때 가끔은 답안지를 주고, 가끔은 답안지를 뺏어서, 논리를 배우도록 만드는 것과 같습니다. 이를 통해 AI가 비와 안개가 섞인 사진(또는 이전에 본 적 없는 유형의 손상)을 마주하더라도, 혼란 없이 문제를 파악하고 해결할 수 있게 합니다.

결과: 더 선명하고, 깨끗하며, 이음새가 없음

저자들은 다섯 가지 다른 유형의 이미지 손상(노이즈 제거, 비 제거, 안개/헤이즈 제거, 움직임에 의한 흐릿함 수정, 어두운 사진 밝기 조절)에 대해 새로운 FIT 시스템을 테스트했습니다. 그들은 JIT(Just Image Transformers)라는 매우 강력한 베이스라인을 포함하여 기존의 최고 방법들과 비교했습니다.

결과는 인상적이었습니다. 다섯 가지 다른 손상 유형에 대한 표준 테스트에서, FIT는 평균 30.72 dB(복원된 이미지가 원본에 얼마나 가까운지를 나타내는 척도)를 달ol했습니다. 이는 기존의 최고 방법들을 상당한 차이로 앞질렀으며, 다른 최상위 시스템들보다 0.5에서 1.1 dB 더 높은 점수를 기록했습니다. 이미지 복원의 세계에서 단 1 dB의 차이라도 매우 큰 의미를 갖습니다. 1 dB의 도약은 종종 엄청난 품질 향상으로 간주됩니다.

특히, 논문은 FIT가 "공간적으로 균일하지 않은(spatially non-uniform)" 손상(사진의 부위마다 지저분함이 다른 경우)을 처리하는 데 탁면히 뛰어나다는 점을 강조합니다.

  • 비(Rain)에 대하여: FIT는 배경 질감을 날카롭게 유지하면서도 빗줄기를 철저하게 제거했습니다.
  • 안개(Fog)에 대하여: 안개가 낀 영역을 깨끗하게 만들면서도, 맑은 부분이 이상하거나 색이 바래 보이지 않도록 했습니다.
  • 흐릿함(Blur)에 대하여: 다른 방법들이 뭉개진 흔적으로 만들어버린 날카로운 가장자리들을 복구해냈습니다.

가장 시각적인 증거는 '그리드 점수(Grid Score)'입니다. 저자들은 그 보기 싫은 이음새를 측정하는 방법을 고안했습니다. 기존의 경직된 격자 방식은 특히 손상이 심할 때 높은 그리드 점수(많은 이음새)를 보였습니다. 반면 FIT의 그리드 점수는 훨씬 낮았으며, 이는 이미지가 부드럽고 자연스러우며 블록 형태의 선이 보이지 않음을 의미합니다.

이것이 왜 중요한가

이 논문은 이미지를 나누는 방식(토큰화)이 그것을 고치는 '두뇌'만큼이나 중요하다는 것을 시사합니다. 오랫동안 연구자들은 격자가 고정되어 있고 경직되어야 한다고 가정해 왔습니다. 이 논문은 그 가정이 틀렸음을 입증합니다. 격자를 유연하게 만들고 손상의 형태에 따라 구부러지게 함으로써, 컴퓨터는 문제를 더 명확하게 보고 더 효과적으로 해결할 수 있습니다.

저자들은 이 시스템이 모든 이미지 복원 문제를 해결한다고 주장하는 것은 아니며, 실제 환경의 예측 불가능한 시나리오에 대해서는 여전히 테스트가 필요하다고 언급합니다. 그러나 그들은 이 '구부림' 접근 방식이 강력한 새로운 도구임을 입증했습니다. 이는 미래의 사진 편집 도구가 단순히 더 똑똑한 알고리즘이 아니라, 더 유연한 알고리즘, 즉 우리가 치우려는 지저분함에 맞춰 자신의 세계를 보는 관점을 재형성할 수 있는 도구가 될 것임을 시사합니다.

요약하자면, FIT는 때때로 부서진 사진을 고치기 위해서는 경직된 창을 통해 보는 것을 멈추고 유연한 렌즈를 통해 바라봐야 한다는 것을 가르쳐줍니다. 그렇게 할 때, 사진은 훨씬 더 좋아 보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →