← 최신 논문
💻 computer science

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

본 논문은 이질적인 인간 및 기계 시각 요구사항에 부합할 수 있는 적응형 적외선 및 가시광선 이미지 융합을 달성하기 위해 속성 정렬 및 선호도 제어 가능한 잠재 확산 모델을 통합하는 직접 선호도 최적화 프레임워크인 DPOFusion을 제안합니다.

원저자: Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 대의 카메라가 동시에 같은 장면을 촬영한다고 상상해 보세요. 하나는 가시광선 카메라(휴대전화와 같은) 로, 선명한 색상과 질감을 잘 포착하지만 어두운 곳에서는 어려움을 겪습니다. 다른 하나는 적외선 카메라로, 어두운 곳에서도 열 신호를 선명하게 포착하지만 흐릿하고 흑백 열화상 유령처럼 보입니다.

이미지 융합은 이 두 장의 사진을 서로의 장점을 모두 갖춘 완벽한 한 장의 이미지로 섞어내는 예술입니다.

문제: "한 가지 크기가 모두에게 맞지 않는다"

이 논문은 기존 융합 방법의 큰 골치 아픈 점을 지적합니다. 그것들은 경직되어 있습니다.

셰프에게 스테이크를 요리해 달라고 요청한다고 상상해 보세요.

  • 일반인은 "미디엄 레어로, 겉은 잘 구워진 상태로 해주세요"라고 말할 수 있습니다.
  • 경비원은 "맛은 상관없어요. 그냥 사람의 얼굴을 선명하게 보여줘서 신원을 확인하게 해주세요"라고 말할 수 있습니다.
  • 자율주행차는 "보행자를 피하기 위해 도로 가장자리를 완벽하게 볼 수 있어야 해요"라고 말할 수 있습니다.

현재의 융합 모델은 오직 하나의 특정 방식으로만 요리할 수 있는 셰프와 같습니다. 다른 결과를 원한다면 완전히 새로운 셰프 (새로운 AI 모델) 를 고용하고 새로운 레시피로 다시 훈련해야 합니다. 이는 느리고 비싸며 유연하지 않습니다.

해결책: "당신의 방식으로 융합하기"

저자들은 DPOFusion이라는 새로운 시스템을 제안합니다. 이를 맛을 조절하는 다이얼이 달린 슈퍼 셰프로 생각하세요.

이 셰프는 고객마다 처음부터 새로운 요리를 만드는 대신, 고품질의 기본 요리를 준비한 뒤 요청에 따라 즉시 미세하게 조정합니다.

다음은 이를 단순한 단계로 나눈 작동 원리입니다.

1. "테이스팅 메뉴" 생성기 (PALDM)

먼저 시스템은 다양한 융합 결과물의 "테이스팅 메뉴"를 생성합니다.

  • 두 개의 원본 사진 (가시광선 및 적외선) 을 가져옵니다.
  • 특수한 AI(잠재 확산 모델) 를 사용하여 다양한 혼합 이미지를 생성합니다. 어떤 것은 90% 적외선, 어떤 것은 50 대 50, 어떤 것은 질감이 강조되고 어떤 것은 대비가 개선된 형태일 수 있습니다.
  • 비유: 한 화가가 조명이나 초점을 약간씩 다르게 하여 풍경화의 50 가지 버전을 빠르게 스케치한다고 상상해 보세요. 이는 시스템이 선택할 수 있는 방대한 옵션 풀을 제공합니다.

2. "맛보기 테스트" (선호도 수집)

이제 시스템은 어떤 버전이 "최고"인지 알아야 합니다. 하지만 "최고"는 누가 묻느냐에 따라 다릅니다.

  • 일반인의 경우: 사람이 스케치를 보고 "여기 차의 질감은 좋지만 하늘은 이상해 보여요"라고 말합니다. 좋은 부분과 나쁜 부분을 표시합니다.
  • 기계의 경우: 보안 카메라 (객체 감지 AI) 가 스케치를 보고 "이건 사람을 못 보이지만, 저건 선명하게 보여요"라고 말합니다.
  • AI 비평가의 경우: 지능형 언어 모델 (VLM) 이 음식 평론가처럼 행동하여 선명도, 노이즈 없음, 자연스러운 색상 등 기술적 품질을 기준으로 이미지를 순위 매깁니다.

3. "마법 다이얼" (직접 선호도 최적화 - IDPO)

이것이 논문의 핵심 비법입니다. 셰프 전체를 다시 훈련시키는 대신 **직접 선호도 최적화 (DPO)**라는 기법을 사용합니다.

  • 기존 방식: 모델에 새로운 선호도를 가르치려면 보통 바닥부터 다시 훈련시켜야 합니다. 이는 셰프를 1 년간 요리 학교로 보내는 것과 같습니다.
  • DPO 방식: 시스템은 "승자" 이미지 (좋아한 것) 와 "패자" 이미지 (싫어한 것) 를 비교합니다. 그런 다음 셰프의 두뇌에 미세하고 정밀한 조정을 가해 다음 이미지가 승자와 더 비슷하게 보이도록 만듭니다.

"마스크" 트릭 (인스턴스 직접 선호도 최적화):
때로는 이미지의 일부만 변경하고 싶을 때가 있습니다.

  • 예시: "차를 더 선명하게 하되 하늘은 건드리지 마세요."
  • 시스템은 마스크( stencil 과 같은 것) 를 사용합니다. AI 에게 "이 마스크 안의 픽셀만 선호도에 맞게 조정하고, 마스크 밖의 모든 것은 그대로 유지하라"고 지시합니다.
  • 이를 통해 차의 디테일을 개선하라고 요청했을 때 실수로 하늘이나 배경을 망치지 않도록 보장합니다.

결과

이 논문의 "마법 다이얼" 시스템을 실제 데이터셋 (야간 거리 장면 등) 으로 테스트했습니다.

  • 일반인 피드백: 이미지를 더 자연스럽게 만들도록 요청했을 때, 시스템은 색상과 질감을 완벽하게 조정했습니다.
  • 기계 피드백: 자율주행차가 더 잘 "보게" 해달라고 요청했을 때, 시스템은 보행자와 차를 강조하도록 이미지를 조정하여 차량의 감지 소프트웨어의 정확도를 크게 높였습니다.
  • 다용도성: 동일한 기본 모델은 재훈련 없이 프롬프트만 변경하면 "일반인 모드", "보안 모드", "주행 모드" 사이를 전환할 수 있습니다.

요약

DPOFusion은 피드백을 통해 학습하는 유연한 이미지 블렌더입니다. 아름다운 사진을 원하는 일반인이든, 선명한 디테일이 필요한 보안 시스템이든, 장애물을 피해야 하는 로봇이든, 이 시스템은 이미지의 나머지 부분은 완벽하게 유지하면서 특정 요구에 맞게 융합 결과를 즉시 조정할 수 있습니다. 이는 "모두를 위한 하나의 모델"에서 "당신의 방식으로의 융합"으로의 전환을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →