← 최신 논문
💬 NLP

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM은 외부 보상 모델이나 인간이 라벨링한 데이터 없이도 시각적 생성 충실도를 크게 향상시키기 위해 모델 자체의 이해 모듈을 내부 평가자로 활용하는 글로벌-로컬 이중 보상 시스템을 갖춘 통합 멀티모달 모델을 위한 자기 보상형 사후 학습 프레임워크를 도입한다.

원저자: Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 재능 있는 예술가이자 동시에 매우 엄격한 미술 비평가가 있다고 상상해 보세요. 이 예술가는 **통합 멀티모달 모델(Unified Multimodal Model, UMM)**이라는 단 하나의 컴퓨터 프로그램 안에 살고 있습니다.

여기서 논문이 지적하는 문제는 다음과 같습니다.
이 예술가는 그림을 비평하는 데는 매우 뛰어납니다. 만약 당신이 그림을 보여주며 "이것이 '파란 테이블 위의 빨간 사과'라는 묘사와 일치하나요?"라고 묻는다면, 그들은 즉시 실수를 찾아낼 수 있습니다. 하지만 당신이 그들에게 정확히 그 그림을 그려보라고 요청하면, 그들은 종종 실수를 저지릅니다. 사과를 초록색으로 그리거나 테이블의 위치를 잘못 잡기도 합니다. 그들의 "비평가 뇌"는 "예술가 손"보다 더 똑똑합니다.

SRUM(Unified Multimodal Models를 위한 자기 보상 학습)은 이 간극을 해결하는 새로운 훈련 방법입니다. 이는 모델이 인간 교사나 별도의 컴퓨터 프로그램으로부터 자신의 작품을 채점받는 대신, 자신의 "비평가 뇌"를 사용하여 "예술가 손"을 코칭하도록 가르칩니다.

SR-UM이 작동하는 방식은 다음과 같이 간단한 단계로 나뉩니다.

1. "시도, 판단, 그리고 수정" 루프

인간이 그림을 채점하기를 기다리는 대신, 모델은 스스로 이를 수행합니다:

  • 1단계 (예술가): 모델은 프롬프트(예: "파란 테이블 위의 빨간 사과")에 따라 이미지를 그리려고 시도합니다.
  • 2단계 (비평가): 모델 내부의 "이해" 모듈이 방금 그린 그림을 살펴봅니다. 이것은 내부적인 판사 역할을 합니다. 단순히 "좋음" 또는 "나쁨"이라고 말하는 것이 아니라, 점수를 매기고 그런지에 대해 설명합니다.
  • 3단계 (교훈): 모델은 이 스스로 생성된 점수를 사용하여 미래의 그림을 조정합니다. 만약 비평가가 "사과가 너무 초록색이다"라고 말한다면, 예술가는 다음번에 사과를 더 붉게 만들기 위해 학습합니다.

2. "전역 및 지역" 성적표

논문은 단순한 "잘했어"라는 말만으로는 충분하지 않다고 주장합니다. 정말 잘하기 위해서는 예술가에게 두 가지 구체적인 피드백이 필요하며, SRUM은 이를 제공합니다:

  • 전역 보상 (전체적인 모습): 이것은 방 안을 돌아다니는 갤러리 관장과 같습니다. 그들은 전체 장면이 말이 되는지 확인합니다. 테이블이 실제로 사과 아래에 있는가? 하늘이 지면 위에 있는가? 이는 전체적인 레이아웃이 올바른지 보장합니다.
  • 지역 보상 (세부 사항): 이것은 돋보기와 같습니다. 특정 사물들을 확대해서 봅니다. 사과가 실제로 빨간색인가? 테이블의 나무 질감이 사실적인가? 이는 큰 그림이 놓칠 수 있는 작고 구체적인 실수들을 바로잡습니다.

이 두 가지를 결집함으로써, 모델은 완전한 성적표를 받게 됩니다: "방의 모습은 맞지만(전역), 사과를 더 붉게 만들어야 한다(지역)."

3. 이것이 왜 중요한가

보통 AI가 그림을 더 잘 그리도록 훈련하려면 다음과 같은 것들이 필요합니다:

  • 이미지를 보고 그것이 좋은지 나쁜지 말해줄 수 있는 수천 명의 인간 전문가.
  • 또는, 판사 역할을 할 별도의 거대한 AI 프로그램.

SRUM은 이 두 가지의 필요성을 제거합니다. 모델은 자신의 내부 지식을 사용하여 스스로를 채점합니다. 이것은 마치 학생이 연습 에세이를 쓰고, 자신이 공부했던 교재를 사용하여 스스로 에세이를 채점한 다음, 더 좋은 성적을 받기 위해 에세이를 다시 쓰는 것과 같습니다.

결과

논문은 복잡한 작업, 예를 들어 특정 개수의 물체를 그리거나 3D 공간에 아이템을 배치하는 작업(예: "노란 사과 위의 빨간 바나나")에 대해 테스트했습니다.

  • SRUM 이전에는 모델이 이해력은 좋았으나 이러한 복잡한 장면을 그리는 데는 서툴렀습니다.
  • SRUM 이후에는 모델의 드로잉 능력이 크게 향상되었습니다. 모델은 자신의 강력한 이해력을 더 나은 생성 능력으로 전환하는 법을 배웠습니다.

요약하자면: SRUM은 멀티모달 모델이 자신의 "뇌"를 사용하여 자신의 "손"에게 전체적인 모습과 아주 작은 세부 사항을 모두 체크하는 이중 시스템을 통해 그림을 더 잘 그리는 법을 가르치는 자기 개선 시스템입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →