← 최신 논문
🤖 machine learning

MIRO: MultI-Reward cOnditioned pretraining improves T2I quality and efficiency

MIRO 는 여러 보상을 동시에 조건으로 삼아 텍스트-이미지 생성기를 학습시키는 새로운 사전 학습 방법으로, 구성 및 사용자 선호도 벤치마크에서 최첨단 성능을 달성하면서도 시각적 품질, 학습 효율성, 다양성을 동시에 향상시킵니다.

원저자: Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Vicky Kalogeiton, David Picard

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Vicky Kalogeiton, David Picard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 예술가를 가르쳐 그림을 그리게 한다고 상상해 보세요.

구식 방법: "필터링과 처벌" 방식
전통적으로 이러한 AI 예술가를 훈련시킬 때 연구자들은 다소 가혹한 학교 시스템과 같은 세 단계 과정을 사용했습니다.

  1. 지저분한 교실: 먼저 로봇은 인터넷의 수백만 장의 무작위 이미지를 봅니다 (일부는 걸작이고 일부는 낙서입니다). 로봇은 이미지가 어떻게 보이는지는 배우지만, 인간이 무엇을 좋아하는지는 잘 모릅니다.
  2. 검열관: 다음으로 교사들은 "나쁜" 그림을 모두 버리고 로봇에게 다시 가르치기 위해 "좋은" 그림만 남깁니다. 이는 책장 몇 페이지가 찢어졌다는 이유로 도서관 전체를 버리는 것과 같습니다. 이야기의 구성 방식에 대한 맥락을 잃게 됩니다.
  3. 처벌: 마지막으로 강화 학습이라는 기법을 사용합니다. 로봇에게 그림을 보여주고 인간에게 "이걸 좋아하나요?"라고 묻고, 답이 "아니오"라면 로봇을 처벌합니다. 로봇이 실제로 좋은 그림을 그리지 않고도 "예스"를 받기 위해 시스템을 속이려 하면, 테스트를 "조작"하는 법을 배우게 됩니다 (보상 해킹이라고 불리는 문제입니다).

그 결과는 무엇일까요? 로봇은 한 가지 특정 유형의 "완벽한" 그림을 만드는 데는 능숙해지지만, 지루해지고 창의성을 잃으며 학습에 시간이 오래 걸립니다.

신식 방법: MIRO ("다중 작업 멘토")
이 논문은 MIRO를 소개하며 게임의 규칙을 완전히 바꿉니다. 나쁜 데이터를 걸러내거나 나중에 로봇을 처벌하는 대신, MIRO는 로봇이 처음부터 품질 점수를 이해하도록 가르칩니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. "품질 성적표"

로봇이 보는 모든 이미지는 성적표와 함께 제공된다고 상상해 보세요. 이 성적표는 단순히 "합격" 또는 "불합격"이라고만 말하지 않습니다. 다음과 같은 일곱 가지 항목에 대한 구체적인 점수를 매깁니다:

  • 예쁜가요? (미적 가치)
  • 인간이 좋아하나요? (사용자 선호도)
  • 그림이 설명과 일치하나요? (텍스트 - 이미지 정렬)
  • 논리가 올바른가요? (시각적 추론)
  • 과학적으로 정확한가요? (과학적 정확성)
  • 그리고 몇 가지 기타 항목.

2. 전체 스펙트럼 학습

구식 방법에서는 교사들이 "C"와 "D" 등급을 버렸습니다. 하지만 MIRO에서는 로봇이 모든 등급을 유지합니다.

  • 미적 가치에서 "C"가 어떤 모습인지 배웁니다.
  • 과학적 정확성에서 "A"가 어떤 모습인지 배웁니다.
  • 아름다움에서는 "B"지만 텍스트 정렬에서는 "A"인 그림이 있을 수 있음을 배웁니다.

품질의 전체 스펙트럼을 봄으로써 로봇은 단순히 "완벽한" 것들을 외우는 것이 아니라, 이미지가 만들어지는 깊은 구조를 학습합니다. 이는 정답만 외우는 것이 아니라, 오답이 왜 틀렸는지 정확히 이해하기 위해 실패한 시험지까지 모두 공부하는 학생과 같습니다.

3. 마지막의 "볼륨 노브"

이 부분이 가장 놀랍습니다. 로봇이 특정 점수를 특정 시각적 스타일과 연관시키는 법을 배웠기 때문에, 믹싱 콘솔이나 볼륨 노브처럼 출력을 조절할 수 있습니다.

로봇에게 그림을 그리라고 요청할 때 단순히 "잘 그려줘"라고 말하지 않습니다. 원하는 대로 정확히 조절할 수 있습니다:

  • "미적 가치 노브를 10 으로 높이고, 과학 노브는 5 로 유지해 줘."
  • "텍스트 정렬이 완벽하도록 해줘. 색상이 조금 이상해도 괜찮아."

이 논문은 이러한 노브를 조절함으로써 로봇이 동일한 단일 모델에서 혼란스럽고 다양한 이미지 세트를 생성하거나, 매우 다듬어진 구체적인 이미지를 즉시 생성할 수 있음을 보여줍니다. 새로운 요청마다 로봇을 다시 훈련시킬 필요가 없습니다.

왜 이것이 중요한가 (논문에 따르면)

  • 속도: 로봇이 "좋은" 것뿐만 아니라 모든 데이터에서 학습하고 즉시 품질 규칙을 이해하기 때문에, 이전 방법보다 19 배 더 빠르게 학습합니다.
  • 효율성: MIRO로 훈련된 작은 로봇 (0360 억 개 파라미터) 은 FLUX-dev 와 같은 거대 로봇 (120 억 개 파라미터) 을 이길 수 있으며, 370 배 적은 컴퓨팅 파워를 사용합니다. 이는 거대하고 느린 공장보다 똑똑하고 잘 훈련된 견습공이 더 뛰어난 성과를 내는 것과 같습니다.
  • 속임수 부재: 로봇이 일곱 가지 다른 점수를 동시에 균형 있게 조절하기 때문에, 한 가지 항목 (예: 그림은 예쁘게 보이게 하지만 텍스트는 무시하는 것) 에서 높은 점수를 받기 위해 쉽게 "속일" 수 없습니다. 균형을 찾아야 하므로 더 좋고 정직한 결과가 나옵니다.

한 줄 요약:
MIRO 는 AI 훈련을 "합격 또는 불합격" 게임처럼 취급하는 것을 멈춥니다. 대신 이를 복잡한 품질 언어를 배우는 과정으로 대우합니다. 모든 이미지에 대한 다차원 성적표를 읽도록 AI 에게 가르침으로써, 간단한 다이얼로 사용자의 정확한 요구 사항에 맞춰 조정할 수 있는 더 똑똑하고 빠르며 제어 가능한 예술가를 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →