OmniGen2: Towards Instruction-Aligned Multimodal Generation
이 논문은 텍스트와 이미지를 위한 별도의 디코딩 경로를 도입하고 반성 메커니즘을 통해 텍스트 생성 능력을 유지하면서 다양한 생성 작업에서 최첨단 성능을 달성하는 오픈소스 멀티모달 생성 모델 OmniGen2 를 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎨 오미제네 2 (OmniGen2): "명령을 완벽하게 듣는 만능 그림 그리는 로봇"
이 논문은 인공지능이 그림을 그릴 때, 우리가 내리는 정교한 지시사항을 얼마나 잘 이해하고 따라하는지를 획기적으로 개선했다는 내용을 담고 있습니다. 마치 "그림을 그리는 로봇"이 단순히 명령을 듣는 것을 넘어, 마치 인간처럼 상황을 파악하고 실수를 스스로 고치는 능력을 갖게 된 이야기입니다.
이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드릴게요.
1. 문제점: "왜 그림이 내 뜻대로 안 그려질까?"
기존의 AI 그림 도구들은 "노란 브로콜리 그려줘"라고 하면 노란 브로콜리를 그리기는 하지만, "노란 브로콜리인데 잎사귀는 초록색으로 하고 배경은 공원으로 바꿔줘"처럼 복잡하고 세부적인 명령을 받으면 헷갈려하거나 엉뚱한 그림을 그리곤 했습니다. 마치 "그림을 잘 그리는 천재"지만 "지시사항을 잘 듣지 못하는 학생" 같은 느낌이었죠.
2. 해결책: 오미제네 2 (OmniGen2) 의 두 단계 훈련법
연구팀은 이 문제를 해결하기 위해 두 단계의 훈련 과정을 고안했습니다.
1 단계: "세상 모든 것을 아는 기초 체력 다지기" (Foundation Model)
- 비유: 그림을 그릴 준비를 하는 유치원생을 대학생으로 키우는 과정입니다.
- 내용: 먼저 AI 에게 세상의 모든 사물, 상황, 스타일에 대한 지식을 대량으로 주입합니다. 단순히 그림만 그리는 게 아니라, "이게 뭐지?", "이건 어떻게 생겼지?"를 이해하는 **시각 언어 모델 (VLM)**을 기반으로 합니다.
- 특징: 이 단계에서 AI 는 다양한 그림을 그릴 수 있는 기본 실력을 갖추지만, 아직 지시사항을 완벽하게 따르지는 못합니다.
2 단계: "명령을 완벽하게 따르는 훈련" (Instruction Alignment)
- 비유: 이제 실전 연습을 시키는 단계입니다. 선생님이 "왼쪽에 개를, 오른쪽에 고양이를"이라고 하면, AI 는 그림을 그리고 스스로 점검합니다. "아, 내가 개를 오른쪽에 그렸네? 다시 그려야지!"라고 스스로 수정하는 과정을 반복합니다.
- 핵심 기술 (강화 학습): AI 가 그림을 그릴 때마다 "이게 내 명령과 맞나요?"라는 **점수 (보상)**를 줍니다. 점수가 낮으면 다시 그리고, 점수가 높으면 칭찬합니다. 이 과정을 여러 번 반복하며 AI 는 어떤 명령이든 정확하게 이해하고 실행하는 법을 배웁니다.
3. 오미제네 2 의 특별한 능력 (마법 같은 기능들)
이 모델은 세 가지 주요 능력을 모두 다룰 수 있습니다.
- 텍스트 → 그림 (Text-to-Image):
- "해변에 앉아 있는 파란색 드레스를 입은 소녀"라고 말하면, 바로 그 그림을 그려줍니다.
- 그림 수정 (Image Editing):
- 기존 그림에서 "오리 제거하기", "모자 추가하기", "색깔을 분홍색으로 바꾸기"처럼 일부만 수정하라고 하면, 나머지 부분은 건드리지 않고 딱 그 부분만 고쳐줍니다.
- 맥락 생성 (In-Context Generation):
- 가장 놀라운 기능입니다. "이 사진의 사람 (A) 과 이 사진의 고양이 (B) 를 합쳐서, 둘이서 차를 마시는 그림을 그려줘"라고 하면, 두 개의 다른 사진 속 캐릭터를 가져와서 자연스럽게 합쳐서 새로운 그림을 만듭니다. 마치 레고 블록처럼 서로 다른 조각을 맞춰 새로운 작품을 만드는 것과 같습니다.
4. 새로운 시험지: "오미컨텍스트 (OmniContext)"
기존에는 AI 가 맥락을 이해하는지 테스트할 수 있는 공인된 시험지가 없었습니다. 연구팀은 이를 위해 **새로운 시험지 (OmniContext)**를 만들었습니다.
- 내용: "이 캐릭터의 얼굴은 그대로 유지하면서 배경을 우주로 바꿔줘", "이 사물을 다른 사람 손에 쥐게 해줘" 등 정교한 조건을 충족하는지 평가합니다.
- 결과: 오미제네 2 는 이 시험에서 다른 어떤 AI 보다 높은 점수를 받아, 명령을 가장 잘 따르는 AI임을 증명했습니다.
5. 요약: 왜 이것이 중요한가요?
- 기존: "그림 좀 그려줘" → "어? 내가 원하는 게 아니네." (수정 반복)
- 오미제네 2: "이거 저거 고쳐줘" → "네, 알겠습니다. 바로 수정했습니다." (한 번에 해결)
이 기술은 앞으로 디자이너, 화가, 일반 사용자 모두에게 큰 혜택을 줍니다. 복잡한 지시사항을 반복해서 말하지 않아도, AI 가 내 마음속 그림을 정확히 이해해서 한 번에 만들어주기 때문입니다.
한 줄 요약:
오미제네 2 는 "세상의 모든 것을 알고, 내 말 한마디 한마디를 귀 기울여 듣고, 실수가 있으면 스스로 고치는" 똑똑한 그림 그리는 로봇입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.