← 최신 논문
💻 computer science

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

이 논문은 지도 미세 조정 및 강화 학습 전략을 통해 두 작업을 공통의 목표 상태로 정렬함으로써 시각적 이해와 생성 사이의 의미론적 격차를 좁히고, 이를 통해 생성된 편집이 기술된 지시 사항과 일관되게 일치하도록 보장하는 공유 대상 정렬 프레임워크인 STBridge를 소개한다.

원저자: Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 사진을 보고 무엇이 보이는지 정확히 말할 수 있고, 그 직후에 당신의 말에 따라 새로운 그림을 아주 쉽게 그려낼 수 있는 세상을 상상해 보세요. 이것이 바로 "통합 멀티모달 모델(Unified Multimodal Models, UMMs)"의 꿈입니다. 이 모델들을 매우 똑똑한 예술가이자 동시에 숙련된 미술 비평가라고 생각해보세요. 이들은 이해하는 능력(비평가가 그림을 설명하는 것과 같은 시각적 세계의 이해)과 창조하는 능력(예술가가 새로운 장면을 그리는 것과 같은 시각적 세계의 생성)이라는 두 가지 일을 수행하는 하나의 뇌를 가져야 합니다. 오랫동안 과학자들은 하나의 크고 강력한 컴퓨터 뇌를 구축하기만 하면 자연스럽게 두 가지 일을 모두 잘하게 될 것이라고 생각했습니다. 하지만 여기에는 함정이 있습니다. 뇌가 하나로 합쳐져 있다고 해서 두 영역이 완벽하게 대화한다는 뜻은 아닙니다. 때때로 모델의 "비평가" 부분이 빨간 고양이를 묘사하더라도, "예술가" 부분은 파란 강아지를 그릴 수도 있습니다. 그들은 동일한 지침을 따르고 있지만, 최종 결과물이 실제로 어떠해야 하는지에 대해 서로 동의하지 못하는 것입니다. 이 논문은 묘사와 그림 사이의 이 어색한 침묵을 다루며, 모델이 그들의 말과 그림이 정확히 같은 이야기를 하도록 가르치는 방법을 연구합니다.

길림대학교와 텐센트 유투 랩(Tencent YouTu Lab)의 연구진은 이미지로 진행하는 "사이먼 세이즈(Simon Says)" 게임을 통해 이 "정렬 격차(alignment gap)"를 조사하기로 했습니다. 그들은 모델에게 시작 이미지와 "자전거를 추가하라"와 같은 간단한 지시를 주었습니다. 그런 다음 모델에게 두 가지를 요청했습니다. 첫째, 새로 만들어질 그림이 어떻게 보여야 하는지에 대한 상세한 묘사(대상 캡션)를 작성하는 것, 둘째, 실제로 그 그림을 그리는 것입니다. 그러고 나서 그 묘사와 그림을 비교하여 서로 일치하는지 확인했습니다. 그 결과, 기존의 가장 똑똑한 모델들조차 종종 서로 맞지 않는다는 것을 발견했습니다. 모델은 자전거에 대해 완벽한 설명을 써놓고도 정작 자전거를 그리는 것을 잊어버리거나, 자전거를 그리면서도 완전히 다른 것을 설명하기도 했습니다. 이는 마치 초콜릿 케이크 레시피를 써놓고 실수로 피자를 구워버린 요리사나, 프랑스어로 완벽한 문장을 써놓고는 스페인어로 말하는 번역가와 같았습니다.

이를 해결하기 위해 연구팀은 STBridge(Shared-Target Alignment)라는 새로운 훈련법을 발명했습니다. 여러분이 학생에게 작가와 삽화가 모두 되는 법을 가르친다고 상상해 보세요. 그들이 글쓰기와 그림 그리기를 따로 연습하게 하는 대신, 동일한 목표를 향해 동시에 작업하도록 강제하는 것입니다. STBridge에서 "목표"는 특정한 시각적 상태입니다. 모델은 먼저 이 목표를 글로 설명해야 하며, 그다음 즉시 그 단어들을 청사진으로 삼아 그림을 그려야 합니다. 이것은 예술가에게 엄격한 대본을 주는 것과 같습니다: "당신이 그리려는 장면을 정확하게 묘사해야 하며, 그다음 당신이 묘사한 것을 정확하게 그려야 합니다." 만약 묘사와 그림이 일치하지 않으면, 모델은 "엄지손가락을 내리는(thumbs down)" 벌점을 받게 됩니다.

연구진은 단 한 번의 수업에 그치지 않고, 3단계 훈련 캠프를 사용했습니다. 먼저, 그들은 **지도 미세 조정(Supervised Fine-Tuning, SFT)**을 사용하여 모델에게 묘사와 그에 맞는 이미지가 서로 긴밀하게 연결된 수천 개의 사례를 보여주며 기초적인 연결 고리를 확립했습니다. 그다음, 그들은 두 단계의 강화 학습(모델이 시행착오를 거치며 보상을 받는 방식)을 사용했습니다. 첫 번째 단계에서는 모델이 자신이 만들고자 하는 변화를 더 잘, 더 정확하게 묘사하도록 보상했습니다. 두 번째 단계에서는 글쓰기 부분을 고정하고, 개선된 묘사에 완벽하게 부합하는 이미지를 그리는 것에 대해서만 보상을 주었습니다. 이는 모델이 단순히 무작위 추측으로 운 좋게 맞히는 것이 아니라, 두 개의 뇌를 진정으로 조율하는 법을 배우도록 하기 위함이었습니다.

결과는 매우 인상적이었습니다. 연구진이 다양한 과제를 통해 STBridge를 테스트했을 때, 모델은 모든 면에서 눈에 띄게 좋아졌습니다. 모델이 시각적 세부 사항을 얼마나 잘 이해하는지 확인하는 BLINK 테스트에서 점수는 5.15점 상승했습니다. 복잡한 이미지 편집을 위한 테스트인 RISE에서는 점수가 21.00점이나 치솟으며 엄청난 향상을 보였습니다. 아마도 가장 중요한 것은, 모델의 말과 그림이 얼마나 잘 일치하는지를 측정한 것입니다. 이 새로운 훈련 전에는 모델의 설명과 그림이 일치하는 경우가 **57.4%**에 불과했습니다. 하지만 STBridge 이후, 그 일치도는 **90.0%**까지 급증했습니다.

이 논문은 단순히 더 크고 복잡한 컴퓨터 뇌를 만드는 것만으로는 이러한 모델을 진정으로 통합할 수 없음을 시사합니다. 대신, 그들의 이해와 생성을 동일한 "목표 상태(target state)"에 고정하도록 명시적으로 가르쳐야 합니다. 모델에게 자신이 만들고자 하는 것을 먼저 설명하게 하고, 그다음 설명한 것을 정확하게 만들도록 강제함으로써, STBridge는 컴퓨터가 생각하는 것과 만드는 것 사이의 간극을 메웁니다. 이는 컴퓨터가 진정으로 창의적이고 신뢰할 수 있기 위해서는, 그들의 말과 이미지가 지나가는 낯선 사람이 아니라 서로의 가장 친한 친구가 되어야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →