← 최신 논문
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

이 논문은 텍스트 지시사항 내에 이미지를 고유 어휘 토큰으로 임베딩하고 1500 만 개의 인터리브드 샘플로 구성된 확장 가능한 데이터 엔진을 활용하여 다중 이미지 일관성과 복잡한 지시사항 추종 분야에서 기존 방법들을 크게 능가하는 통합 시각 생성 모델인 INSET 을 소개합니다.

원저자: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 예술가에게 매우 구체적이고 복잡한 지시를 내리려 한다고 상상해 보세요.

기존 방식 (인덱스 카드 문제)
현재 대부분의 AI 이미지 생성기는 숫자만 이해하는 사서처럼 작동합니다. 한 사진의 특정 개, 다른 사진의 특정 모자, 세 번째 사진의 특정 배경을 포함한 이미지를 원한다면, 당신은 이렇게 말해야 합니다: "이미지 #1 의 개, 이미지 #2 의 모자, 이미지 #3 의 배경을 사용하여 그림을 그려 주세요."

AI 는 그림을 그리는 동안 어떤 숫자가 어떤 사진에 해당하는지 기억해야 합니다. 사진을 더 추가할수록 AI 는 혼란에 빠집니다. 어느 모자가 어느 개와 매칭되는지 잊어버리거나, 아예 추가된 사진들을 무시해 버립니다. 이는 눈가리개를 하고 다섯 개의 공을 저글링하는 것과 같습니다. 결국 공을 떨어뜨리게 됩니다.

새로운 방식: "문장 속의 이미지" (Inset)
이 논문은 Inset(문장 속의 이미지) 이라는 새로운 모델을 소개합니다. Inset 은 이미지를 번호가 붙은 별도의 파일로 취급하는 대신, 문장 속의 단어처럼 다룹니다.

당신이 이야기를 쓰고 있는데, "개"라는 단어를 쓰는 대신 그 특정 개의 작고 완벽한 사진을 문장 바로 안에 붙여 넣는다고 상상해 보세요.

  • 기존 방식: "이미지 1 의 개를 의자에 올려주세요."
  • Inset 방식: "[개 사진] 을 의자에 올려주세요."

사진이 문장에서 "의자"라는 단어 바로 옆에 있기 때문에, AI 는 숫자를 추측하거나 기억할 필요가 없습니다. 의미가 바로 앞, 정중앙에 있습니다. 이를 통해 AI 는 많은 수의 서로 다른 이미지를 포함하는 복잡한 지시도 혼란 없이 처리할 수 있습니다.

AI 학습 방법 (데이터 공장)
AI 에게 이를 가르치기 위해 연구자들은 인터넷에서 충분한 예시를 찾을 수 없었습니다. 왜냐하면 그러한 예시들은 드물기 때문입니다. 그래서 그들은 확장 가능한 데이터 엔진(데이터를 위한 로봇 공장) 을 구축했습니다.

  1. 사진의 경우: 수백만 장의 사진을 가져와 다른 똑똑한 AI 들을 이용해 분해했습니다. 그들은 모든 사물 (예: "빨간 꽃병"이나 "파란 고양이") 을 식별하고, 그에 대한 문장을 작성한 뒤, 설명이 있던 자리에 해당 사물의 실제 사진을 문장 안에 삽입했습니다.
  2. 동영상의 경우: 그들은 AI 가 사물이 어떻게 변화하는지 학습하도록 동영상을 분석했습니다. 만약 동영상이 고양이가 점프하는 모습을 보여준다면, "시작 부분의 고양이 [앉아 있는 고양이 사진] 를 가져와 점프하게 만드세요 [점프하는 고양이 사진]"이라는 지시를 생성했습니다. 이는 AI 가 정적인 복사뿐만 아니라 움직임과 변형을 이해하도록 가르칩니다.

그들은 이 모델을 훈련시키기 위해 1,500 만 개의 이러한 "사진 - 문장"을 생성했습니다.

결과
그들은 InterleaveBench라는 어려운 과제로 이 새로운 모델을 테스트했는데, 이는 많은 서로 다른 이미지를 하나의 복잡한 요청에 혼합하는 작업입니다.

  • 점수: 2 개의 이미지를 사용하라고 요청했을 때 Inset 은 잘 수행했습니다. 하지만 5 개의 이미지를 사용하라고 요청했을 때, 기존 모델들은 무너진 반면 Inset 은 계속 더 좋아졌습니다. 원본과 유사하게 사물을 유지하고 텍스트 지시를 따르는 데 있어 훨씬 더 정확했습니다.
  • 보너스: AI 가 이미지를 지시의 일부로 학습했기 때문에 편집도 수행할 수 있습니다. 특정 셔츠의 사진을 보여주고 "이 셔츠를 사진 속 사람身上에 입혀주세요"라고 말하면, AI 는 "셔츠"가 어떻게 생겼는지 단순히 추측하는 대신 그 셔츠의 정확한 디자인을 복사합니다.

요약
이 논문은 AI 가 이미지를 참조할 때 "숫자"를 사용하는 것을 멈추고 대신 이미지를 단어처럼 "읽게" 함으로써, 복잡하고 다양한 이미지를 생성하고 편집하는 훨씬 더 강력한 도구를 만들 수 있다고 주장합니다. 그들은 방대한 양의 연습 예제 라이브러리를 구축하고, 특히 작업이 복잡해질 때 그들의 새로운 모델이 모든 기존 오픈소스 경쟁자들을 능가한다는 것을 보여줌으로써 이를 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →