← 최신 논문
💻 computer science

Vision-Language Binding in In-Context Image Generation

본 논문은 FLUX.2 와 같은 통합 어텐션 인-컨텍스트 이미지 생성 모델에서 텍스트 토큰이 참조 이미지로부터 스타일과 색상과 같은 일반적인 시각적 속성을 흡수하고 전달하는 구조화된 채널로 작용하는 반면, 구체적인 인스턴스 정체성은 텍스트 토큰을 우회하여 이미지-대-이미지 어텐션을 통해 직접 출력으로 흐른다는 것을 밝혀냈다.

원저자: Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

FLUX.2이라는 이름의 초지능 로봇 예술가가 있다고 상상해 보세요. 이 로봇은 "모자를 추가하세요"와 같은 텍스트 지시와 "빨간 공의 사진"과 같은 참조 이미지를 입력받아 이를 결합하여 새로운 이미지를 생성할 수 있습니다.

오랫동안 우리는 이 로봇이 실제로 단어와 이미지 사이의 연결을 어떻게 이해하는지 알지 못했습니다. 로봇이 먼저 이미지를 보고 그 다음에 단어를 따로 보았을까요? 아니면 둘을 큰 수프처럼 섞어 놓았을까요?

이 논문은 로봇이 작업하는 동안 그 뇌 속을 엿보기 위해 특수 도구를 사용하는 탐정처럼 행동합니다. 연구 결과, 로봇은 정보가 서로 다른 경로를 통해 이동하는 이중 차선 도로와 같이 매우 구체적이고 조직적인 방식으로 정보를 처리한다는 사실이 밝혀졌습니다.

다음은 간단한 비유를 사용하여 그들의 발견 사항을 정리한 것입니다:

1. 두 개의 도로: "번역가" 대 "직통선"

연구자들은 로봇이 모든 정보를 동일하게 처리하지 않는다는 사실을 발견했습니다. 로봇은 작업을 두 개의 명확한 차선으로 나눕니다:

  • 차선 A: "번역가" (텍스트 토큰)

    • 이곳을 통해 이동하는 것: 일반적인 분위기, 색상, 스타일, 장면의 "분위기"입니다.
    • 비유: 텍스트 토큰을 번역가메모 작성자라고 생각하세요. 로봇이 "화창한 만화 스타일의 공원"이라는 참조 이미지를 볼 때, 텍스트 토큰은 그 설명을 흡수합니다. 시각적인 "화창한 만화 공원"을 "화창한 만화처럼 보이게 하라"는 정신적 메모로 변환합니다.
    • 결과: 로봇은 이러한 메모를 텍스트 토큰에 기록하고, 텍스트 토큰은 이를 최종 이미지로 운반합니다. 만약 텍스트 토큰이 이미지를 보지 못하도록 차단하면, 로봇은 "화창한 만화"라는 분위기를 완전히 잊어버립니다.
  • 차선 B: "직통선" (이미지 대 이미지 주의)

    • 이곳을 통해 이동하는 것: 특정 사람의 얼굴, 독특한 흉터, 특정 건물의 정확한 모양과 같은 정확한 세부 사항입니다.
    • 비유: 이를 비선이나 직통 전화라고 생각하세요. 로봇이 참조 이미지에서 특정 얼굴을 복사해야 할 때, 메모 작성자 (텍스트) 에게 묻는 번거로움을 겪지 않습니다. 대신 참조 이미지에서 새로운 이미지로 직접 선을 그어 연결합니다.
    • 결과: 텍스트 토큰은 완전히 우회됩니다. 텍스트가 이미지를 보지 못하도록 차단하더라도, 로봇은 이미지 데이터로 가는 직통선이 있기 때문에 여전히 정확한 얼굴을 복사할 수 있습니다.

2. 세 가지 탐정 도구

이를 파악하기 위해 연구자들은 세 가지 교묘한 트릭 (개입) 을 사용했습니다:

  • 도구 1: "엑스레이 안경" (T2I 렌즈)

    • 그들은 로봇이 작업하는 중간에 멈추어 텍스트 토큰이 작성한 "메모"를 가져온 다음, 로봇에게 원래 이미지를 무시하고 오직 그 메모만을 기반으로 그림을 그리도록 요청했습니다.
    • 그들이 본 것: 메모는 "공원의 빨간 공"과 같은 "분위기"를 성공적으로 묘사했지만, 특정 사람의 정확한 얼굴은 묘사하지 못했습니다. 이는 텍스트 토큰이 일반적인 정보는 보유하고 있지만 정확한 세부 사항은 보유하지 못함을 증명했습니다.
  • 도구 2: "가위" (주의 킥아웃)

    • 그들은 로봇의 부분들 사이의 연결을 끊기 위해 디지털 가위를 사용했습니다.
    • 그들이 본 것: 이미지텍스트 메모 사이의 연결을 끊었을 때, 로봇은 색상과 스타일을 잊어버렸습니다. 하지만 이미지최종 이미지 사이의 연결을 끊었을 때, 로봇은 특정 얼굴을 잊어버렸습니다. 이는 두 개의 분리된 차선을 확인시켜 주었습니다.
  • 도구 3: "메모리 교체" (I2I-to-I2I 패칭)

    • 그들은 한 작업 (예: 빨간 공) 에서 가져온 "메모"를 다른 작업 (예: 파란 차) 에 붙여넣었습니다.
    • 그들이 본 것: 새로운 차가 갑자기 빨간색으로 변했습니다! 하지만 사람의 얼굴을 바꾸기 위해 "메모"를 교체하려고 시도했을 때는 아무 일도 일어나지 않았습니다. 이는 메모가 색상과 스타일을 운반하지만 정체성은 운반하지 않음을 증명했습니다.

3. 비밀 장소: "패딩"

가장 멋진 발견 중 하나는 로봇이 이러한 메모를 텍스트의 어디에 기록하는지였습니다.

  • 텍스트에는 보통 "콘텐츠" (실제로 입력한 단어) 와 "패딩" (텍스트를 표준 길이에 맞추기 위해 추가된 빈 공간) 이 있습니다.
  • 연구자들은 로봇이 이미지의 분위기를 저장하기 위해 실제 단어를 무시한다는 사실을 발견했습니다. 대신 로봇은 모든 시각적 세부 사항 (색상, 스타일) 을 빈 패딩 공간에 기록합니다.
  • 비유: 이는 실제 숙제 답안은 메인 페이지에 쓰지만, 교사의 옷차림에 대한 비밀 메모는 페이지 하단의 빈 여백에 적는 학생과 같습니다. 로봇은 시각적 기억을 보유하기 위해 텍스트의 "빈 공간"을 사용합니다.

요약

이 논문은 로봇이 모든 것을 처리하기 위해 하나의 큰 뇌 (통합된 주의 스트림) 를 사용하지만, 자연스럽게 스스로를 조직화한다는 결론을 내립니다:

  1. 텍스트 토큰 (특히 빈 패딩) 은 일반적인 설명 (색상, 스타일, 장면) 을 운반하는 매개체 역할을 합니다.
  2. 직접적인 이미지 연결정확한 세부 사항 (얼굴, 특정 객체) 을 위한 고속 회선 역할을 합니다.

로봇은 단어와 이미지를 맹목적으로 섞는 것이 아니라, 무엇을 어디에 배치할지 결정하는 내장된 효율적인 시스템을 갖추고 있습니다. 이를 통해 일반적인 분위기는 단어로 번역되고, 정확한 세부 사항은 직접 복사되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →