← 최신 논문
💻 computer science

Token-to-Token Alignment of Text Embeddings for Semantic Blending

이 논문은 텍스트 프롬프트를 재구조화하고 그 임베딩을 정렬하여 기저의 연속적인 의미 공간을 드러내는 토큰 간 정렬(Token-to-Token alignment) 프레を生 framework를 소개하며, 이를 통해 생성 모델을 수정하지 않고도 단순한 선형 보간을 통한 매끄러운 이미지 블렌딩과 연속적인 편집을 가능하게 한다.

원저자: Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 두 가지 서로 다른 케이크 레시 recipe가 있다고 상상해 보세요.

  • 레시피 A: "볼에 밀가루, 달걀, 설탕을 넣고 섞은 다음, 굽는다."
  • 레시피 B: "먼저 달걀을 볼에 깨뜨려 넣고, 그다음 설탕과 밀가루를 넣은 뒤, 굽는다."

두 레시피가 정확히 같은 케이크를 설명하고 있음에도 불구하고, 단계의 순서가 다르고 단어의 배열 순서도 다릅니다.

이제, 당신이 이 레시피들을 단순히 긴 단어(토큰)의 목록으로만 이해하는 로봇 요리사라고 상상해 보세요. 만약 당신이 리스트 중간에 있는 단어들을 하나씩 교체하며 레시피 A를 레시피 B로 천천히 바꾸려 한다면, 로봇은 혼란에 빠질 것입니다. 로봇은 섞기도 전에 "굽기"를 시도하거나, "달걀"을 "밀가루"와 이상한 순서로 섞을 수도 있습니다. 그 결과는 두 케이크 사이의 매끄러운 전환이 아니라, 엉망진창이고 망가진 결과물이 될 것입니다.

이것이 바로 **"Token-to-Token Alignment of Text Embeddings for Semantic Blending"**이라는 논문이 AI 이미지 생성기를 위해 해결하고자 하는 문제입니다.

문제점: "번역 과정에서의 손실" 효과

현대적인 AI 이미지 생성기(텍스트를 그림으로 바꿔주는 것들)는 단어의 목록(토큰)을 읽어서 작동합니다. AI에게는 모든 단어가 특정 위치를 갖는 "사전"(임베딩 공간)이 있습니다.

문제는 이 사전이 엉망이라는 점입니다.

  • 만약 당신이 "고양이를 안고 있는 남자"라고 말하면, AI는 "남자"와 "고양이"를 특정 위치에 배치합니다.
  • 만약 당신이 "남자에 의해 안겨 있는 고양이"라고 말하면, 문장 구조가 바뀌었기 때문에 AI는 "고양이"와 "남자"를 다른 위치에 배치합니다.

만약 당신이 첫 번째 문장에서 두 번째 문장으로 AI의 설정을 슬라이드하듯 옮기려 한다면, AI는 첫 번째 문장의 "남자"가 두 번째 문장의 "남자"와 대응된다는 것을 알지 못합니다. AI는 그저 단어들이 위치를 바꾸며 뒤섞이는 것으로만 인식합니다. 결과는 어떠할까요? 이미지는 글리치(오류)가 발생하거나, 이상한 모양으로 변형되거나, 의미를 완전히 잃어버립니다. 이는 마치 노래 A의 첫 음을 연주하고, 그다음 노래 B의 두 번째 음을 연주하고, 다시 노래 A의 세 번째 음을 연주하며 두 노래를 섞으려는 것과 같습니다. 음악이 아닌 소음이 들리게 될 것입니다.

해결책: "번역가"와 "매치메이커"

저자들은 이를 해결하기 위해 **토큰 대 토큰 정렬(Token-to-Token Alignment)**이라 불리는 2단계 프로세스를 제안합니다. 이것을 번역가와 매치메이커가 함께 협력하는 것으로 생각해보세요.

1단계: 번역가 (구조적 정렬)

먼저, 시스템은 스마트한 AI(LLM)를 사용하여 두 개의 원래 문장을 표준화된 형식으로 재작성합니다.

  • 원래 문장 A: "고양이를 안고 있는 남자"
  • 원래 문장 B: "남자에 의해 안겨 있는 고양이"

"번역가"는 두 문장을 라벨이 붙은 칸이 있는 양식처럼 엄격한 템플릿으로 재작성합니다.

  • 칸 1 (주체): 남자 / 고양이
  • 칸 2 (동작): 안고 있음 / 안겨 있음
  • 칸 3 (대상): 고양이 / 남자
  • 칸 4 (색상): 치즈색 / 치즈색

이제 두 문장은 구조적으로 동일해졌습니다. "남자"는 항상 칸 1에 있고, "고양이"는 항상 칸 3에 있습니다. 이것이 단어 순서 문제를 해결합니다.

2단계: 매치메이커 (임베딩 정렬)

구조가 같더라도, AI의 내부 "사전"은 주변 단어들 때문에 첫 번째 문장의 "남자"를 두 번째 문장의 "남자"와 여전히 약간 다르게 취급할 수 있습니다.

"매치메이커"는 두 문장에 있는 모든 단어의 내부 코드(임베딩)를 살펴봅니다. 그것은 단어들이 얼마나 유사한지 계산하고 직접적인 선을 긋습니다.

  • 그것은 "첫 번째 문장의 '남자'는 두 번째 문장의 '남자'와 일치한다, 비록 약간 다르더라도"라고 말합니다.
  • 그것은 문장 A의 모든 개념이 문장 B의 특정 파트너를 갖도록 완벽한 지도를 만듭니다.

마법: 매끄러운 블렌딩

번역가와 매치메이커가 임무를 완수하면, AI는 마침내 원래 의도했던 일을 할 수 있습니다. 바로 **블렌딩(혼합)**입니다.

첫 번째 문장의 모든 단어가 이제 두 번째 문장과 완벽한 파트너를 갖게 되었으므로, AI는 단순히 설정을 한쪽에서 다른 쪽으로 미끄러지듯 옮길 수 있습니다.

  • 이미지는 글리치가 발생하는 대신, "고양이를 안고 있는 남자"에서 "남자에 의해 안겨 있는 고양이"로 부드럽게 변합니다.
  • "남자"는 계속 남자로 남고, "고양이"는 계속 고양이로 남으며, "치즈색" 색상도 일관되게 유지됩니다.

논문은 이것이 세 가지 주요 작업에서 작동함을 보여줍니다:

  1. 연속적 합성 (Continuous Synthesis): 소파 위의 "고양이"를 소파 위의 "사자"로 바꿀 때, 소파가 사라지거나 방의 모습이 변하지 않고 단계별로 변화시킵니다.
  2. 연속적 편집 (Continuous Editing): 흰색 종이학 사진을 가져와서 초록색 용으로 천천히 변하게 만들 때, 각 단계에서 변화가 얼마나 일어날지를 정확히 제어합니다.
  3. 블렌딩 (Blending): 카우보이 사진과 기사 사진을 가져와서, 옷과 동물이 글리치 없이 자연스럽게 변하는 영화 같은 매끄러운 전환을 만들어냅니다.

핵심 요약

저자들은 AI가 이미 이러한 매끄러운 전환을 수행하는 방법을 알고 있다고 주장합니다. 다만 "지도"(텍스트 프롬프트)가 서로 다른 언어로 그려져 있었기 때문에 길을 찾지 못했을 뿐입니다.

그들은 AI를 새로 만들거나 새로운 기술을 가르칠 필요가 없었습니다. 그저 AI가 두 아이디어 사이의 연결고리를 볼 수 있도록 지시 사항을 정리하기만 하면 되었습니다. 단어와 그 의미를 완벽하게 정렬함으로써, 그들은 혼란스럽고 망가진 전환을 매끄럽고 논리적인 여정으로 바꾸어 놓았습니다.

요컨대: 엔진을 바꾸지 말고, 지도만 고치십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →