← 최신 논문
💻 computer science

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image는 시맨틱 우선 디퓨전 패러다임을 활용하여 이전 모델들에 비해 현저히 적은 학습 연산량(125K A800 GPU 시간)으로 여러 벤치마크에서 최첨단 성능을 달나 달성하면서도, 다양한 배포 요구 사항을 위해 확장 가능한 변체와 증류된 몇 단계 버전들을 제공하는 새로운 텍스트-투-이미지 파운데이션 모델입니다.

원저자: SeFi-Team

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: SeFi-Team

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 벽지를 바르기 전에 집을 먼저 짓기

당신이 사람의 설명을 듣고 로봇에게 걸작을 그리도록 가르치고 있다고 상상해 보세요.

기존 방식 (전통적인 AI):
보통 이런 로봇들은 모든 것을 한꺼번에 배우려고 합니다. 나무가 어디에 있는지, 하늘은 어떤 색인지, 잎사귀는 어떻게 생겼는지, 나무껍질의 질감은 어떤지를 단 한 순간에 모두 파악해야 합니다. 이는 마치 집을 짓는 동시에 벽을 칠하고 배관까지 설치하려는 것과 같습니다. 제대로 해내기 위해서는 엄청난 양의 시간, 에너지, 그리고 비용(컴퓨팅 파워)이 듭니다.

SeFi-Image 방식 (Semantic-First Diffusion):
SeFi-Image 팀은 인간이 이런 방식으로 그림을 그리지 않는다는 점에 주목했습니다. 우리는 보통 윤곽선을 먼저 스케치한 다음, 세부 사항을 채워 넣습니다.

  • 1단계: 청사진 (Semantics): 먼저 AI는 "큰 그림"을 파악합니다. 태양은 어디에 있는가? 고양이가 있는가? 고양이가 지붕 위에 있는가? 이를 통해 깨끗하고 구조적인 이미지의 뼈대를 만듭니다.
  • 2단계: 디테일 (Texture): 뼈대가 탄탄해지면, AI는 고양이의 털, 하늘의 구름, 지붕의 질감 등을 채워 넣습니다.

이 논문은 Semantic-First Diffusion이라는 새로운 방법을 소개합니다. 이 방법은 AI가 "페인트"를 걱정하기 전에 "청사진" 부분을 먼저 해결하도록 강제합니다. 청사진이 이미 명확하기 때문에, 디테일을 더하는 작업이 훨씬 쉬워집니다.

이것이 왜 중요한가

1. "가성비" 최고의 슈퍼스타
보통 AI가 그림을 정말 잘 그리게 하려면 수개월 동안 돌아가는 슈퍼컴퓨터가 필요합니다.

  • 비교: 이 논문은 막대한 비용을 들여 훈련된(314,000 GPU 시간 사용) 유명한 모델인 Z-Image를 언급합니다.
  • SeFi-Image의 결과: 그들의 가장 큰 모델(50억 파라미터)은 단 125,000 GPU 시간만을 사용하여 유사하거나 심지어 더 나은 결과를 얻었습니다. 이는 동일한 양의 일을 수행하면서 전기 요금을 10~20% 수준으로만 사용한 것과 같습니다. 학습 과정을 더 잘 조직한다면 돈을 훨씬 적게 쓰고도 고품질의 결과를 얻을 수 있다는 것을 증명했습니다.

2. "세 가지 크기" 접근법
팀은 단순히 하나의 거대한 로봇을 만든 것이 아니라, 세 가지를 만들었습니다:

  • 작은 로봇 (1B): 작고 빠르며 놀라울 정도로 똑똑합니다. 크기가 작음에도 불구하고 지시 사항을 잘 따릅니다.
  • 중간 로봇 (2B): 균형 잡힌 옵션입니다.
  • 큰 로봇 (5B): 가장 복잡한 요청을 처리하는 헤비급 모델입니다.
    이는 사람들이 각자 다른 컴퓨터를 가지고 있기 때문에 매우 유용합니다. 강력한 서버가 있다면 '큰 것'을 사용하고, 노트북을 사용한다면 '작은 것'을 사용할 수 있습니다.

3. 읽기와 쓰기에 능숙함
AI에게 가장 어려운 것 중 하나는 이미지 안에 텍스트(예: 가게 간판이나 책 표지)를 그리는 것입니다.

  • 문제점: 대부분의 AI는 글자를 뒤섞거나 철자를 틀리곤 합니다.
  • SeFi-Image의 해결책: 그들은 AI에게 "합성 데이터(synthetic data)"라는 특수한 식단을 제공했습니다. 예를 들어, 평범한 배경이나 복잡한 레이아웃 위에 텍스트가 있는 수백만 개의 이미지를 생성하여 AI에게 글자가 어떻게 생겼고 어디에 위치해야 하는지를 정확히 가르친 것입니다. 덕분에 SeFi-Image는 길고 복잡한 문장에서도 텍스트를 정확하게 렌더링하는 데 매우 뛰어납니다.

어떻게 훈련했는가 ("커리큘럼")

이 논문은 초등학생에서 대학생으로 올라가는 학생처럼 스마트한 훈련 일정을 설명합니다:

  1. 초등 과정 (Pre-training): AI에게 수백만 개의 단순한 설명이 담긴 이미지를 보여주어 모양과 사물의 기초를 배우게 했습니다.
  2. 고등학교 과정 (Continual Training): 더 높은 품질의 이미지를 사용하여 더 구체적인 지시 사항을 따르는 법을 가르쳤습니다.
  3. 대학교 과정 (Fine-Tuning): 아주 엄격한 필터를 사용하여 오직 최고의 이미지들만 AI에게 보여줌으로써, AI가 단순히 스케치를 하는 수준을 넘어 예술가가 되도록 가르쳤습니다.

또한 그들은 모델의 "터보(Turbo)" 버전을 만들었습니다. 이것은 "빨리 감기" 버튼이라고 생각하면 됩니다. 보통 AI가 이미지를 그리는 데 50단계가 걸린다면, 그들은 증류(distillation) 기술을 사용하여 모델이 단 4단계만으로 이미지를 그릴 수 있도록 가르쳤습니다. 이를 통해 품질 저하를 최소적으면서도 실시간 사용을 위해 훨씬 빠르게 만들었습니다.

무엇을 발견했는가 (결과)

  • 효과가 있습니다: 모델은 복잡한 지시 사항(예: "파란 의자 옆 나무 옆에 빨간 고양이를 놓아줘")을 따르는 여러 테스트(벤치마크)를 통과했습니다.
  • 확장성이 좋습니다: "큰 것(5B)"이 가장 뛰어나지만, "작은 것(1B)"도 다른 회사의 훨씬 더 큰 모델들과 거의 대등한 성능을 보였습니다. 이는 "청사진 우선" 방식이 매우 효율적임을 입증합니다.
  • 이중 언어 지원: 영어와 중국어 모두에서 잘 작동합니다.

한계점 (하지 못한 것)

저자들은 자신들의 모델이 아직 할 수 없는 부분에 대해서도 솔직하게 밝히고 있습니다:

  • 크기 제한: 그들의 가장 큰 모델은 50억 파라미터입니다. 더 크게 만들고 싶었지만, 컴퓨터 자원(구체적으로 NVIDIA A800 GPU 사용 제한)의 한계에 부딪혔습니다.
  • 스타일 다양성: 자연스러운 이미지와 텍스트에 집중했기 때문에, 복잡한 그래픽 디자인이나 인포그래픽 같은 매우 특정한 예술적 스타일에서는 일반적인 사진만큼 뛰어나지 않습니다.
  • 비디오 및 편집: 이 모델은 텍스트로부터 새로운 이미지를 만드는 용도로 제작되었습니다. 기존 사진을 편집하거나 영상을 만드는 기능에 대해서는 아직 테스트하지 않았습니다.

요약

SeFi-Image는 AI에게 그림을 가르치는 새로운 방법입니다. 모든 것을 한꺼번에 배우는 대신, "뼈대"를 먼저 그리고 그 다음에 "피부"를 그리는 법을 가르칩니다. 이 간단한 변화 덕분에 그들은 더 저렴하게 훈련하고, 더 빠르게 실행하며, 현재 사용 가능한 가장 비싼 모델들과 대등하거나 혹은 더 나은 모델을 구축할 수 있었습니다. 그들은 누구나 사용해 볼 수 있도록 코드와 모델을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →