← 최신 논문
🤖 AI

When Do Diffusion Models learn to Generate Multiple Objects?

본 논문은 Mosaic 프레임워크를 도입하여 텍스트-이미지 확산 모델의 다중 객체 생성 시 unreliability 가 개념 불균형보다는 주로 장면 복잡성과 저데이터 환경에서 카운팅 및 구성적 일반화 학습의 어려움에서 비롯됨을 입증합니다.

원저자: Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능은 있지만 약간 혼란스러운 화가를 상상해 보세요. 당신의 설명을 바탕으로 그림을 그리도록 가르치고 있습니다. 당신은 "파란색 개 옆에 앉아 있는 빨간색 고양이"와 같이 여러 가지 물건이 있는 장면을 그리도록 하고 싶습니다.

이 논문은 현대의 AI 화가들 (Diffusion Models 라고 함) 이 단일 물체를 그리는 데는 뛰어나지만, 여러 가지를 함께 그리라고 요청받으면 종종 실패하는 이유를 조사합니다. 그들은 하나의 고양이 대신 두 마리의 고양이를 그리거나, 어떤 색이 어떤 동물에 속하는지 혼동하거나, 동물들이 어디에 앉아 있어야 한다는 지시를 완전히 무시할 수 있습니다.

연구자들은 다음과 같은 궁금증을 가졌습니다: 화가가 그림을 그리는 데 서툰 것일까요, 아니면 설명서 (데이터) 에 결함이 있는 것일까요?

이를 알아내기 위해 연구자들은 MOSAIC이라는 특수하고 통제된 "훈련 체육관"을 구축했습니다. 지저분한 실제 사진 대신, 모든 세부 사항을 통제할 수 있는 구와 정육면체와 같은 기하학적 모양으로 구성된 단순한 장면을 만들었습니다.

여기서 그들이 발견한 바를 간단한 개념으로 나누어 설명합니다:

1. "세기" 문제 (마법의 숫자)

유추: 화가에게 "사과 하나"를 그리라고 한 다음, "사과 두 개", 그리고 "사과 열 개"를 그리라고 상상해 보세요.

  • 발생한 일: 화가가 방대한 예제 라이브러리 (대규모 데이터셋) 를 가지고 있을 때는 완벽하게 셀 수 있었습니다. 하지만 라이브러리가 작았을 때 화가는 혼란스러워졌습니다.
  • 반전: 단순히 "열"이라는 단어를 얼마나 자주 보았는지에만 문제가 있었던 것은 아닙니다. "열"을 자주 보았더라도 장면이 열 개의 물건으로 붐비면 화가는 어려움을 겪었습니다.
  • 결론: 세기는 독특하게 어렵습니다. 작은 훈련 세트에서 화가는 처음에는 개수를 정확히 맞추지만, 계속 연습할수록 실제로는 더 나빠져서 종종 열 개의 물건을 세 개나 네 개로 줄여 그렸습니다. 마치 화가가 혼란스러워지고 그림을 "깔끔하게" 보이게 하려고 단순히 물건을 더 적게 그리기로 결정하는 것과 같습니다.
  • 해결책: 물건을 무작위로 흩뿌리는 대신 정돈된 격자 (틱택토 보드와 같은) 에 그리도록 하면 화가는 세는 데 훨씬 능숙해집니다. 이는 AI 가 단순히 더 많은 데이터가 필요한 것이 아니라 공간을 조직할 "도움" (귀납적 편향) 이 필요함을 시사합니다.

2. "섞고 맞추기" 문제 (구성 일반화)

유추: 화가에게 "빨간 공"과 "파란색 정육면체"를 따로 그리는 법을 가르친 다음, "빨간 공과 파란색 정육면체"를 함께 그리라고 요청한다고 상상해 보세요.

  • 기대: "그들은 빨간색을 알고, 파란색을 알고, 공을 알고, 정육면체를 안다. 그것들을 섞을 수 있어야 한다!"라고 생각할 것입니다.
  • 현실: 그들이 이전에 보지 못한 새로운 조합을 더 많이 그리도록 요청할수록 성능은 더 나빠집니다.
  • 난이도 계층: 연구자들은 AI 에게 명확한 난이도 순서를 발견했습니다:
    1. 색상 (가장 쉬움): "빨간 공과 파란색 정육면체"는 보통 괜찮습니다.
    2. 세기 (중간): "빨간 공 세 개"는 더 어렵습니다.
    3. 공간적 관계 (가장 어려움): "파란색 정육면체 아래에 있는 빨간 공"은 가장 어렵습니다. AI 는 종종 공을 정육면체 에 그리지, 아래에 그리지 못합니다.

3. "데이터 크기" 대 "데이터 균형" 논쟁

유추: 화가를 훈련시키는 두 가지 방법이 있습니다:

  • 방법 A (불균형): "빨간 공" 사진 1,000 장을 보여주지만 "파란 공" 사진은 10 장만 보여줍니다.
  • 방법 B (균형): "빨간 공" 사진 100 장과 "파란 공" 사진 100 장을 보여줍니다.

결론: 놀랍게도, 불균형한 데이터가 주요 악당은 아니었습니다. 데이터가 완벽하게 균형 잡혀 있더라도 예제의 총수가 너무 적으면 AI 는 여전히 세기나 공간적 관계와 같은 복잡한 작업에서 실패했습니다.

  • 진짜 범인: 장면의 복잡성입니다. 장면 안에 넣는 물체가 많을수록 데이터가 어떻게 분포되어 있든 AI 가 배우기 더 어려워집니다. 작은 데이터셋을 가지고 있다면, 장면에 더 많은 물체를 추가하는 것은 AI 의 학습 능력을 무너뜨립니다.

4. "파인튜닝" 함정

연구자들은 또한 사전 훈련된 유명한 AI(Stable Diffusion 3) 를 가져와 이러한 특정 작업에 대해 "파인튜닝"을 시도해 보기도 했습니다.

  • 결과: 그들이 AI 에게 "아래"나 "위"와 같은 더 나은 공간적 관계를 가르치려 할 때는 성능이 향상되었습니다. 하지만 세기를 더 잘 가르치려 할 때는 실제로는 더 나빠졌습니다. 세기를 더 많이 연습할수록 AI 는 개별 물체를 세는 법을 더 많이 잊어버리는 것처럼 보였습니다.

결론

이 논문은 현재의 AI 화가들이 특정 색상이나 물체의 예시를 충분히 보지 못해서 실패하는 것이 아니라고 결론 내립니다. 그들은 다음과 같은 이유로 실패합니다:

  1. 세기는 작은 데이터셋에서 쉽게 무너질 수 있는 취약한 기술입니다.
  2. 공간적 추론(물체들이 서로에 대해 어디에 있는지 아는 것) 은 처음부터 배우기 가장 어려운 기술입니다.
  3. 새로운 개념을 혼합하는 것(예: 파란색 정육면체 아래에 있는 빨간 공) 은 AI 가 아이디어를 재결합하는 방법을 진정으로 이해해야 하므로, 현재 모델들은 격자와 같은 특정 구조적 도움 없이는 이를 수행하는 데 어려움을 겪습니다.

본질적으로 AI 는 플래시카드를 잘 외울 수는 있지만, 교사가 매우 구체적인 구조를 제공하지 않는 한 지저분하고 복잡한 시험 문제에 그 사실들을 적용하는 데는 어려움을 겪는 학생과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →