← 최신 논문
💻 computer science

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

이 논문은 프레셰 인셉션 거리(FID)가 샘플링 변동보다는 주로 학습 시드에 의해 유발되는 상당한 잠재적 무작위성을 보인다는 점을 밝히며, 이에 따라 FID를 오차 막대와 함께 보고하고 작은 성능 차이는 통계적으로 결론을 내릴 수 없는 것으로 취급할 것을 권고한다.

원저자: Nicolas Dufour, Alexei A. Efros, Patrick Pérez

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicolas Dufour, Alexei A. Efros, Patrick Pérez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 요리 경연 대회의 심사위원이라고 상상해 보세요. 모든 셰프(생성형 AI 모델)는 요리를 선보이고, 당신은 그 요리가 얼마나 맛있어 보이는지와 맛을 기준으로 점수를 줍니다. AI 이미지 생성의 세계에서 이 점수는 FID(Fréchet Inception Distance)라고 불립니다. 점수가 낮을수록 더 좋은 요리입니다.

수년 동안 커뮤니티는 이 점수를 완벽하고 변하지 않는 사실로 취급해 왔습니다. 만약 셰프 A가 34.0점을 받고 셰프 B가 33.5점을 받았다면, 모두가 셰프 B가 확실히 더 낫다고 가정합니다.

이 논문, **"The FID Lottery(FID 로또)"**는 이것이 위험한 환상이라고 주장합니다. 저자들은 당신이 보는 점수가 단순히 셰프의 기술만을 측정하는 것이 아니라, 또한 **운(luck)**의 척도이기도 하다고 주장합니다.

다음은 쉬운 비유를 사용한 저자들의 연구 결과 요약입니다.

1. 두 가지 로또

저자들은 AI가 이미지를 생성할 때마다 두 가지 서로 다른 "로또"가 진행된다고 말합니다.

  • 훈련 로또 (거대한 로또): 셰프가 요리를 시작하기도 전에, 그들은 세 가지 요소에 대해 주사위를 던집니다:

    1. 재료: 데이터가 섞이고 순서가 정해지는 방식.
    2. 팬트리 설정: 시작 시 AI의 두뇌(가중치)가 초기화되는 방식.
    3. 조리 과정: 훈련의 매 단계마다 레시피에 추가되는 특정 유형의 "노이즈"(무작위 정적 상태).
    • 결과: 설령 두 셰프가 정확히 같은 레시피를 따르더라도, 훈련 중에 "운 좋은" 주사위 결과값을 얻은 셰프는 (그리고 종종 더 나은) 약간 다른 요리를 만들어내게 됩니다.
  • 생성 로또 (작은 로또): 요리가 완성되면, 셰프는 접시에 담아야 합니다. 그들은 최종 장식을 위한 무작위 시작점을 골라야 합니다.

    • 결과: 만약 당신이 같은 셰프에게 요리를 10번 플레이팅하라고 요청한다면, 점수는 약간씩 변하겠지만 큰 차이는 없을 것입니다.

중대한 발견: 저자들은 모델을 다시 훈련시키는 것(훈련 로또를 다시 플레이하는 것)이 단순히 같은 요리를 다시 플레이팅하는 것(생성 로토를 다시 플레이하는 것)보다 점수를 3.2배 더 많이 변화시킨다는 것을 발견했습니다.

2. "숨겨진" 노이즈 바닥 (Noise Floor)

이 논문은 점수의 "노이즈 바닥"이 존재함을 밝혀냈습니다.

  • 점수를 온도계라고 상상해 보세요. 저자들은 운 때문에 점수가 자연적으로 약 1%에서 2% 정도 변동한다는 것을 발견했습니다. 셰프가 아무것도 다르게 하지 않아도 말이죠.
  • 문제점: 최근 많은 AI 논문들이 점수를 아주 미세하게 개선했다고 주장합니다 (예: 34.0에서 33.8로). 저자들은 만약 개선 폭이 이 1~2%의 "운의 격차"보다 작다면, 그것이 실제적인 개선이 아닐 수도 있다고 주장합니다. 그것은 단지 이번에 운 좋은 주사위가 그들에게 유리하게 던져졌을 뿐일 수도 있습니다.

3. 더 크다고 항상 더 좋은 것은 아니다 (운과 관련하여)

더 크고 강력한 AI(더 큰 주방)를 만들면 운의 요소가 사라질 것이라고 생각할 수도 있습니다.

  • 발견: 아닙니다. AI가 작든 거대하든, "운의 격차"는 대략 동일한 비율(1~2%)로 유지됩니다.
  • 비유: 주사위를 던지는 것과 같습니다. 주사위 한 개를 던지든 천 개를 던지든, 무작위성은 여전히 존재합니다. 모델을 더 크게 만든다고 해서 주사위가 덜 무작위해지지는 않습니다.

4. "골든 티켓" (뽑기 운)

저자들은 어떤 훈련 과정은 믿기 힘들 정도로 운이 좋다는 것을 발견했습니다.

  • 발견: "운 좋은" 훈련 시드(행운의 시작)는 "운 나쁜" 시드와 동일한 수준의 고품질 점수에 도달할 수 있지만, 이를 두 배 더 빠르게 해낼 수 있습니다.
  • 함축적 의미: 만약 어떤 연구자가 자신의 새로운 방식이 훈련 속도를 2배 높였다고 주장한다면, 그들은 단지 자신의 "운 나쁜" 기존 방식과 "운 좋은" 새로운 실행을 비교하고 있는 것일지도 모릅니다. 그들은 실제로 코드를 개선한 것이 아니라, 단지 주사위 운이 좋았을 뿐일 수도 있습니다.

5. 가이던스 튜닝 (비법 소스)

논문은 또한 "Classifier-Free Guidance(CFG)"라고 불리는 설정도 살펴보았습니다. 이는 AI에게 프롬프트를 얼마나 엄격하게 따를지 알려주는 다이얼과 같습니다.

  • 발견: 모든 훈련 과정에 대해 이 다이얼을 완벽하게 조정한다면, 노이즈 격차를 절반으로 줄일 수 있습니다.
  • 함정: 이렇게 하는 것은 순위를 바꿉니다. 이전에는 1위였던 "운 좋은" 시드가 다이얼을 조정한 후에는 5위로 떨어질 수 있습니다. 이것은 마치 모든 케이크에 대해 오븐 온도를 각각 조정하는 것과 같습니다. 350°F에서 가장 좋았던 케이크가 360°F에서는 최고가 아닐 수 있습니다.

게임의 새로운 규칙

저자들은 우리가 운에 속지 않도록 결과를 보고하는 새로운 방법을 제안합니다:

  1. 단 하나의 숫자만 믿지 마세요: 단 하나의 점수만 보고하지 마세요. 서로 다른 시드로 훈련을 여러 번 수행하여 얻은 "오차 범위(error bar)"를 함께 보고하세요.
  2. 미세한 승리는 무시하세요: 만약 새로운 방식이 점수를 약 1.3% 미만으로 개선했다면, 이를 "결론을 내릴 수 없음(inconclusive)"으로 취급하세요. 그것은 아마도 노이즈일 가능성이 높습니다.
  3. 다이얼을 조정하세요: 가이던스를 사용 중이라면 각 실행에 맞춰 구체적으로 조정하되, 이 작업이 순위를 바꿀 수 있다는 점을 기억하세요.

요약하자면: 이 논문은 AI 이미지 생성의 세계에서 운이 엄청난 역할을 한다는 것을 알려줍니다. 우리는 무작위적인 변동을 과학적 돌파구로 취급해 왔습니다. 새로운 방식이 실제로 더 나은지 알기 위해서는 실험을 여러 번 수행하여 그 개선 사항이 "노이즈"라는 로또의 법칙을 견뎌내는지 확인해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →