Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs
이 논문은 생성형 AI에서 모델 유도 변동성을 프롬프트 유도 효과로부터 분리하여 텍스트-이미지, 이미지 캡셔닝 및 LLM 작업의 다양성을 더욱 정확하게 평가하고 가이드할 수 있게 하는 새로운 다양성 지표인 Conditional-Vendi와 Conditional-RKE를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 주문(프롬프트)을 받으면 요리(이미지, 비디오 또는 이야기)를 만들어내는 첨단 주방을 운영하는 셰프라고 상상해 보십시오. 수년 동안 비평가들은 오직 두 가지 기준으로만 이 셰프들을 평가해 왔습니다:
- 충실도(Fidelity): 요리가 주문과 닮았는가? (예: "매콤한 타코"를 주문했을 때, 그것이 정말 타코처럼 보이는가?)
- 무조건적 다양성(Unconditional Variety): 만약 주문 없이 셰프를 그냥 요리하게 내버려 둔다면, 얼마나 다양한 요리를 만들 수 있는가?
하지만 퍼즐의 빠진 조각이 하나 있었습니다: 셰프가 주문 위에 얼마나 많은 다양성을 더하는가?
만약 당신이 "빨간 자동차"를 주문한다면, 셰프는 항상 평범한 빨간 세단만을 만드는가? 아니면 빨간 컨버터블, 빨간 스포츠카, 빨간 트럭, 그리고 빨간 빈티지 쿠페로 당신을 놀라게 하는가? 기존의 도구들은 "셰프가 지루한 것"인지 아니면 "고객이 매우 구체적인 주문을 한 것"인지 구분하지 못했습니다.
이 논문은 이러한 특정한 종류의 창의성을 측정하는 새로운 방법인 **조건부 벤디 점수(Conditional Vendi Score)**와 **조건부 RKE(Conditional RKE)**를 소개합니다.
핵심 문제: "프롬프트" vs "셰프"
저자들은 현재의 다양성 점수가 두 가지 서로 다른 원천의 다양성을 혼동하고 있다고 설명합니다:
- 프롬프트 유도 다양성(Prompt-Induced Diversity): 이는 고객이 주문을 바꿈으로써 발생하는 다양성입니다. 당신이 "개", "고양이", "새"를 차례로 주문하면 결과물은 변합니다. 이것은 셰프의 창의성이 아니라, 단지 당신이 메뉴를 바꾸는 것입니다.
- 모델 유도 다양성(Model-Induced Diversity): 이는 동일한 주문을 주었을 때 셰프가 더하는 다양성입니다. 만약 당신이 "개"를 열 번 요청한다면, 셰프는 열 마리의 서로 다른 품종을 만드는가, 아니면 열 개의 똑같은 복사본을 만드는가?
비유:
사진 부스를 상상해 보십시오.
- 시나리오 A: 당신이 "개", "고양이", "말"의 사진을 차례로 요청합니다. 부스는 세 장의 매우 다른 사진을 제공합니다. 기존의 점수들은 말합니다. "와, 이 부스는 정말 다양하네!"
- 시나리오 B: 당신이 "개"의 사진을 열 번 요청합니다. 부스는 열 마리의 서로 다른 품종의 개를 보여줍니다. 기존의 점수들은 이 사진들이 "말"과 비교했을 때 모두 "개"처럼 보이기 때문에 "음, 별로 다양하지 않네"라고 말할 수도 있습니다.
저자들은 시나리오 B가 사실 AI의 진정한 마법이 발휘되는 지점이라고 주장합니다. 그들은 AI가 프롬프트가 그대로 유지될 때조차 얼마나 다양하게 출력하는지를 측정하고자 합니다.
해결책: "프롬프트 인지형" 점수
논문은 두 가지 새로운 점수인 **조건부-벤디(Conditional-Vendi)**와 **조건부-RKE(Conditional-RKE)**를 제안합니다.
이 점수들을 "프롬프트 유도" 노이즈를 무시하고 오직 "모델 유도" 신호만을 측정하는 특별한 필터라고 생각하십시오.
- 작동 방식: 모든 사진을 한꺼번에 보는 대신, 수학적으로 각 특정 프롬프트 카테고리 내에서 사진들이 얼마나 다른지를 살펴봅니다. 본질적으로 다음과 같이 묻는 것입니다: "우리가 모든 '개' 사진을 한데 모은다면, 그것들은 서로 얼마나 다른가? '고양이' 사진들을 모은다면 어떠한가?" 그러고 나서 그 값들을 평균 냅니다.
- 결과: 이 점수는 시나리오 B의 셰프(10 마리의 서로 다른 개를 만드는 것)가 시나리오 A의 셰프(1 마리의 개, 1 마리의 고양이, 1 마리의 말을 만드는 것)보다 더 창의적이라는 것을 정확히 식별해 냅니다. 왜냐하면 시나리오 B의 셰프는 특정 요청에 자신만의 색깔을 더하기 때문입니다.
"과속 방지턱"과 "지름길"
이 새로운 점수를 계산하는 것은 수학적으로 매우 무겁습니다. 저자들은 매우 큰 데이터셋(예: 25,000개의 이미지)의 경우, 계산이 "차원의 저주"에 빠진다는 것을 발견했습니다. 이는 마치 해변의 크기를 측정하기 위해 모래알 하나하나를 세려고 하는 것과 같습니다. 시간이 너무 오래 걸리고 정확도를 높이기 위해 너무 많은 데이터가 필요합니다.
해결책: 그들은 "절단된(Truncated)" 버전을 도입했습니다.
- 비유: 모든 모래알을 세는 대신, 가장 큰 모래알 10,000개만 셉니다. 그러면 이 상위 모래알들이 해변의 "무게"와 다양성의 99%를 대표한다는 것을 깨닫게 됩니다.
- 이점: 이 "절단된 조건부-벤디"는 빠르고, 실제 사용하기에 충분히 정확하며, 거대한 데이터셋에서도 막히지 않습니다.
테스트 수행
저자들은 실제 AI 모델들로 새로운 점수를 테스트했습니다:
- 텍스트-투-이미지 (DALL-E 3 또는 Stable Diffusion 등): 프롬프트가 모호할 때(예: "동물") AI가 매우 다양한 동물을 생성하여 점수가 올라가는 것을 보여주었습니다. 반면 프롬프트가 구체적일 때(예: "골든 리트리버")는 AI가 특정 요청에 의해 제약을 받으므로 점수가 낮게 유지되었습니다. 이는 이 점수가 단순히 프롬프트의 다양성을 측정하는 것이 아니라, AI의 내부적 자유도를 실제로 측정한다는 것을 증명했습니다.
- 텍스트-투-비디오 및 LLM: 이들은 비디오 생성기와 언어 모델(Llama 등)에도 이를 테스트했습니다. 언어 모델의 "온도(Temperature, 무작위성)"를 높임에 따라 점수가 올라가는 것을 발견했으며, 이는 이야기가 더 다양해졌음을 정확히 나타냈습니다.
- AI 가이드하기: 그들은 이 점수를 단순히 AI를 판단하는 데 사용한 것이 아니라, AI를 조종하는 데 사용했습니다. "생성하는 동안 이 점수를 최대화하라"고 AI에게 지시함으로써, 텍스트 프롬프트와의 연결성을 잃지 않으면서도 더 다양한 이미지를 생산하도록 강제할 수 있었습니다.
요약
요컨대, 이 논문은 우리에게 새로운 자(ruler)를 제공합니다. 이전에는 AI가 명령을 얼마나 잘 따르는지, 혹은 혼자 있을 때 얼마나 무작위적인지만 측정할 수 있었습니다. 이제 우리는 AI가 명령을 따르면서도 얼마나 창의적인지를 측정하는 자를 갖게 되었습니다. 이는 사용자의 프롬프트에서 발생하는 노이즈와 기계의 상상력에서 오는 진정한 신호를 분리해 냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.