How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning
본 연구는 멀티모달 거대 언어 모델이 제로샷 설정에서 인간의 평가와 상당한 일치도를 보이며 시각적 창의성을 효과적으로 평가할 수 있음을 입증하는 동시에, 이들의 단계별 추론은 점수 정확도를 향상시키지는 못함에도 불구하고 평가 과정에 대한 해석 가능한 통찰을 제공한다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 아주 똑똑한 예술 비평가를 상상해 보세요. 이 비평가는 예술 수업을 한 번도 들어본 적이 없고, 인간이 그림을 채점하는 것을 본 적도 없으며, "창의성"이 무엇처럼 보이는지에 대해 들어본 적도 없습니다. 당신은 그저 사진 한 장을 건네며 이렇게 묻습니다. "이것의 창의성을 1점에서 5점 사이로 점수 매겨보세요."
이것이 본 논문이 하고 있는 일의 핵심입니다. 연구진들은 여섯 가지의 서로 다른 고급 AI 모델(디지털 심사위원이라고 생각하면 됩니다)에게 정확히 이 일을 시켰습니다. 그들은 이 AI들이 아무런 특별한 훈련이나 연습 없이도, 인간이 사진의 창의성을 어떻게 평가할지 추측할 수 있는지 알고 싶었습니다.
연구 결과는 다음과 같이 쉬운 부분들로 나누어 설명할 수 있습니다.
1. "제로샷(Zero-Shot)" 마술
보통 AI에게 예술을 채점하는 법을 가르치려면, "좋은" 그림과 "나쁜" 그림 수천 개의 예시와 함께 인간이 매긴 점수를 함께 보여줘야 합니다. 이는 학생에게 채점된 시험지 뭉치를 보여주며 가르치는 것과 같습니다.
하지만 연구진들은 다른 방법을 시도했습니다: 바로 **제로샷(Zero-Shot)**입니다. 그들은 AI에게 사진 한 장과 간단한 지시 사항만 주었습니다. "이것을 1점에서 5점 사이로 평가하세요." 예시도, 훈련도 없었습니다. 그것은 마치 길 가는 낯선 사람에게 한 번도 본 적 없는 그림을 채점해 달라고 부탁하는 것과 같았습니다.
결과: 놀랍게도, AI 심사위원들은 꽤 잘 해냈습니다. 그들의 평점은 인간의 평점과 매우 잘 일치했습니다.
- AI 생성 이미지(컴퓨터가 만든 정교한 사진)의 경우, AI 심사위원과 인간의 의견이 매우 강력하게 일치했습니다.
- 손으로 그린 스케치(사람이 그린 거칠고 투박한 그림)의 경우, 일치하긴 했지만 그 정도는 조금 약했습니다.
2. "정교함 vs 거침"의 편향
연구진은 AI 심사위원들이 고화질 사진은 좋아하지만 연필 스케치는 싫어하는, 마치 독특한 성격적 결함을 가진 비평가 같은 면이 있다는 것을 발견했습니다.
- "정교함"에 대한 편향: 매끄러운 컴퓨터 생성 이미지를 볼 때, AI 심사위원들은 지나치게 관대했습니다. 인간보다 더 높은 점수를 주었습니다.
- "거침"에 대한 편향: 단순한 손 그림 스케치를 볼 때, AI 심사위원들은 너무 엄격했습니다. 인간보다 낮은 점수를 주었습니다.
AI 모델들은 은밀하게 "정교하고" "복잡한" 이미지를 좋아하는 것 같습니다. 만약 그림에 선이 많고 세부 묘사가 많다면, AI는 그것이 단지 "번잡하다"고 생각하는 인간의 생각과는 달리 창의적이라고 생각합니다. AI 모델들은 "상세함"을 "창의성"과 혼동하는 듯 보였습니다.
3. "사고 과정" (생각의 사슬, Chain of Thought)
이러한 AI 모델 중 일부에는 특별한 기능이 있습니다. 최종 점수를 주기 전에 자신의 "사고 과정"을 글로 써 내려가는 기능입니다. 이는 마치 수학 시험에서 풀이 과정을 적는 학생과 같습니다.
연구진은 AI가 점수를 결정하기 위해 내부적으로 어떻게 생각하는지 들여다보았습니다. 그들은 AI가 일관된 4단계 레시피를 따른다는 것을 발견했습니다:
- 지각(Perception): "고양이와 나무가 보인다." (무엇이 있는지 묘사함).
- 독창성(Originality): "이것은 이상하고 새롭다!" (얼마나 독특한지 판단함).
- 품질(Quality): "선이 매끄럽고 예쁘다." (얼마나 잘 그려졌는지 판단함).
- 정당화(Justification): "그러므로, 4점을 준다." (숫자를 선택함).
큰 반전: 연구진은 만약 AI가 이러한 단계들을 생각하고 글로 써내는 시간을 갖는다면, 인간의 점수와 더 잘 일치할 것이라고 생각했습니다. 하지만 그렇지 않았습니다. "생각하는 과정"이 점수의 정확도를 높이지는 못했습니다. 하지만, 그것은 연구진에게 AI가 왜 그런 점수를 주었는지에 대한 창을 열어주었습니다. 그것은 AI가 단순히 "독창성"(얼마나 특이한가)보다는 "품질"(얼마나 예쁜가)에 주목하고 있다는 것을 보여주었습니다. 이것이 왜 AI가 정교한 AI 이미지를 그토록 좋아했는지를 설명해 줍니다.
4. AI는 자신이 무엇을 보고 있는지 알아야 할까요?
연구진은 의문을 가졌습니다. "만약 AI가 그림 속의 개를 고양이로 착각한다면, 그 창의성 점수가 낮아질까?"
답변은: 별로 그렇지 않다는 것입니다.
심지어 AI가 그림 속의 대상을 잘못 식별하거나, 혹은 인간조차 무엇인지 합의하지 못할 정도로 그림이 추상적일 때조차, AI의 창의성 점수는 여전히 인간의 점수와 잘 일치했습니다. 이는 AI가 단순히 "이것이 개인가? 예/아니오"와 같은 체크리스트를 확인하는 것이 아님을 시사합니다. AI는 대상이 정확히 무엇인지 모르더라도, 이미지의 '분위기(vibe)', 구도, 그리고 기묘함을 보고 있는 것입니다.
요의 핵심 (Takeaway)
이 논문은 우리가 일반적인 대형 AI 모델들을 사전 훈련 없이도 "창의성 심사위원"으로 사용할 수 있음을 보여줍니다. 이들은 놀라울 정도로 뛰어나지만, 하나의 편향을 가지고 있습니다: 그들은 복잡하고 상세한 이미지를 좋아하고, 단순하고 거친 스케치는 싫어합니다.
그들의 "사고 과정"을 들여다봄으로써, 우리는 그들이 어디서 맞고 어디서 틀리는지를 정확히 알 수 있습니다. 그것은 마치 자신의 취향이 우리와 조금 다르더라도, 자신의 근거를 설명할 수 있는 비평가를 둔 것과 같습니다. 연구진은 누구나 자신의 사진에 이 "AI 심사위원"을 사용해 볼 수 있도록 무료 앱도 제작했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.