AGC-Bench: Measuring Artificial General Creativity
이 논문은 인공 일반 창의성(artificial general creativity)의 통일된 척도를 확립하여 일반 지능과는 구별되는 단일한 창의성 요인을 밝혀내고, 최정상급 인간 창작자들이 여전히 현재의 프런티어 거대언어모델(LLM)보다 뛰어난 성능을 보임을 입증하는 종합적인 벤치마크이자 평가 프레임워크인 AGC-Bench를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 사람들의 '창의성'을 측정하기 위해 설계된 거대한 테스트 도서관을 가지고 있다고 상상해 보세요. 어떤 테스트는 벽돌의 새로운 용도를 생각해 내라고 하고, 어떤 테스트는 재미있는 농담을 써 보라고 하며, 또 어떤 테스트는 과학적인 퍼즐을 풀라고 합니다. 오랫동안 연구자들은 논쟁해 왔습니다. 창의성이란 수학을 잘하면 물리학도 잘하게 되는 것처럼 모든 분야에서 뛰어난 성과를 내게 해주는 하나의 거대한 '슈퍼 파워'인가, 아니면 시는 잘 쓰지만 공학은 엉망일 수 있는 것처럼 별개의 분리된 기술들의 집합인가?
이제 우리는 이야기를 쓰고, 문제를 해결하고, 농담을 던질 수 있는 인공지능(AI) 모델들을 가지고 있습니다. 하지만 우리는 AI의 창의성이 일반적인 슈퍼 파워인지, 아니면 그저 일련의 고립된 기술들인지 측정할 방법을 가지고 있지 않았습니다.
이 논문은 AGC-Bench라는 AI를 위한 거대한 새로운 "창의성 체육관"을 소개합니다. 연구진이 무엇을 했고 무엇을 발견했는지 쉽게 설명해 드리겠습니다.
1. 궁극의 창의성 체육관 구축하기
연구진은 단순히 새로운 테스트 하나를 만든 것이 아닙니다. 대신 그들은 사서이자 탐정처럼 행동했습니다. 그들은 3,000편 이상의 과학 논문을 훑어보며 AI를 위해 만들어진 모든 창의성 테스트를 찾아냈습니다. 이 방대한 논문 더미 속에서 그들은 78개의 뚜렷한 테스트(예: "브레인스토밍" 테스트, "스토리텔링" 테스트, "유머" 테스트 등)를 골라냈고, 이를 한꺼번에 실행할 수 있는 통합 시스템을 구축했습니다.
이것은 마치 한 명의 운동선수를 측정하기 위해 런닝머신, 웨이트 랙, 클라이밍 벽, 수영장을 갖추고 정밀하게 조율된 단일 체육관을 만드는 것과 같습니다. 그들은 이 체육관에서 83개의 서로 다른 AI 모델을 테스트했습니다.
2. "심판" 문제와 새로운 심판
AI에게 다른 AI의 농담이나 이야기를 채점하라고 요청하면, AI 심판은 편향될 수 있습니다. 때로는 너무 엄격하거나, 때로는 너무 관대할 수 있죠. 이는 마치 특정 팀을 좋아하고 다른 팀을 싫어하는 심판을 두는 것과 같습니다.
이를 해결하기 위해 연구진은 **심판 반응 이론(Judge Response Theory)**이라는 영리한 기술을 사용했습니다. 그들은 세 명의 서로 다른 "슈퍼 AI" 심판이 모든 답변을 채점하도록 했습니다. 그런 다음 수학을 사용하여 어떤 심판이 "엄격한 코치"이고 어떤 심판이 "너그러운 코치"인지 파악했습니다. 그들은 모두가 공정하게 평가받을 수 있도록 점수를 조정했습니다. 마지막으로, 이 공정한 패널을 모방하여 누구나 나중에 비싼 슈퍼 AI 없이도 사용할 수 있는 오픈 소스 AI(AGC-Judge)를 훈련시켰습니다.
3. 거대한 발견: 창의성은 하나인가, 여럿인가?
이것이 이 논문의 핵심 질문입니다. 그들은 물었습니다. 만약 AI가 이야기를 잘 쓴다면, 그 AI는 자동으로 과학 문제를 잘 풀게 될까?
답변은: 대체로 그렇습니다.
그들이 점수를 분석했을 때, AI의 창의성은 하나의 강력한 엔진처럼 작동한다는 것을 발견했습니다. 그들은 이를 "C 요인"(인간의 일반 지능을 뜻하는 'g 요 factor'와 유사함)이라고 부릅니다.
- 비유: 창의성을 손전등이라고 상상해 보세요. 만약 AI가 밝은 손전등(높은 "C")을 가지고 있다면, 그것은 시를 쓰든 농담을 만들든 상관없이 모든 다양한 테스트에서 밝게 빛납니다.
- 통계: 이 단일 "C 요인"은 모델 간 차이의 **81.5%**를 설명했습니다. 즉, 어떤 AI가 하나의 창의적 과업을 얼마나 잘 수행하는지 알면, 거의 모든 다른 창의적 과업을 얼마나 잘 수행할지도 예측할 수 있습니다.
하지만 인간이 수학자보다 작가로서 더 뛰어날 수 있는 것처럼, 상위 AI 모델들도 약간의 선호도를 보였습니다. 어떤 모델은 유머에 약간 더 강했고, 어떤 모델은 과학적 아이디어에 약간 더 강했습니다. 하지만 전반적인 "창의적 엔진"은 동일했습니다.
4. AI의 창의성은 단지 "추론"의 탈을 쓴 것인가?
어떤 사람들은 "AI가 정말 창의적인 것이 아니라, 그저 논리와 사실에 매우 능숙한 것뿐 아닐까?"라고 생각했습니다.
연구진은 모델들에게 "창의적이 되어라"라고 요청하는 것과 "논리적인 뇌를 사용하라"라고 요청하는 것을 비교하여 이를 테스트했습니다.
- 결과: AI에게 "창의적이 되라"고 말하는 것이 "추론 능력을 사용하라"고 말하는 것보다 점수를 훨씬 더 많이 높였습니다. 이는 이 테스트가 단순한 논리가 아니라 실제로 창의성을 측정하고 있음을 증명합니다.
5. 인간 vs AI: 누가 더 유연한가?
그들은 AI의 결과를 동일한 테스트를 치른 실제 인간 그룹과 비교했습니다.
- 발견: 인간은 매우 "특화"되어 있습니다. 시 쓰기에 뛰어난 사람이 공학 퍼즐을 푸는 데는 서툴 수 있습니다. 인간의 창의성은 여러 개의 주머니로 나뉘어 있습니다.
- AI의 차이점: AI는 놀라울 정도로 "일반적"입니다. 한 가지를 잘하는 AI는 대개 모든 것을 잘합니다. AI는 인간보다 덜 특화되어 있습니다.
- 승자: AI가 더 유연하긴 하지만, 그 방에서 가장 뛰어난 인간은 가장 어려운 과업에서 가장 뛰어난 AI를 이겼습니다. 최고의 인간은 최고의 AI보다 약간 앞서 있었지만, AI가 빠르게 추격하고 있었습니다.
요약
이 논문은 AI의 창의성을 측정하기 위한 거대하고 공정하며 표준화된 놀이터를 구축했습니다. 그들은 AI의 창의성이 여러 개의 분리된 기술이 아니라, 모든 유형의 창의적 과업에서 성능을 발휘하게 하는 단일하고 일반적인 능력(마치 슈퍼 배터리처럼)이라는 것을 발견했습니다. 최고의 AI는 매우 뛰어나지만, 최고의 인간은 여전히 왕좌를 지키고 있으며, 인간의 창의성은 AI의 "팔방미인" 방식에 비해 더 전문화되어 있습니다.
그들은 다른 사람들이 이 모델들을 계속 테스트하고 개선할 수 있도록 모든 도구, 데이터, 그리고 "공정한 심판" AI를 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.