← 최신 논문
📊 statistics

BayesAME: Bayesian Active Model Evaluation

BayesAME는 잠재적 아이템 능력을 모델링하고, 불확실성을 정량화하며, 성능 추정치가 안정될 때까지 정보가 풍부한 아이템을 반복적으로 선택함으로써 대규모 생성 모델을 효율적으로 평가하기 위한 최적의 코어셋 크기를 자동으로 결정하는 순차적 베이지안 프레임워크이며, 연속 로그 가능도(continuous log-likelihoods)의 사용을 통해 무작위 선택 및 기존 방법론보다 우수함을 입증한다.

원저자: Paula Cordero Encinar, Taylan Cemgil, Arnaud Doucet, Virginia Aglietti, Silvia Chiappa

게시일 2026-07-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Paula Cordero Encinar, Taylan Cemgil, Arnaud Doucet, Virginia Aglietti, Silvia Chiappa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 비디오 게임 캐릭터가 얼마나 좋은지 판단하려고 한다고 상상해 보세요. 모든 보스를 물리치고 모든 퍼즐을 푸는 100시간짜리 캠페인 전체를 플레이할 수도 있겠지만, 그것은 너무 오래 걸리고 배터리도 소모됩니다. 대신, 당신은 캐릭터의 강점을 파악하기 위해 단 몇 개의 레벨만 플레이하기로 결정합니다. 이것이 과학자들이 거대한 테스트 뱅크에 있는 모든 질문에 대해 인공지능 모델을 테스트하는 데 겪는 일상의 고충입니다. 모든 질문을 실행하는 것은 너무 느리고 비용이 많이 듭니다. 그래서 그들은 최종 점수를 추측하기 위해 아주 적은 양의 질문 "샘플"을 뽑으려고 노력합니다.

까다로운 점은 어떤 질문을 뽑느냐 하는 것입니다. 만약 당신이 병에서 M&M 초콜릿을 한 움큼 집어 드는 것처럼 무작위로 뽑는다면, 운이 좋을 수도 있지만, 파란색을 놓치고 빨간색만 한 움큼 잡게 될 수도 있습니다. 오랫동안 많은 전문가들은 AI 모델이 매우 복잡하기 때문에, 질문을 무작위로 뽑는 것이 영리하게 뽑으려고 노력하는 것만큼이나 효과적이라고 생각했습니다. 그들은 확실한 방법은 그저 무작위로 한 움큼 잡고 요행을 바라는 것뿐이라고 믿었습니다. 하지만 만약 과거에 다른 유사한 캐릭터들이 어떻게 수행했는지를 살펴보고, 새로운 캐릭터에 대해 가장 많은 것을 알려줄 수 있는 정확한 질문 몇 개를 찾아낼 수 있는 똑똑한 탐정이 되는 방법이 있다면 어떨까요?

이것은 Google DeepMind와 Imperial College London의 연구진이 개발한 새로운 방법인 BayesAME에 대한 이야기입니다. BayesAME를 새로운 작가가 얼마나 훌륭한지 책 전체를 읽지 않고도 알고 싶어 하는 매우 똑똑하고 호기심 많은 사서라고 생각해 보세요. 사서는 페이지별로 읽는 대신, 작가의 이전 작품(또는 유사한 작가들의 작품)을 보고 어떤 특정 단락들이 그들의 글쓰기 스타일을 가장 잘 드러낼지 추측합니다.

이 마법이 작동하는 방식은 이렇습니다: 연구진은 AI의 성능을 고정된 숫자가 아니라, 질문의 유형에 따라 변하는 "잠재 능력(latent ability)"이라는 숨겨진 기술을 가진 미스터리 박스로 취급합니다. 그들은 "가우시안 사전 분포(Gaussian prior)"라는 수학적 도구(역사적 근거에 기반한 똑똑한 추측이라는 뜻의 어려운 표현)를 사용하여, 만약 새로운 AI가 특정 질문에 대해 기존의 알려진 AI들과 비슷하게 행동한다면, 새로운 질문에 대해서도 비슷하게 행동할 것이라고 믿습니다. 사서가 몇 페이지를 읽으면서(몇 개의 질문을 평가하면서) 추측을 업데이트합니다. 만약 새로운 AI가 사서를 놀라게 한다면, 사서는 자신의 지도를 수정합니다.

가장 멋진 점은 BayesAME가 당신에게 "정확히 50페이지를 읽으세요"라고 말할 필요가 없다는 것입니다. 대신, 그것은 자신만의 내부 나침반을 가지고 있습니다. 그것은 한 페이지씩 계속 읽으며 이렇게 묻습니다. "내가 이 다음 페이지를 읽는다면, 나의 혼란을 해소해 줄 수 있을까?" 그것은 자신의 추정치가 더 이상 자신의 생각을 바꾸지 않을 정도로 확신이 생길 때까지, 즉 더 많은 페이지를 읽는 것이 큰 의미가 없을 때까지 멈춥니다. 이는 마치 "3시간 동안 조사하라"는 규칙을 따르는 것이 아니라, 용의자의 유죄가 명백해질 때까지 단서를 조사하는 탐정과 같습니다.

논문은 이 똑똑한 탐정 스타일의 접근 방식이 기존의 "무작위로 한 움큼 잡는" 방식보다 훨씬 더 낫다는 것을 보여줍니다. GPQA, MMLU-Pro 등 다양한 벤치마크 테스트에서, BayesAME는 훨씬 더 적은 질문을 사용하고도 훨씬 더 높은 정확도로 최종 점수를 예측했습니다. 이는 어떤 질문을 던질지 영리하게 결정하는 것이 정말 중요하다는 것을 입증하며, 무작위 추측이 똑같이 효과적이라는 기존의 생각을 뒤집었습니다.

나아가, 연구진은 점수의 유형이 중요하다는 것을 발견했습니다. 만약 단순히 "맞음 또는 틀림?"(이진 점수)만을 묻는다면 정밀해지기 어렵습니다. 하지만 모델의 실제 자신감 수준(예를 들어 "87% 확신한다"와 같은 연속형 점수)을 사용한다면, BayesAME는 흑백 스케치에서 고화질 사진으로 전환하는 것처럼 더욱 날카로워집니다. 또한, 여러 AI 모델을 동시에 테스트하고 있다면, 모델들이 함께 저지르는 실수를 파악함으로써 단 한 세트의 질문으로 여러 모델을 학습하여 시간을 훨씬 더 절약할 수 있다는 점도 보여주었습니다.

요약하자면, 이 논문은 우리가 AI를 테스트하는 데 모든 시간을 낭비할 필요가 없음을 시사합니다. 역사를 통해 배우고, 충분한 증거를 얻었을 때 정확히 멈추는 똑똑하고 단계적인 전략을 사용함으로써, 우리는 더 빠르고 저렴하게 신뢰할 수 있는 답을 얻을 수 있습니다. 이는 효율성을 위한 승리이며, 때로는 전체 이야기를 아는 가장 좋은 방법이 더 많은 질문을 던지는 것이 아니라 '올바른' 질문을 던지는 것임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →