← 최신 논문
🤖 AI

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

이 논문은 함수 평가, 지표 및 확률성을 표준화하여 현재의 마스크 확산 언어 모델 순위가 통제되지 않은 변수들로 인해 종종 비교 불가능하다는 것을 밝혀내는 연산 인지형 평가 프로토콜인 CaRE를 소개하며, 정보 기반 재마스킹(informed remasking)과 확률적 언마스킹(stochastic unmasking)이 근본적으로 상충 관계에 있음을 입증한다.

원저자: Yash Shah, Abhijit Chakraborty, Vivek Gupta

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yash Shah, Abhijit Chakraborty, Vivek Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 혼란스러운 주방에서 누가 최고의 요리사인지 판별하려고 한다고 상상해 보십시오. 이 주방의 요리사들은 인간이 아니라 "AI 모델"이라 불리는 거대한 컴퓨터 두뇌들입니다. 오랫동안 이 모델들은 도미노가 쓰러지는 것처럼 재료를 하나씩 추가하며 요리를 해왔습니다. 하지만 최근에는 "마스크 확산(Masked Diffusion)"이라는 새로운 요리 스타일이 폭발적인 인기를 끌고 있습니다. 마스크 확산 방식은 재료를 하나씩 추가하는 대신, 요리 전체를 한 번에 보고 무엇이 빠졌는지 추측한 뒤, 일부 부분을 눈가리개(마스크)로 가리고, 완벽한 요리가 될 때까지 그 빠진 조각들을 반복해서 다시 추측합니다. 이것은 마치 컴퓨터가 이야기가 말이 될 때까지 자신의 추측을 계속 지우고 다시 쓰는 "Guess Who?" 게임과 같습니다.

문제는 이 주방의 모든 사람이 서로 다른 규칙으로 승자를 결정하고 있다는 점입니다. 어떤 심판은 요리사가 요리를 얼마나 많이 쳐다봤는지(단계/steps)를 세고, 어떤 심판은 풍미를 맛보고(지표/metrics), 어떤 심판은 요리사가 아주 무모하게 혹은 아주 신중하게 추측하도록 내버려 둡니다(확률성/stochasticity). 규칙이 너무나 엉망이기 때문에, 어떤 심판은 A 요리사가 최고라고 말하는 반면, 다른 심판은 똑같은 수프를 맛보고 있음에도 불구하고 A 요리사가 최악이라고 말할 수도 있습니다. 이 논문은 과학자들이 모여 주방을 정리하고, 규칙을 표준화하며, 모두가 공정한 게임을 할 때 누가 실제로 최고의 요리사인지 알아내기로 결심한 이야기입니다.


논문: CaRE – 위대한 주방 청소

이 논문의 연구자들인 Yash Shah와 Abhijit-Chakraborty는 "마스크 확산" 모델들이 점점 좋아지고 있음에도 불구하고, 이를 테스트하는 방식이 뒤처지고 있다는 점을 깨달았습니다. 그들은 최근 일곱 편의 논문이 "리마스킹(remasking)"이라는 기술(요리사가 이미 추측한 부분의 일부를 더 잘하기 위해 다시 가리기로 결정하는 것과 같은 기술)을 사용하여 이 모델들을 개선하려 노력하고 있다는 것을 발견했습니다. 하지만 각 논문이 서로 다른 설정을 사용했기 때문에 결과는 엉망이었습니다. 어떤 논문은 특정 전략이 챔피언이라고 주장했지만, 다른 논문에서는 그것이 실패라고 주장했습니다.

이를 해결하기 위해 그들은 CaRE(Compute-aware Remasking Evaluation, 연산량 인지 리마스킹 평가)라는 새로운 평가 프레임워크를 구축했습니다. CaRE를 엄격한 심판이라고 생각하십시오. 이 심판은 모든 요리사가 정확히 같은 양의 에너지, 정확히 같은 맛보기 숟가락, 그리고 정확히 같은 수준의 무작위성을 사용하도록 강제합니다. 그들은 LLaDA-8B와 Dream-7B 같은 거대 모델을 포함한 12가지 다른 AI 모델을 대상으로 이 테스트를 진행했으며, OpenWebText라는 방대한 텍스트 라이브러리를 사용했습니다.

큰 놀라움: 전략의 문제가 아니라 "온도"의 문제였다

CaRE 심판이 개입했을 때, 그들은 충격적인 사실을 발견했습니다. AI의 글쓰기 실력을 결정하는 가장 큰 요인은 요리사들이 사용하는 화려한 "리마스킹" 전략이 아니었습니다. 대신, 그것은 **온도(temperature)**라고 불리는 설정(요리사의 추측이 얼마나 무작위적이거나 "거친지"를 제어하는 것)이었습니다.

연구 결과, 온도가 품질의 차이를 91% 설명한다는 것이 밝혀졌습니다. 이것은 요리사가 멋진 칼을 쓰느냐 무딘 칼을 쓰느냐보다, 요리 중에 음식을 맛볼 수 있느냐 없느냐가 훨씬 더 중요하다는 말과 같습니다. 온도를 조금만 높여도(0.0에서 0.1로) AI의 글쓰기 품질은 급격히 상승하여, 모든 전략의 차이를 사소하게 만들어 버렸습니다. 실제로 온도를 변경하는 것은 품질 점수를 0.32점 높일 수 있었는데, 이는 최고의 전략과 최악의 전략 사이의 차이보다 더 컸습니다.

숨겨진 함정: "똑똑한" 전략이 역효과를 낼 때

이 논문이 발견한 가장 흥고한 반전은 여기 있습니다. AI가 약간의 무작위성(stochastic unmasking)을 허용받았을 때, 가장 혼란스러운 부분의 텍고를 계속 다시 가리는 "똑똑한" 전략(high_entropy 리마스킹)이 오히려 상황을 악화시켰다는 것입니다.

논문은 높은 무작위성과 이 "똑똑한" 재가리기 전략을 결로했을 때, 아무것도 다시 가리지 않는("none" 전략) 경우보다 품질 점수가 0.296점 떨어졌음을 보여주었습니다. 이는 **256 단계(steps)**와 온도 0.25에서 발생했습니다. 연구자들은 이 결과가 우연이 아님을 통계적 확률 p=0.020을 통해 매우 확신했습니다.

왜 이런 일이 발생했을까요? "똑똑한" 전략은 AI의 마음을 너무 자주 바꾸게 만들었습니다. 그것은 마치 요리사가 수프를 맛보고 소금을 넣었다가, 다시 빼고, 후추를 넣었다가, 다시 빼는 과정을 반복하는 것과 같습니다. 수프가 정착되지 못하는 것입니다. AI는 단어들을 계속 "휘저었고(churning)", 이는 겉보기에는 글의 다양성을 높여주는 듯 보였지만 실제로는 전체적인 이야기의 일관성을 떨어뜨렸습니다. 일단 추측한 단어는 그대로 두는 "멍청한" 전략이 AI에게 무작위성이 허용되었을 때 훨씬 더 나은 결과를 가져왔습니다.

"가짜" 리더보드

논문은 또한 이전의 리더보드들이 "컴퓨트(compute, 실제 컴퓨터가 하는 작업량)"를 정확히 계산하지 못했기 때문에 오해의 소지가 있다고 지적했습니다. 어떤 전략들은 256 단계를 사용한다고 주장했지만, 단어를 계속 다시 가림으로써 실제로 아무것도 다시 가리지 않는 전략보다 4배 더 많은 작업(최대 513번의 포워드 패스)을 수행하게 만들었습니다.

CaRE 심판이 모든 이에게 동일한 양의 작업을 수행하도록 강제하자, 순위가 뒤집혔습니다. 이전 논문들에서 승자처럼 보였던 전략들이 갑자기 패자로 전락했습니다. 예를 들어, HumanEval이라는 코딩 테스트에서 high_entropy 전략은 "none" 전략을 이기고 있는 것처럼 보였지만, 이는 단지 그 전략이 3.4배 더 많은 컴퓨터 파워를 사용했기 때문이었습니다. 컴퓨터 사용량을 동일하게 맞추자, "none" 전략이 대등하거나 오히려 더 나은 성능을 보였습니다.

핵론

CaRE의 핵심 교훈은 우리가 단순히 하나의 숫자나 하나의 전략만을 보고 AI가 "더 낫다"고 말할 수 없다는 것입니다. 이 논문은 우리가 모델을 테스트하는 방식이 실제 이야기를 가리고 있었다는 점을 드러냅니다. 사람들이 열광했던 "똑똑한" 기술들은 종로 종종 테스트 설정의 부산물에 불과했습니다. 연구자들은 연산량을 계산하고, 무작위성을 제어하며, 품질을 측정하는 다양한 방법을 통해 표준화된 규칙을 적용함으로써, **확률성(stochasticity, 무작위성)**이 진정한 주인이며, AI에게 창의성이 허용될 때는 때때로 가장 단순한 접근 방식(추가적인 것을 하지 않는 것)이 가장 좋을 수 있다는 것을 밝혀냈습니다.

그들은 새로운 "리더보드"와 일곱 가지 프로토콜(seven-point protocol)을 공개하여, 향후 AI 요리사들이 공정하게 심판받을 수 있도록 했습니다. 이를 통해 누군가 새로운 방법이 혁신적이라고 말할 때, 그것이 정말 혁신인지 아니면 그저 엉망인 주방에서 나온 결과물인지를 확실히 알 수 있게 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →