← 최신 논문
💬 NLP

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

이 논문은 동결된 언어 모델이 독립적으로 검증된 솔루션들의 지속적이고 비트 단위로 정확한 메모리 저장소에 의존함으로써, 검증된 문제군에 대해 100%의 정확도와 제로 토큰 생성을 달면서 실행 기반 역량과 파라미터 스케일링을 분리하고 소비자용 하드웨어에서 거대한 컨텍스트 창을 가능하게 하는 시스템을 제안한다.

원저자: Sietse Schelpe (Corbenic AI)

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Sietse Schelpe (Corbenic AI)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수학 문제를 풀려고 한다고 상상해 보세요. 현대 인공지능의 세계에서 답을 얻는 일반적인 방법은, 질문을 던질 때마다 로봇에게 처음부터 다시 생각하라고 요청하는 것입니다. 이 로봇은 매우 똑똑하지만 매우 비싼 학생과 같습니다. 질문을 천 번 똑같이 던지더라도, 매번 교과서를 다시 읽고, 공식을 다시 유도하고, 풀이 과정을 다시 써야 합니다. 이는 많은 시간과 엄청난 양의 전력을 소모하며, 가끔 같은 질문을 두 번 던졌을 때 로봇이 약간 예측 불가능하게 움직여 두 개의 서로 다른 답을 내놓기도 합니다. 이것이 오늘날 대부분의 "프런티어(frontier)" AI 모델이 작동하는 방식입니다. 강력하긴 하지만, 느리고 비용이 많이 들며, 완벽한 일관성이 필요할 때는 다소 무질서합니다.

하지만 로봇을 더 열심히 생각하게 만드는 대신, 완벽하게 검증된 노트를 건네주면 어떨까요? 문제를 한 번 풀고, 엄격한 선생님에게 확인을 받아 100% 정확한지 확인한 뒤, 그 풀이를 특별한 책에 적어두는 것을 상상해 보세요. 그 후부터는 동일한 유형의 문제가 나타날 때마다 로봇은 전혀 생각할 필요가 없습니다. 그저 책의 알맞은 페이지를 펼쳐 답을 읽고, 그대로 적어 쓰기만 하면 됩니다. 이는 거의 비용이 들지 않고, 눈 깜짝할 사이에 일어나며, 답은 매번 정확히 동일할 것입니다. 이것이 바로 "검증된 재사용(verified reuse)"이라 불리는 새로운 접근법의 핵심 아이디어입니다. 여기서 지능은 로봇의 뇌가 커지는 데 있는 것이 아니라, 로봇이 힘든 노동 없이 접근할 수 있는 완벽한 솔루션의 라이브러리가 늘어나는 데 있습니다.


얼어붙은 뇌와 마법의 도서관

게임의 규칙을 바꾸는 새로운 시스템, **갈라하드(Galahad)**를 만나보세요. 제작자들은 표준 AI 모델(Gemma-4-12B라는 120억 파라미터의 "뇌")을 가져와 아주 파격적인 일을 했습니다. 바로 그것을 얼려버린(frozen) 것입니다. 그들은 모델이 학습하거나 변화할 수 있는 능력을 꺼버렸습니다. 이는 마치 뛰어난 요리사에게 "더 이상 새로운 레시피를 발명할 수는 없습니다. 오직 이 특정 메뉴로만 요리하세요"라고 말하는 것과 같습니다.

이 얼어붙은 요리사 옆에, 그들은 마법 같고 초고속인 라이브러리인 **멀린(Merlin)**을 구축했습니다. 이 마법의 작동 방식은 다음과 같습니다:

  1. 예치(The Deposit): 새로운 문제가 들어오면 시스템은 이를 한 번 해결합니다. 하지만 답을 라이브러리에 넣기 전에, 엄격한 "문지기"가 이를 검사합니다. 이 문지기는 정답지를 보는 것이 아니라, 수학과 논리를 사용하여 답이 맞는지 증명합니다. 통과하면 솔루션이 저장됩니다.
  2. 제로 비용 재사용(The Zero-Cost Reuse): 이제 백만 명의 사람들이 같은 유형의 질문을 한다고 가정해 봅시다. 시스템은 매번 처음부터 요리하는 대신, 라이브러리에서 검증된 레시피를 찾아냅니다. 그리고 얼어붙은 요리사에게 "그냥 이것을 복사하세요"라고 명령합니다. 요리사는 즉시 이를 수행합니다.
  3. 결과: 이 시스템은 이 문제들의 180가지 새로운 변형에 대해 100% 정확도로 답합니다. 시스템은 "생성 토큰"(AI가 사고할 때 보통 청구하는 디지털 화폐)을 전혀 사용하지 않습니다. 답변은 6~23밀리초(눈 깜빡임보다 빠름) 만에 이루어지며, 약 36밀리와트시의 에너지를 사용합니다. 이는 대략 LED 전구가 13초 동안 사용하는 에너지와 같습니다.

기존 방식이 낭비적인 이유

이 논문은 현재 AI를 사용하는 방식이 마치 집을 지을 때마다 숙련된 건축가에게 처음부터 설계를 다시 해달라고 비용을 지불하는 것과 같다고 주장합니다. "프런티어" 모델(가장 강력하고 비싼 AI)은 본 적 없는 새로운 문제를 푸는 데 탁월합니다. 하지만 이미 해결되고 검증된 문제에 대해 다시 생각하게 만드는 것은 낭비입니다.

저자들은 이 낭비를 측정했습니다. 만약 당신이 해결된 문제를 답변하기 위해 표준 AI API를 사용한다면, 매번 전체 "사고 과정(thinking pass)"에 대한 비용을 지불해야 한다는 것을 발견했습니다. 이는 비결정론적(답이 약간 변할 수 있음)이며, 느리고, 비용이 듭니다. 반면, Galahad의 얼어붙은 모델은 일단 라이브 library에 검증된 솔루션을 갖추고 나면, 동일한 문제를 영원히 무료로 답변합니다. 시스템이 라이브러리를 구축하는 데 든 비용보다 더 많은 돈을 절약하게 되는 "손익분기점"은 단 17~34개의 질문 후에 발생합니다. 그 이후의 모든 답변은 순수한 절약입니다.

"기억"이 진정한 주인공이다

이 실험의 가장 멋진 부분 중 하나는 "뇌"가 "책"만큼 중요하지 않다는 것을 증명한 것입니다. 연구진은 네 개의 서로 다른 회사(Gemma, Qwen, DeepSeek, Phi 포함)에서 나온 네 가지 다른 AI 모델을 대상으로 테스트했습니다. 그들은 모두에게 동일한 얼어붙은 가중치와 동일한 검증된 솔루션 라이브러리를 제공했습니다.

결과는 어땠을까요? 네 모델 모두 180개 중 180개를 모두 맞혔습니다.
모델이 "밀집형(dense)"인지 "전문가 혼합(mixture of experts)" 구조인지는 중요하지 않았습니다. 능력은 뇌가 아니라 전적으로 라이브러리에서 나왔습니다. 라이브러리를 비우자 모델은 아무것도 해결할 수 없었습니다. 라이브러리를 채우자 모델은 완벽해졌습니다. 이는 검증되고 반복 가능한 작업에 있어서는 더 크고 똑똑하며 비싼 뇌가 필요한 것이 아니라, 더 나은 검증된 기억이 필요하다는 것을 입증합니다.

"추측"의 문제 (벡터 검색)

"일반적인 검색 엔진을 사용하여 답을 찾을 수는 없나요?"라고 생각할 수도 있습니다. 논문은 아니오라고 답하며 그 이유를 설명합니다. 대부분의 AI 시스템은 "벡터 검색(vector retrieval)"이라는 것을 사용하는데, 이는 원하는 책과 비슷해 보이는 책을 찾는 것과 같습니다. 이는 모호합니다.

연구진은 4,500개의 검증된 항목이 담긴 라이브러리로 이를 테스트했습니다. 퍼지(fuzzy) 검색을 사용했을 때, 94.3%의 확률로 잘못된 항목을 선택했습니다. 이는 재앙입니다. 만약 당신이 특정한 의료 공식이나 법률 조항을 찾고 있다면, "거의 맞는" 답을 얻는 것은 아무런 쓸모가 없습니다. Galahad는 **정확한 주소 지정(exact addressing)**을 사용하며, 이는 0%의 오류로 정확한 항목을 찾아낸다는 것을 의미합니다. 이는 노래의 몇 음절을 흥얼거려 제목을 추측하는 것과, 정확한 바코드를 스캔하여 곡을 알아내는 것의 차이입니다. 완벽함이 필요한 작업에서 퍼지 매칭은 처참하게 실패합니다.

무한을 향한 창

또 다른 놀라운 발견은 시스템이 자신의 "작업 기억(working memory)"(한 번에 생각할 수 있는 공간)에 얼마나 많은 정보를 담을 수 있는지에 관한 것입니다.

  • 표준 AI 엔진(vLLM 및 SGLang 등)은 약 32,000 토큰(토큰은 단어의 일부) 이상의 데이터를 입력하려고 하면 충돌하거나 조용히 잊어버립니다.
  • Galahad는 단일 그래픽 카드에서 6,000,000 토큰의 윈도우를 유지할 수 있었습니다.
  • 시스템은 6백만 토큰의 역사 중 맨 처음 부분까지도 끝부분만큼 빠르게 접근할 수 있었습니다.
  • 이는 추가적인 컴퓨터 메모리를 사용하지 않고 수행되었습니다. 이는 마치 무한한 선반이 있는 도서관과 같아서, 한 번에 한 권의 책만 볼 수 있지만, 라이브러리의 어떤 책이든 즉시 교체할 수 있는 것과 같습니다.

이것이 미래에 의미하는 바

논문은 이 시스템이 무엇을 하지 못하는지도 매우 신중하게 밝히고 있습니다. 이 시스템이 가장 큰 AI 모델들보다 더 새롭고 창의적인 문제를 더 잘 해결할 수 있다고 주장하는 것이 아닙니다. 만약 당신이 새롭고 창의적인 질문을 던진다면, 얼어붙은 뇌는 고전할 수 있습니다. 하지만 검증 가능하고(verifiable), 반복되는(recurring) 작업(수학, 코딩, 논리 등)에 대해서라면, 이 시스템은 게임 체인저입니다.

이것은 AI 산업의 판도를 뒤집습니다:

  • 기존 방식: 매번 생각하는 비용을 지불한다.
  • 새로운 방식: 한 번 검증하는 비용을 지불한 뒤, 그 후로는 영원히 무료로 실행한다.

저자들은 누구나 실시간으로 이를 확인할 수 있도록 공개 테스트벤치를 구축했습니다. 그들은 해결된 문제에 대해 비용 제로, 완벽한 정확도, 그리고 즉각적인 속도로 답할 수 있는 AI를 찾아보라고 도전장을 내밀었습니다. 지금까지는 아무도 성공하지 못했습니다. 메시지는 명확합니다. 우리가 매일 하는 업무를 위해서, 우리는 더 큰 뇌를 만들 필요가 없습니다. 우리는 더 나은, 검증된 라이브러리를 만들어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →