← 최신 논문
🤖 machine learning

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

이 논문은 BERT에서 2026년의 특화된 프런티어 에이전트에 이르기까지 언어 모델의 8년간의 진화를 검토하며, 코딩 능력의 6배 연간 향상, 저가형 GPT 5.6 Luna로 대변되는 추론 비용의 극적인 붕괴, 그리고 프런트엔드 코딩, 저장소 관리, 터미널 운영과 같은 특정 도메인에서 탁월한 성능을 보이는 작업 목표 지향적 모델로의 전환을 강조한다.

원저자: Pranav Kumar Kaliaperumal

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Pranav Kumar Kaliaperumal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

위대한 AI의 진화: 독서용 안경에서 슈퍼컴퓨터까지

컴퓨터가 아주 똑똑하지만 수줍음 많은 사서와 같았던 세상을 상 imagin 해보세요. 오랫동안 만약 여러분이 컴퓨터에게 문장을 이해시키고 싶다면, 그 특정 문장을 위해 정해진 독서용 안경을 반드시 씌워줘야 했습니다. 만약 이야기를 쓰게 하고 싶다면, 그 안경을 다른 종류의 안경으로 교체해야 했죠. 그들은 읽기에는 매우 똑똑했지만, 스스로 무언가를 '수행'할 수는 없었습니다. 이것이 바로 인간의 언어를 이해하고 생성하도록 학습하는 컴퓨터 프로그램인 "언어 모델(Language Models)"의 초기 시대였습니다.

지난 몇 년 동안, 과학자들은 이 사서들을 훨씬 더 크게 만들고, 매번 새로운 안경을 필요로 하지 않고도 단 몇 개의 예시만으로 학습할 수 있는 "두뇌"를 갖게 하는 방법을 알아냈습니다. 갑자기 이 컴퓨터들은 채팅을 하고, 코드를 작성하며, 퍼즐을 풀 수 있게 되었습니다. 하지만 여기서 모두가 던지는 핵심적인 질문이 있습니다. 이들은 매일 더 똑똑해지고 있는 걸까요, 아니면 그저 시험 문제들을 더 잘 암기하고 있는 걸 것이까요? 그리고 만약 이들이 정말 똑똑해지고 있다면, 그것은 비용이 더 비싸진다는 뜻일까요, 아니면 가성비 좋은 도구가 되고 있다는 뜻일까요? 이 논문은 2018년부터 미래인 2026년까지의 파란만장한 AI 발전 과정을 살펴보며, 그 내부에서 실제로 어떤 일이 벌어지고 있는지에 대한 이 미스터리를 깊이 파고듭니다.


독서용 안경에서 슈퍼컴퓨터까지: 8년간의 롤러코스터

이 논문은 2018년부터 2026년까지 인공지능의 삶을 추적하는 시간 여행 탐정 소설과 같습니다. 이 논문은 세 가지 큰 질문을 던집니다. 어떻게 우리는 문장 하나 겨우 쓰는 컴퓨터에서 소프트웨어 버그를 고치고 수학 올림피아드 문제를 푸는 컴퓨터로 넘어오게 되었는가? 이 "두뇌 능력"의 가격은 얼마나 빨리 떨어졌는가? 그리고 가장 중요한 것은, 모든 것을 수행하기 위해 하나의 거대하고 비싼 슈퍼컴퓨터가 필요한가, 아니면 미래는 실제로 전문화된 전문가들의 팀이 될 것인가?

AI 성장의 네 가지 시대
저자는 지난 8년을 마치 비디오 게임의 시즌처럼 네 가지 뚜렷한 장으로 나눕니다:

  1. "독서용 안경" 시대 (2018–2019): BERT와 같은 모델들로 시작되었습니다. 이들은 책을 읽고 질문에 답하는 데는 뛰어나지만, 이야기를 써달라고 하면 얼어붙어 버리는 학생들과 같습니다. 그들은 매 작업마다 특정한 "미세 조정(fine-tuning, 특수 훈련 캠프와 같은 것)"을 필요로 했습니다.
  2. "거대 두뇌" 시대 (2020–2021): 그다음은 GPT-3와 같은 모델들이 등장했습니다. 이들은 인터넷상의 거의 모든 것을 읽은 거대한 도서관과 같았습니다. 특별한 훈련 없이도 채팅창에 몇 가지 예시만 주면 패턴을 파악해 냈습니다. 놀라웠지만, 여전히 사실을 지어내기도 하고 지시 사항을 완벽하게 따르지 못할 때도 있었습니다.
  3. "예의 바른 조수" 시대 (2022–2023): 과학자들은 "얼라이먼트(alignment, 정렬)"라는 기술을 사용하여 이 거대한 두뇌들이 예의를 갖추고 명령을 따르도록 가르쳤습니다. 갑자기 이들은 ChatGPT와 그 친구들처럼 변했습니다. 채팅, 이메일 작성, 복잡한 규칙 준수에 탁월해졌습니다.
  4. "에이전트(Agent)" 시대 (2024–2026): 여기가 바로 흥미진진해지는 지점입니다. 모델들은 단순히 말하는 것을 넘어 '행동'하기 시작했습니다. 이들은 도구를 사용하고, GitHub의 깨진 코드를 고치며, 단계별로 사고하여 수학 문제를 해결하는 "에이전트"가 되었습니다. 2026년에 이르러 최고의 모델들은 국제 수학 올림피아드 문제를 풀고 전체 소프트웨어 프로젝트를 수리하게 되었습니다.

성장의 속도: 수학적 미스터리
이 논문은 모델들이 실제 세상의 소프트웨어 버그를 고치는 능력(SWE-bench라는 테스트 사용)이 얼마나 빠르게 향상되고 있는지 측정합니다. 결과는 놀랍습니다. 모델이 버그를 성공적으로 고칠 확률은 매년 약 5.8배씩 성장하고 있습니다. 이는 만약 한 명의 러너가 매년 5.8배씩 빨라진다면, 불과 몇 년 만에 소리보다 빠르게 달릴 수 있게 되는 것과 같습니다. 그러나 논문은 기존의 "지식 테스트(MMLU 등)"가 한계에 부딪히고 있다고도 언급합니다. 모델들이 너무나 잘하게 된 나머지, 이제 그 테스트들은 모델들을 구별하는 데 무용지물이 되었습니다. 분야는 더 어렵고 실질적인 도전 과제로 이동했습니다.

가격 폭락: "보급형 티어"의 놀라움
여기서 가장 놀라운 이야기가 나옵니다. 이 지능의 비용이 폭락했습니다.

  • 2020년에는 100만 단어의 AI 사고력을 얻는 데 60달러가 들었습니다.
  • 2026년에는 "보급형" 버전의 AI가 동일한 양의 사고력에 단 1달러면 충분합니다.
    이는 60배의 가격 하락입니다.

하지만 더 놀라운 점이 있습니다. 논문은 2026년의 저렴한 "보급형" 모델들이 불과 몇 달 전의 초고가 "플래그십" 모델만큼이나 성능이 좋다는 것을 발견했습니다. 이는 마치 오늘날의 100달러짜리 자동차가 작년의 500달러짜리 자동차만큼 잘 달릴 수 있는 것과 같습니다. 시장의 "중간 지대"는 사라졌습니다. 여러분은 저렴하고 똑똑한 보급형 티어를 얻거나, 아니면 초고가의 프리미엄 티어를 얻게 될 뿐입니다. 중간 단계는 존재하지 않습니다.

"전문가" 팀 vs "팔방미인"
오랫동안 사람들은 하나의 거대한 모델이 결국 모든 것에 최고가 될 것이라고 생각했습니다. 하지만 논문은 2026년 현재, 그 아이디어는 죽었다고 주장합니다. "프런티어(최첨단)" AI는 이제 파편화되었습니다.

  • 웹사이트를 만들고 싶다면, Claude Opus 5가 챔피언입니다.
  • 거대한 코드 저장소를 고쳐야 한다면, Claude Fable 5가 승리합니다.
  • 컴퓨터가 터미널에서 인간처럼 행동하게 하려면, GPT-5.6 Sol이 대장입니다.
  • 완전히 새로운 유형의 논리 퍼즐을 풀어야 한다면, Opus 5가 기록 보유자입니다.

단 하나의 모델이 모든 것에서 승리하지는 않습니다. 논문은 이제 AI를 사용하는 가장 똑똑한 방법은 "라우터(router)", 즉 서로 다른 작업을 가장 적합한 전문가 모델에게 보내는 교통 경찰이 되는 것이라고 제안합니다. 두 모델 사이를 전환하는 단순한 시스템이 적절한 전문가를 선택함으로써 단일 최고의 모델을 능가할 수 있습니다.

고정된 모델을 더 똑똑하게 만들 수 있을까?
연구자는 또한 모델 자체를 바꾸지 않고 질문하는 방식만 바꾸어 작은 고정 모델을 더 똑똑하게 만들 수 있는지 확인하기 위해 작은 실험을 수행했습니다.

  • 작은 모델(Qwen2.5-1.5B)에게 수학 문제를 풀게 했습니다.
  • 한 번만 물었을 때("탐욕적(greedy)" 방식)는 **58%**를 맞혔습니다.
  • 네 번 물어보고 가장 흔한 답을 선택했을 때("투표" 기술)는 **62%**를 맞혔습니다.
  • "천장(ceiling, 네 번의 시도 중 마법처럼 최선의 답을 골라낼 수 있다면)"은 **79%**였습니다.

이는 모델이 대부분의 경우 정답을 이미 '알고' 있지만, 단지 그것을 뽑아내는 더 나은 방법이 필요하다는 것을 시사합니다. 또한 논문은 정답일 가능성이 높은 답변을 예측할 수 있는 "신뢰도 탐지기(confidence detector)"를 구축했습니다. 이를 통해 탐지기가 가장 확신하는 답변들만 신뢰했을 때, 그 특정 그룹에서 **94%**의 정확도를 얻을 수 있음을 발견했습니다. 이는 미래에 우리가 더 큰 모델을 필요로 하는 것이 아니라, 그들의 작업을 검증하고 최선의 것을 골라내는 더 나은 방법이 필요할 수도 있음을 시사합니다.

결론
논문은 "모든 것을 다스리는 하나의 모델"의 시대는 끝났다고 결론짓습니다. 우리는 **전문화과 라우팅(specialization and routing)**의 시대로 나아가고 있습니다. 모델들은 특정 작업에 믿기지 않을 정도로 능숙해지고 있으며, 가격은 빠르게 떨어지고 있고, AI를 사용하는 가장 똑똑한 방법은 그것을 단일 슈퍼 브레인이 아닌 전문가 팀처럼 다루는 것입니다. 모델들이 놀라울 정도로 발전하고 있지만, 논문은 이들이 테스트를 "속이는(gaming)" 데에도 매우 능숙해지고 있으므로, 우리가 무엇을 신뢰할지에 대해 주의해야 한다고 경고합니다. 미래는 단순히 더 큰 두뇌를 갖는 것이 아니라, 우리가 가진 두뇌를 더 똑똑하게 사용하는 방법에 달려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →