← 최신 논문
🤖 machine learning

TEMPO: Scaling Test-time Training for Large Reasoning Models

이 논문은 테스트 시 학습 (TTT) 중 발생하는 보상 신호의 편향과 다양성 붕괴 문제를 해결하기 위해 정책 정제와 라벨 데이터 기반의 비평가 재보정을 교차 수행하는 'TEMPO' 프레임워크를 제안하여, 다양한 대규모 추론 모델의 성능과 다양성을 동시에 크게 향상시켰음을 보여줍니다.

원저자: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

게시일 2026-04-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🚀 TEMPO: 시험장에서 배우는 '똑똑한 AI'의 비밀

이 논문은 **"시험을 치르면서 동시에 더 똑똑해지는 AI"**를 만드는 새로운 방법인 TEMPO에 대해 설명합니다. 기존 AI 는 공부를 다 끝낸 후 시험을 보면 그 점수로만 만족하고 끝났지만, TEMPO 는 시험지를 풀면서 실시간으로 실력을 업그레이드합니다.

이 복잡한 기술을 일상적인 비유로 쉽게 풀어보겠습니다.


1. 문제: 왜 기존 AI 는 시험장에서 멈추나요? (기존 방식의 한계)

기존의 '시험 때 훈련 (Test-time Training)' 방식은 혼자서 문제를 풀고 스스로 점수를 매기는 방식이었습니다.

  • 비유: imagine imagine 혼자 공부하는 학생이 있다고 상상해 보세요.
    • 이 학생은 문제를 풀고 "아, 내가 푼 답이 맞을 거야!"라고 스스로 믿습니다.
    • 처음에는 잘하지만, 시간이 지나면 자신의 실수를 '정답'으로 착각하게 됩니다.
    • "내가 이 방식이 최고야!"라고 고집을 부리면서, 다른 창의적인 풀이법을 무시하게 됩니다.
    • 결과: 성적은 어느 순간 더 이상 오르지 않고 (Plateau), 사고방식은 단조로워져서 (Diversity Collapse) 새로운 문제를 풀지 못하게 됩니다.

이게 바로 기존 AI 들이 겪는 **'스스로를 속이는 함정'**입니다.


2. 해결책: TEMPO (시험 때 기대-최대화 정책 최적화)

저자들은 이 문제를 해결하기 위해 TEMPO라는 두 단계의 루프를 만들었습니다. 이를 **'현명한 멘토와 학생'**의 관계로 비유해 볼까요?

🔄 TEMPO 의 두 가지 단계 (E-Step & M-Step)

1 단계: E-Step (멘토의 재점검)

  • 상황: 학생이 문제를 풀기 전에, 전문가 멘토가 미리 준비된 '정답지 (레이블 데이터)'를 보고 자신의 평가 기준을 다시 다듬습니다.
  • 비유: "아, 내가 전에 '이런 식이 정답이야'라고 생각했는데, 정답지를 보니 그건 틀렸구나. 내 평가 기준을 다시 바로잡아야지!"
  • 핵심: AI 가 스스로 평가하는 기준 (크리틱) 을 정답이 있는 데이터로 주기적으로 교정합니다. 이렇게 하면 AI 가 망상 (잘못된 확신) 에 빠지는 것을 막습니다.

2 단계: M-Step (학생의 문제 풀이)

  • 상황: 이제 기준이 바로잡힌 멘토를 믿고, 학생은 **정답을 모르는 새로운 문제 (테스트 데이터)**를 풉니다.
  • 비유: 멘토가 "이 문제는 이렇게 접근해 봐, 저렇게 접근해 봐"라고 다양한 방향을 제시해 줍니다. 학생은 이 피드백을 받아서 자신의 풀이 방식을 개선합니다.
  • 핵심: AI 는 정답을 모르는 문제에서도 멘토의 도움을 받아 실시간으로 실력을 키웁니다.

이 **멘토의 기준 교정 (E)**과 **학생의 문제 풀이 (M)**를 반복하는 것이 TEMPO 의 핵심입니다.


3. TEMPO 가 왜 대단한가요? (실험 결과)

이 방법을 적용하자 놀라운 일이 일어났습니다.

  • 성적의 폭발적 상승:

    • 수학 올림피아드 (AIME) 같은 어려운 시험에서, 기존 AI 는 33% 정도에서 멈췄지만, TEMPO 를 쓴 AI 는 51% 까지, 14B 모델은 65% 까지 점수가 올랐습니다.
    • 마치 중간고사 점수가 30 점대였던 학생이, 시험장에서 실시간으로 공부해서 기말고사 90 점대를 받은 것과 같습니다.
  • 사고방식의 다양성 유지:

    • 기존 방식은 "가장 많이 나온 답"만 고집하다가 사고가 멈췄지만, TEMPO 는 다양한 풀이법을 계속 시도합니다.
    • 비유: 다른 친구들이 "A 가 정답이야"라고 외칠 때, TEMPO 는 "잠깐, B 나 C 도 가능성 있지 않나?"라고 생각하며 창의성을 잃지 않습니다.
  • 어떤 문제든 잘 푼다:

    • 수학뿐만 아니라 논리 퍼즐, 과학 문제 등 다양한 분야에서도 효과가 입증되었습니다.

4. 요약: TEMPO 의 핵심 교훈

이 논문이 우리에게 주는 메시지는 매우 간단합니다.

"스스로를 평가하는 기준 (멘토) 을 주기적으로 '정답지'로 확인하지 않으면, 아무리 많이 문제를 풀어도 실력은 더 이상 오르지 않는다."

기존 AI 들은 혼자서 "내가 최고야!"라고 외치며 멈췄지만, TEMPO 는 정답지를 보며 기준을 바로잡는 멘토를 곁에 두고, 새로운 문제를 풀 때마다 실시간으로 성장합니다.

이 기술이 적용되면, 앞으로 AI 는 시험을 치르는 순간마다 더 똑똑해져서, 우리가 상상하지 못했던 복잡한 문제들도 해결해 줄 수 있을 것입니다. 🌟

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →