← 최신 논문
💬 NLP

Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3

AIMO 3 대회 실험을 통해 다양한 추론 전략을 적용한 '다양성 프롬프트 믹서'가 오류 상관관계를 줄이는 데 실패했으며, 고온 샘플링이 이미 충분한 효과를 내는 반면 약한 프롬프트 전략은 정확도를 떨어뜨려, 추론 시간 최적화보다 모델의 자체 능력 차이가 성능에 훨씬 더 지배적인 영향을 미친다는 결론을 도출했습니다.

원저자: Natapong Nitarach

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Natapong Nitarach

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 핵심 비유: "요리사 vs 레시피"

이 논문의 주제를 이해하기 위해 요리를 예로 들어볼까요?

  • 모델 (AI) = 요리사의 실력
  • 프롬프트 (지시사항) = 요리 레시피
  • 수학 문제 = 요리할 재료

대부분의 사람들은 "요리사가 실력이 부족하면, 레시피를 더 정교하게 바꾸거나 여러 가지 레시피를 섞어서 요리하면 맛이 좋아지겠지?"라고 생각합니다. 이 논문은 바로 그 가설을 실험해 본 것입니다.


🧪 실험 내용: "다양한 레시피 섞기 (Diverse Prompt Mixer)"

연구팀은 한 명의 요리사 (AI 모델) 를 두고, 같은 재료를 가지고 8 가지 다른 방식으로 요리를 시켰습니다.

  1. 기본 레시피: 차근차근 설명하는 방식.
  2. 작은 예시 먼저: 1, 2, 3 번부터 작은 숫자로 먼저 풀어보는 방식.
  3. 뒤에서부터 풀기: 답을 먼저 추측하고 역으로 계산하는 방식.
  4. 코드 먼저: 컴퓨터 코드로 먼저 계산해보는 방식.
  5. 그 외: 문제 유형을 분류해서 푸는 방식 등...

이렇게 서로 다른 레시피를 섞어서 8 명이 동시에 요리를 시키고, 가장 많은 사람이 낸 답을 정답으로 채택했습니다 (다수결).

예상: "서로 다른 방식으로 풀면 실수하는 패턴이 달라져서, 전체적인 정답률이 훨씬 올라가겠지?"

현실: 완전 빗나갔습니다. (😱)


📉 실패한 이유 3 가지

연구팀은 왜 실패했는지 3 가지 이유를 찾았습니다.

1. 이미 '요리사'가 너무 똑똑해서 (고온 샘플링)

요리사에게 "요리할 때 좀 더 창의적으로, 엉뚱한 아이디어도 섞어봐!"라고 했을 때 (AI 의 'Temperature' 설정을 높임), 이미 요리사 스스로가 다양한 방식으로 요리를 시도합니다. 굳이 레시피를 바꿔주지 않아도, 요리사 머릿속에서 이미 다양한 시도가 일어나고 있는 거죠.

비유: 이미 천재 요리사에게 "오늘은 좀 다른 스타일로 해봐"라고 하면, 레시피를 바꿔줄 필요 없이 스스로 창의적으로 변합니다. 굳이 레시피를 바꿔주면 오히려 요리사가 당황해서 실수합니다.

2. 레시피를 바꾸면 실력이 떨어집니다

"작은 예시부터 풀어봐"나 "뒤에서부터 풀어봐" 같은 새로운 레시피를 주면, 요리사는 그 방식에 익숙하지 않아서 오히려 실수할 확률이 높아집니다.

비유: 미슐랭 스타 셰프에게 "오늘은 초보자가 쓰는 간단한 레시피로 요리해"라고 하면, 그 셰프는 오히려 요리를 망칩니다. 레시피를 다양하게 섞는다고 해서 실수가 줄어들지 않고, 오히려 요리사의 본領을 발휘하지 못하게 방해합니다.

3. 결국 중요한 건 '요리사'의 실력 (모델 능력)

연구팀은 다른 모델 (요리사) 들도 비교해 봤습니다.

  • A 요리사 (gpt-oss-120b): 50 문제 중 약 40 개를 맞췄음.
  • B 요리사 (Nemotron): 50 문제 중 23 개만 맞췄음.

레시피를 아무리 바꿔도, A 요리사가 B 요리사보다 17 점이나 더 잘했습니다. 이는 레시피 (인ference 최적화) 로는 절대 따라잡을 수 없는 **실력 차이 (모델 능력)**였습니다.


💡 결론: "요령보다 실력이 답이다"

이 논문의 결론은 매우 명확합니다.

  1. 모델이 약하면, 레시피를 아무리 바꿔도 소용없다.
    • 수학 문제처럼 어려운 문제에서는 AI 의 기본 능력 (모델 크기, 학습 데이터) 이 90% 이상을 결정합니다.
  2. 이미 충분히 다양하다.
    • AI 에게 "창의적으로 생각해보라"고만 하면, 스스로 다양한 길을 찾습니다. 굳이 레시피를 바꿔줄 필요가 없습니다.
  3. 전략은 "로또"에 가깝다.
    • 점수를 더 높이려면, 똑같은 설정으로 여러 번 시도해 보는 것 (로또 티켓을 많이 사는 것) 이 레시피를 바꾸는 것보다 훨씬 효과적입니다.

🚀 일반인을 위한 요약 메시지

"AI 가 어려운 수학 문제를 풀 때, "이렇게 해봐", "저렇게 해봐"라고 지시사항을 바꾸는 것은 천재 요리사에게 '초보 레시피'를 주는 것과 같습니다.

오히려 가장 똑똑한 요리사 (최고 성능 모델) 를 고용하고, 그에게 **"네가 알아서 창의적으로 여러 번 시도해봐"**라고 말해주는 것이 가장 좋은 방법입니다.

결론: 요령 (프롬프트 엔지니어링) 보다 실력 (모델 능력) 이 압도적으로 중요합니다."

이 연구는 AI 개발자들에게 "더 좋은 모델을 만드세요"라는 메시지를, 그리고 대회 참가자들에게 "모델을 바꾸는 데 집중하세요"라는 현실적인 조언을 남겼습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →