← 최신 논문
💬 NLP

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

이 논문은 다양한 추론 패러다임의 성능이 작업에 따라 상이하게 달라진다는 점을 규명하고, 학습된 라우터를 통해 각 작업에 가장 적합한 추론 방식을 동적으로 선택하는 'Select-then-Solve' 접근법이 고정된 단일 패러다임보다 우수한 성능을 발휘함을 입증합니다.

원저자: Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zh
게시일 2026-04-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 문제를 풀 때, 어떤 '사고 방식'을 쓰느냐가 정답을 맞히는 데 얼마나 중요한가?"**를 연구한 내용입니다.

기존에는 "AI 모델이 똑똑해지면 모든 문제가 해결된다"고 생각했지만, 이 연구는 **"똑똑한 AI 라도 상황에 따라 엉뚱한 사고방식을 쓰면 오히려 틀릴 수 있다"**는 놀라운 사실을 밝혀냈습니다.

이 복잡한 연구를 일상적인 비유로 쉽게 설명해 드릴게요.


🍳 1. 핵심 비유: "요리사와 조리법"

이 논문의 주인공인 **LLM(대형 언어 모델)**을 **'요리사'**라고 상상해 보세요.
그리고 **6 가지의 다른 사고 방식 (Direct, CoT, ReAct 등)**을 **'요리법'**이라고 치환해 봅시다.

  • Direct (직접 답변): "재료만 줘라, 내가 알아서 요리해." (요리사의 재능만 믿는 방식)
  • CoT (단계별 생각): "먼저 재료를 다지고, 볶고, 소금 간을 해. 그다음에 맛을 봐." (생각을 단계별로 기록하는 방식)
  • ReAct (행동과 생각): "재료가 부족하면 마트에 가서 사와. 그리고 요리해." (도구를 쓰며 생각과 행동을 반복하는 방식)
  • Reflection (비판과 수정): "일단 요리해 봤는데, 맛이 이상하네? 다시 생각해 보고 고쳐." (자신을 비판하며 수정하는 방식)

🔍 2. 연구의 발견: "한 가지 요리법으로 모든 요리를 할 수 없다"

연구진은 4 명의 다른 요리사 (최고급 AI 모델 4 개) 를 데려와서 10 가지 다른 요리 (10 가지 시험 문제) 를 시켰습니다. 결과는 어땠을까요?

  • 상황 A (정보 검색이 필요한 요리): "오늘 서울 날씨와 맛집을 알려줘."
    • 이때는 **ReAct(마트 가는 방식)**가 가장 잘합니다. 직접 물어보지 않고 마트 (인터넷 검색) 에 다녀와야 하니까요.
    • 반면, **Direct(직접 답변)**는 "모르겠다"고 하거나 엉뚱한 소리를 합니다.
  • 상황 B (순수 지식이 필요한 요리): "프랑스 혁명이 언제 일어났지?"
    • 이때는 **Direct(직접 답변)**가 가장 빠르고 정확합니다.
    • 그런데 **CoT(단계별 생각)**를 쓰면, "생각해 보니... 아, 아니야..." 하며 헷갈려서 오히려 틀립니다. (생각이 너무 많으면 오히려 방해가 됨)
  • 상황 C (코딩 문제): "파이썬 코드를 짜줘."
    • **ReCode(코드 생성 방식)**가 최고지만, CoT를 쓰면 코드가 엉망이 됩니다.

결론: 어떤 요리법이 최고인지는 요리 (문제) 의 종류에 따라 완전히 다릅니다. 무조건 "생각을 많이 하라"고 하면 오히려 실패할 수 있습니다.

🎯 3. 해결책: "스마트한 주방장 (라우터)"

그렇다면 어떻게 해야 할까요? 모든 문제에 똑같은 요리법을 쓰는 게 아니라, **문제에 맞는 요리법을 골라주는 '스마트한 주방장'**이 필요합니다.

저희 연구팀은 **'선택 후 해결 (Select-then-Solve)'**이라는 시스템을 만들었습니다.

  1. 문제 들어옴: "오늘 날씨 알려줘."
  2. 주방장 (라우터) 분석: "이건 검색이 필요하네? ReAct 방식을 써야겠다."
  3. 실행: AI 가 ReAct 방식으로 검색을 하고 정답을 냅니다.
  4. 문제 들어옴: "수학 문제 풀어줘."
  5. 주방장 분석: "이건 계산이 필요하네? ReCode 방식을 써야겠다."

이 **'스마트 주방장'**을 도입하자, AI 의 정답률이 기존 최고 방식보다 약 3%~5% 더 올라갔습니다. 그리고 무조건 비싼 방식 (도구를 많이 쓰는 방식) 을 쓸 때보다 비용 (토큰 사용량) 은 절반으로 줄였습니다.

⚠️ 4. 주의할 점: "AI 스스로 고르면 안 된다"

흥미로운 점은, AI 스스로 "내가 지금 어떤 방식을 쓸까?"라고 물어보면 실패한다는 것입니다.

  • **최고급 AI(GPT-5)**는 스스로 고르면 어느 정도 잘하지만,
  • 중급 AI들은 스스로 고르면 "아, 나는 도구를 써야 해!"라고 무조건 도구를 쓰다가 실패합니다.

이는 "무엇을 할 수 있는지 아는 것 (실력)"과 "언제 무엇을 써야 할지 아는 것 (판단력)"은 별개의 능력임을 보여줍니다. 그래서 우리가 **스마트 주방장 (학습된 라우터)**을 따로 만들어서 AI 를 도와줘야 합니다.

💡 5. 한 줄 요약

"똑똑한 AI 라도 상황에 따라 엉뚱한 사고방식을 쓰면 실패합니다. 그래서 각 문제에 맞춰 '생각 방식'을 자동으로 골라주는 '스마트 주방장'을 두면, 더 정확하고 저렴하게 문제를 풀 수 있습니다."

이 연구는 앞으로 AI 에이전트를 만들 때, 무조건 복잡한 사고 과정을 강요하기보다 **"어떤 문제에 어떤 방식을 쓸지 선택하는 능력"**이 핵심임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →