← 최신 논문
💬 NLP

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

이 논문은 강화 학습 훈련 시 부분 해답을 도입하여 문제 난이도를 낮추고 학습 신호를 강화하는 'QuestA' 전략을 제안함으로써, 15 억 파라미터 모델이 수학 추론 벤치마크에서 새로운 최첨단 성능을 달성하도록 했습니다.

원저자: Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

게시일 2026-04-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

QUESTA: 어려운 문제를 풀게 해주는 '힌트'의 마법

이 논문은 인공지능 (LLM) 이 수학이나 논리 같은 어려운 문제를 풀 때, 어떻게 하면 더 똑똑해질 수 있는지에 대한 새로운 방법을 소개합니다. 연구팀이 제안한 방법의 이름은 **'QUESTA'**입니다.

이걸 이해하기 위해 일상생활에 비유해 볼까요?

1. 문제점: "너무 어려운 시험지"와 "너무 쉬운 시험지"의 함정

기존에 인공지능을 가르칠 때 (강화 학습이라고 부릅니다), 두 가지 극단적인 문제가 있었습니다.

  • 너무 쉬운 문제만 풀게 하면: 학생은 이미 아는 내용만 반복해서 풀게 됩니다. 점수는 오를 것 같지만, 실제로는 새로운 것을 배우지 못하고 "자신감만 과하게" 생깁니다. 나중에 진짜 어려운 시험을 보면, 오히려 평소보다 더 못 풀게 됩니다. (논문의 Figure 2 에서 보듯, 쉬운 문제만 풀면 정답률이 떨어집니다.)
  • 너무 어려운 문제만 풀게 하면: 학생은 문제를 보자마자 "어떻게 시작하지?"라며 막힙니다. 정답을 한 번도 못 찾아내니, 선생님 (AI) 은 "정답을 줘야지"라고 생각하지만, 학생은 힌트도 없이 막막해서 아무것도 배우지 못합니다. (보상이 거의 없으니 학습이 멈춥니다.)

2. 해결책: QUESTA (힌트 달아주기)

연구팀은 이 문제를 해결하기 위해 QUESTA라는 방법을 개발했습니다. 핵심은 **"문제 풀이 과정의 일부 (힌트) 를 미리 알려주는 것"**입니다.

비유: 요리 레시피

  • 기존 방식: "오늘 저녁 메뉴는 스테이크야. 만들어봐!"라고만 하면 초보자는 당황해서 실패합니다.
  • QUESTA 방식: "오늘 저녁 메뉴는 스테이크야. 일단 소고기를 두툼하게 썰고, 소금과 후추를 뿌려두면 돼. 그다음부터 네가 해봐!"라고 말합니다.

이렇게 문제 해결의 첫 단계를 미리 보여줌으로써, AI 는 "아, 이렇게 시작하는구나!"라고 배우고, 그 다음 단계부터는 스스로 고민하며 정답에 도달할 수 있게 됩니다.

3. 왜 이것이 효과적인가요? (학습의 효율성)

  • 학습 속도 빨라짐: 처음부터 끝까지 혼자 끙끙 앓지 않아도 되니, 정답을 찾는 확률이 훨씬 높아집니다.
  • 진짜 실력 향상: 힌트는 훈련할 때만 줍니다. 시험 (평가) 때는 힌트를 주지 않습니다. 그런데 신기하게도, 훈련할 때 힌트를 받아본 AI 는 시험 때 힌트가 없어도 훨씬 더 잘 풉니다. 마치 "어려운 문제를 풀 때 필요한 사고방식"을 체득했기 때문입니다.
  • 작은 모델도 거인 됨: 이 방법을 쓰면, 파라미터가 15 억 개 (1.5B) 인 작은 AI 모델도, 320 억 개 (32B) 나 되는 거대 모델 못지않은 실력을 보여주었습니다. (논문 Table 1 참조)

4. 실제 성과: 수학 올림피아드에서도 승리

이 방법을 적용한 AI 모델 (QUESTA-Nemotron-1.5B) 은 세계적인 수학 경시대회인 AIMEHMMT 같은 아주 어려운 시험에서 놀라운 성적을 냈습니다.

  • 기존 15 억 개 모델의 실력을 10% 이상 끌어올렸습니다.
  • 심지어 320 억 개 모델보다 더 좋은 점수를 받은 문제들도 있습니다.

5. 결론: "스caffolding(비계)"의 힘

이 논문의 핵심 메시지는 **"어려운 문제를 가르칠 때는, 처음부터 끝까지 혼자 시키지 말고, 적절한 '비계 (힌트)'를 세워주는 것이 중요하다"**는 것입니다.

  • 기존: "너 혼자 해봐!" (너무 어려움) 또는 "너 이미 다 알잖아?" (너무 쉬움)
  • QUESTA: "이 부분은 내가 도와줄게, 나머지는 네가 해봐! 그리고 나중에 그 도움은 빼고 네가 해볼 거야."

이처럼 **질문 (Question) 을 보완 (Augmentation)**하여 AI 가 스스로 성장할 수 있는 길을 열어준 이 기술은, 앞으로 AI 가 더 복잡한 문제를 해결하는 데 큰 역할을 할 것으로 기대됩니다.

한 줄 요약:

"어려운 수학 문제를 풀 때, 처음 몇 줄만 힌트로 알려주면 AI 가 스스로 더 똑똑해져서, 힌트가 없어도 거인처럼 문제를 푼다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →