← 최신 논문
🤖 AI

Asking the Right Questions: Improving Reasoning with Generated Stepping Stones

본 논문은 전이 가능한 중간 '발판' 질문을 생성함으로써 복잡한 작업에 대한 LLM 추론을 강화하는 ARQ 프레임워크를 소개하며, 이러한 유익한 프롬프트를 생성하기 위해 합성 데이터를 통해 SFT 및 RL로 모델을 효과적으로 미세 조정할 수 있음을 입증합니다.

원저자: Hengyuan Hu, Tingchen Fu, Minqi Jiang, Alexander H Miller, Yoram Bachrach, Jakob Nicolaus Foerster

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hengyuan Hu, Tingchen Fu, Minqi Jiang, Alexander H Miller, Yoram Bachrach, Jakob Nicolaus Foerster

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 복잡하고 난해한 퍼즐을 풀려고 노력한다고 상상해 보세요. 상자를 바라보며 조각들이 무질서하게 쌓인 더미를 바라보면, 당신의 뇌는 얼어붙습니다. 조각을 억지로 끼워 넣으려 하지만 맞지 않습니다. 다시 시도하고 또다시 시도하다가 결국 포기하게 됩니다.

인공지능 (AI) 이 매우 어려운 수학이나 논리 문제를 풀려고 할 때 종종 이런 일이 발생합니다. AI 는 문제 전체를 바라보고 바로 정답으로 뛰어들려 하지만, 결국 막히게 됩니다.

이 논문은 ARQ(올바른 질문하기) 라는 새로운 사고방식을 소개합니다. ARQ 는 AI 에게 거대한 퍼즐을 즉시 풀도록 강요하는 대신, 먼저 작고 간단한 연습용 퍼즐을 만들도록 가르칩니다.

"발판" 비유

어려운 문제를 건너야 하는 넓은 강으로 생각하세요.

  • 옛날 방식: AI 는 깊고 빠르게 흐르는 물을 가로질러 바로 헤엄치려 합니다. 종종 익사 (실패) 합니다.
  • ARQ 방식: AI 는 먼저 강 한가운데 있는 작고 얕은 돌을 찾습니다. 그 돌 (발판) 위로 점프하여 숨을 고르고, 그 작은 구간을 어떻게 건너야 할지 파악합니다. 돌 위에 서면 더 좋은 시야와 다음 돌로, 그리고 결국 반대편으로 점프할 수 있는 자신감을 얻게 됩니다.

이 논문에서 그 "돌"은 원래 문제의 더 간단한 버전입니다.

작동 원리 (두 단계 춤)

연구자들은 두 개의 AI "뇌"가 협력하는 시스템을 구축했습니다.

  1. 질문 생성기 (건축가): 이 AI 는 어려운 문제를 바라보고 말합니다. "이건 한 번에 하기엔 너무 어렵다. 같은 규칙을 사용하는 더 작고 쉬운 문제 버전을 만들어 보자."
    • 예시: 어려운 문제가 6개의 동전으로 이루어진 원에 관한 것이라면, 생성기는 "만약 동전이 4개뿐이라면 어떨까?"라고 물을 수 있습니다.
  2. 해결사 (건설자): 이 AI 는 먼저 작고 쉬운 문제를 풉니다. 작은 문제의 답을 찾으면, 그 답을 힌트로 활용하여 크고 어려운 문제를 풉니다.

발견한 점

연구자들은 AIME 와 같은 매우 까다로운 수학 경시대회에서 이를 테스트했습니다. 그들이 발견한 점은 다음과 같습니다.

  • 좋은 돌은 존재합니다: 그들은 이러한 "발판" 질문들이 실제로 존재함을 증명했습니다. AI 가 먼저 작은 문제를 풀었을 때, 큰 문제를 훨씬 더 자주 올바르게 풀었습니다.
  • 모든 돌이 같은 것은 아닙니다: 때때로 AI 는 "나쁜" 발판을 생성합니다 (미끄럽거나 막다른 길로 이어지는 돌처럼). AI 가 나쁜 것을 선택하면 혼란에 빠질 수 있습니다. 하지만 좋은 것을 선택하면 개선 효과가 엄청납니다.
  • 누구에게나 작동합니다: 가장 좋은 점은 좋은 발판이 그것을 만든 AI 뿐만 아니라 어떤 AI 에게나 도움이 된다는 것입니다. 그것은 만능 열쇠와 같습니다. 올바른 힌트가 있다면 약한 AI 조차도 퍼즐을 풀 수 있습니다.
  • 건축가 훈련: 연구자들은 "질문 생성기" AI 가 항상 최고의 질문을 던지는 것은 아니라는 점을 깨달았습니다. 그래서 그에게 특별한 훈련 과정을 제공했습니다. 수천 개의 좋은 질문과 나쁜 질문의 예를 보여주고, 실제로 도움이 될 질문을 식별하도록 가르쳤습니다. 이 훈련 후 AI 는 올바른 질문을 던지는 데 훨씬 능숙해졌고, 전체 시스템은 훨씬 더 똑똑해졌습니다.

"연습 경기" 비유

챔피언십 우승을 결정하는 프리스로를 찍으려는 프로 농구 선수가 된다고 상상해 보세요.

  • ARQ 없이: 라인에 서서 눈을 감고 슈팅합니다. 놓치면 놓치는 것입니다.
  • ARQ 로: 큰 슈팅 전에 3 피트 거리에서 몇 번의 연습 슈팅을 합니다. 리듬을 느끼고 자세를 점검하며 "아, 무릎을 조금 더 구부려야겠다"라고 깨닫습니다. 그런 다음 그 느낌을 실제 원거리 슈팅에 적용합니다. 골을 넣을 가능성이 훨씬 높아집니다.

결론

이 논문은 AI 가 어려운 과제를 더 잘 수행하려면 단순히 더 노력하는 것이 아니라 다르게 생각해야 함을 보여줍니다. 거대한 문제를 먼저 작고 관리 가능한 연습 문제로 분해함으로써 AI 는 실제 문제를 풀기 위해 필요한 직관을 구축할 수 있습니다. 연구자들은 또한 AI 가 이러한 연습 문제를 찾는 데 매우 능숙하도록 가르칠 수 있음을 보여주어 전체 과정을 훨씬 더 신뢰할 수 있게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →