← 최신 논문
💻 computer science

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

이 논문은 저자원 인도어에서 특히 교차언어 수학적 추론 능력을 크게 향상시키기 위해 인터리브 강화학습과 점진적 단계별 커리큘럼, 그리고 새로운 다국어 데이터셋(CL-Math)을 결합한 새로운 프레임워크인 IRIS를 소개합니다.

원저자: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 학생에게 복잡한 수학 문제를 푸는 법을 가르친다고 상상해 보세요. 만약 어려운 교과서만 던져주며 "스스로 해결해 봐"라고만 한다면, 그 학생은 아마 막히거나 무작위로 추측하거나 포기할 가능성이 높습니다. 이는 영어, 힌디어, 마라티어와 같은 언어 간 전환을 시도하는 AI 모델이 수학 문제를 풀 때 직면한 문제와 정확히 일치합니다.

이 논문은 IRIS(Interleaved Reinforcement with Incremental Staged Curriculum, 점진적 단계형 커리큘럼을 활용한 교차 강화 학습) 라는 새로운 학습 방법을 소개합니다. IRIS 는 혼란스러운 AI 를 자신감 있는 수학 해결사로 바꾸도록 설계된 매우 구조화된 2 단계 튜터링 시스템으로 생각할 수 있습니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 두 축 학습 계획

저자들은 수학 교육이 동시에 두 가지 다른 요소가 필요하다는 점을 깨달았습니다. 그들은 X 축과 Y 축과 같은 두 개의 "축"을 가진 프레임워크를 구축했습니다:

  • **수직 축 **(난이도 사다리 오르기)
    레벨 1(쉬운 문제) 에서 시작해 마스터해야만 레벨 2 로 넘어가는 비디오 게임을 상상해 보세요. 대부분의 AI 학습은 모든 난이도를 한 번에 모델에게 던집니다. IRIS 는 다릅니다. IRIS 는 AI 를 쉬운 수학 문제부터 시작해 그 문제들을 잘 풀 수 있게 만든 뒤, 그 다음에 점차 중간 난이도와 어려운 문제를 도입합니다. 이는 어려운 문제를 tackling 하기 전에 튼튼한 기초를 다지는 역할을 합니다.

  • **수평 축 **(이야기 완성하기 게임)
    이것이 바로 교묘한 부분입니다. 보통 AI 는 문제와 전체 해답을 함께 제시받습니다. IRIS 는 이 게임을 바꿉니다. IRIS 는 질문과 해답의 첫 몇 단계를 AI 에게 제공한 뒤, "자, 이제 너 혼자야. 나머지를 완성해 줘"라고 말합니다.

    • 초기 단계: AI 는 대부분의 단계를 제공받고 마지막 두 단계만 작성해야 합니다.
    • 후기 단계: AI 는 질문만 제공받고 처음부터 전체 해답을 작성해야 합니다.
      이는 AI 가 단순히 전체 해답을 외우는 것이 아니라, 스스로 사고를 계획하고 계속하는 법을 배우도록 강요합니다.

2. "복합 보상" (점수판)

강화 학습에서 AI 는 잘할 때 점수 (보상) 를 받습니다. 보통은 최종 답이 맞을 때만 점수를 받습니다. 하지만 수학에서는 논리가 잘못된 채로 답만 맞는 것은 여전히 나쁜 결과입니다.

IRIS 는 복합 보상을 사용하는데, 이는 교사가 학생을 네 가지 기준으로 동시에 채점하는 것과 같습니다:

  1. 정답을 맞혔나요? (가장 중요한 부분).
  2. 단계가 논리적이었나요? (올바른 경로와 유사한 논리적 경로를 따랐나요?).
  3. 흐름을 유지했나요? (이전 단계가 멈춘 곳에서 계속 이어갔나요, 아니면 번호를 다시 매기며 처음부터 다시 시작했나요?).
  4. 숫자 형식이 올바른가요? (깔끔한 숫자를 출력했나요?).

이를 통해 AI 는 답이 무엇인지뿐만 아니라 어떻게 생각하는지 배우게 됩니다.

3. "영어 앵커" (다국어 비밀 소스)

가장 큰 도전 과제 중 하나는 힌디어나 마라티어처럼 자원이 적은 언어로 수학을 가르치는 것입니다. 영어에 비해 이러한 언어들은 고품질 수학 데이터가 훨씬 부족합니다.

이 논문은 흥미로운 트릭을 발견했습니다: 영어를 "추론 앵커"로 사용하세요.

  • AI 의 논리적 사고 능력은 영어에 저장되어 있고, 힌디어나 마라티어로 말하는 능력은 별개의 기술이라고 상상해 보세요.
  • 영어와 힌디어/마라티어 문제를 혼합하여 학습시킴으로써 (심지어 영어가 20% 만 포함되더라도), 영어 데이터는 안정적인 앵커 역할을 합니다. 이는 AI 의 논리적 추론을 날카롭고 일관되게 유지시킵니다.
  • 그런 다음 AI 는 이 강력한 추론 능력을 힌디어와 마라티어로 "이전"합니다. 이 영어 앵커가 없다면 AI 는 자원이 적은 언어에서 논리적 일관성을 유지하는 데 어려움을 겪으며, 종종 막히거나 포기하게 됩니다.

4. 결과

연구진은 영어, 힌디어, 마라티어로 단계별 해답이 포함된 29,000 개의 수학 문제를 담은 CL-Math라는 새로운 데이터셋을 만들어 이를 테스트했습니다.

  • 향상된 수학 능력: IRIS 로 학습된 모델은 표준 모델보다 훨씬 더 많은 문제를 정확하게 해결했으며, 특히 가장 어려운 질문에서 두드러졌습니다.
  • 언어 부스트: 가장 큰 개선은 힌디어와 마라티어에서 나타났습니다. "영어 앵커" 전략은 AI 가 해당 언어들만 단독으로 학습했을 때보다 훨씬 더 잘 추론할 수 있도록 도왔습니다.
  • 일반화: 특정 데이터셋으로 학습했음에도 불구하고, AI 는 GSM8K 및 MATH 와 같은 다른 표준 수학 테스트에서도 더 좋은 성과를 보였으며, 이는 이 방법이 광범위하게 작동함을 입증했습니다.

요약

간단히 말해, IRIS는 다음을 통해 AI 에게 수학을 가르치는 학습 방법입니다:

  1. 쉬운 것부터 시작해 점점 어렵게 만들기 (수직).
  2. AI 가 부분 해답을 완성하게 만들기 (수평).
  3. 답과 논리 모두를 평가하기 (복합 보상).
  4. 다른 언어로 수학을 배우도록 돕는 "훈련 바퀴"로 영어 사용하기 (다국어 앵커).

그 결과, 추측이 아니라 실제로 단계를 이해함으로써 여러 언어로 수학 문제를 해결할 수 있는 더 똑똑하고 논리적인 AI 가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →