← 최신 논문
🤖 machine learning

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

이 논문은 강화 학습 기반 추론에서 방해가 되는 프롬프트 토큰을 식별하고 제거하여 효율성을 높이는 'LENS' 프레임워크를 제안하며, 이를 통해 기존 GRPO 대비 수학 및 과학 추론 성능과 수렴 속도를 크게 향상시켰음을 보여줍니다.

원저자: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification"**이라는 제목의 연구로, 한국어로 쉽게 풀어서 설명해 드리겠습니다.

🎧 핵심 비유: "시끄러운 라디오를 청정 모드로 바꾸기"

이 연구의 핵심 아이디어를 한 마디로 요약하면, **"AI 가 문제를 풀 때 방해가 되는 '잡음'을 제거하면 훨씬 더 똑똑해진다"**는 것입니다.

지금까지 AI(대형 언어 모델) 가 수학이나 논리 문제를 풀려고 할 때, 실패하는 이유는 대부분 "문제가 너무 어려워서"가 아니라, **"문제 지문에 섞여 있는 헷갈리는 단어 (잡음) 때문"**이라는 놀라운 사실을 발견했습니다.


🧐 문제 상황: 왜 AI 는 자꾸 틀릴까?

AI 를 학습시키는 방법 중 하나인 '강화 학습 (RL)'은 AI 가 문제를 여러 번 풀고, 정답을 맞출 때마다 칭찬 (보상) 을 주는 방식입니다. 하지만 복잡한 문제에서는 AI 가 정답을 맞추기까지 수많은 시도를 해야 합니다.

기존 연구들은 "시도를 더 많이 해보자 (더 많은 돈과 시간을 써보자)"거나 "실패한 문제는 아예 제외하자"는 접근을 했습니다. 하지만 이 논문은 **"아니요, 문제는 시도 횟수가 아니라 문제 지문 자체에 숨겨진 '방해꾼' 때문입니다"**라고 말합니다.

  • 비유: 마치 라디오를 듣는데, 정답을 알려주는 목소리 대신 "으악, 소음!", "이건 틀렸어!" 같은 잡음이 섞여 있다면, 아무리 라디오를 크게 해도 소리가 들리지 않는 것과 같습니다.

💡 해결책: LENS (Less Noise Sampling Framework)

저자들은 이 문제를 해결하기 위해 **LENS(렌즈)**라는 새로운 방법을 개발했습니다. 렌즈처럼 잡음을 걸러내고 진짜 목소리만 듣게 해주는 장치죠.

LENS 는 두 단계로 작동합니다:

1 단계: 방해꾼 찾기 (잡음 제거)

AI 가 문제를 풀다가 실패했을 때, 그 실패 원인을 분석합니다.

  • 방해꾼 (Interference Token): 문제 지문 속에 섞여 있어 AI 를 혼란스럽게 만드는 몇 개의 단어 (토큰) 를 찾아냅니다. 보통 전체 단어의 5% 미만이 이런 역할을 합니다.
  • 청소: 이 방해꾼 단어들을 지문에서 지워버립니다. (예: "어떤 숫자가 3 을 곱하면 12 가 되는데, 아이고 머리가 아파 4 가 될까요?" → '아이고 머리가 아파'를 지우면)

2 단계: 깨끗한 답으로 배우기 (교차 학습)

지문을 깨끗하게 정리한 뒤, AI 에게 다시 문제를 풀게 합니다.

  • 성공 경험: 깨끗한 지문에서 AI 가 정답을 맞췄다면, 그 '성공 경험'을 기록합니다.
  • 원래 지문으로 적용: 이제 AI 에게 "너가 깨끗한 지문에서 정답을 맞췄잖아? 원래 지문 (잡음이 섞인 것) 을 봐도 그걸 기억해서 정답을 맞춰봐!"라고 가르칩니다.
  • 결과: AI 는 잡음이 섞인 원래 문제에서도 "아, 저 방해꾼 단어는 무시하고 핵심만 봐야겠다"라고 배우게 됩니다.

🚀 성과: 왜 이것이 중요한가?

이 방법을 적용한 결과, 기존 방식 (GRPO) 보다 훨씬 뛰어난 성과를 보였습니다.

  1. 더 빠른 학습: 같은 시간 안에 더 많은 것을 배웠습니다. (약 1.6 배 빠른 속도)
  2. 더 높은 정확도: 수학 문제 풀이 정확도가 평균 3.88% 향상되었고, 과학이나 일반 논리 문제에서도 1.83% 향상되었습니다.
  3. 비용 절감: 더 많은 컴퓨터 자원을 쓰는 대신, '질 좋은 학습'을 통해 효율을 높였습니다.

🌟 한 줄 요약

이 연구는 **"AI 를 더 똑똑하게 만드는 비법은 더 많은 문제를 푸는 게 아니라, 문제를 풀 때 방해가 되는 '잡음'을 찾아내어 제거하고, 그 깨끗한 상태에서 성공한 경험을 원래 문제로 옮겨 배우는 것"**임을 증명했습니다.

마치 시끄러운 카페에서 공부할 때, 귀마개를 하고 집중하면 훨씬 더 잘 공부할 수 있는 것과 같은 원리입니다. 이제 AI 도 잡음 없는 환경에서 자신의 '목소리 (추론 능력)'를 더 잘 낼 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →