← 최신 논문
🤖 AI

MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop

이 논문은 실패한 샘플에 대한 풍부한 언어적 피드백을 학습 가능한 학습 신호로 변환함으로써 추론 능력을 향상시키고, 이를 통해 인도메인 및 아웃도메인 작업 모두에서 기존의 지도 학습 및 RLVR 베이스라인을 능가하는 멀티 턴 강화 학습 프레임워크인 MulFeRL을 소개한다.

원저자: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 MulFeRL 논문을 일상적인 언어와 창의적인 비유를 사용하여 설명한 내용입니다.

문제점: AI의 "침묵하는 실패 (Silent Failure)"

당신이 학생에게 복잡한 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 시험을 냈고, 학생은 답을 틀렸습니다.

표준적인 AI 학습 방식(RLVR)에서 선생님은 그저 **"틀렸어"**라고만 말합니다. 그게 끝입니다. 설명도, 힌트도 없이 그냥 0점을 줄 뿐입니다.

  • 문제점: 만약 학생이 100문제를 틀렸다면, 학생은 100번의 "틀렸음"이라는 점수를 받게 됩니다. 학생은 틀렸는지 전혀 알 수 없습니다. 숫자를 잘못 더한 걸까요? 문제를 오해한 걸까요? 아니면 단계를 건너뛴 걸까요?
  • 결과: AI는 정체됩니다. 피드백(학습 신호)이 너무 희소하고 도움이 되지 않기 때문에, AI는 계속해서 무작위로 추측만 반복하게 됩니다. 이는 마치 운전할 때 백미러를 보는 것을 잊었다는 말을 듣지 못한 채, 벽에 부딪힐 때마다 "충돌"이라는 말만 들으며 운전을 배우려는 것과 같습니다.

해결책: MulFeRL (클립보드를 든 코치)

연구진은 MulFeRL(Multi-turn Feedback-guided Reinforcement Learning)을 제안합니다. 이 시스템은 단순히 "틀렸어"라고 말하는 대신, 구체적이고 구두적인 조언을 건네는 엄격하지만 도움이 되는 코치처럼 행동합니다.

작동 방식은 다음과 같습니다.

1. "모두가 실패한" 함정 (The "All-Failed" Trap)

보통 AI가 어려운 문제를 풀려고 시도하다가 실패하면, 거기서 멈춰버립니다. "나쁜" 답과 비교할 "좋은" 답이 없기 때문에 학습 루프가 깨지는 것입니다.

  • MulFeRL의 전략: AI가 완전히 실패했을 때, 시스템은 포기하지 않습니다. 대신 잠시 멈추고 "피드백 제공자"(똑똑한 인간이나 더 강력한 AI)에게 이 엉망인 상황을 살펴봐 달라고 요청합니다.

2. "구두 피드백" (코치의 메모)

피드백 제공자는 단순히 "틀렸어"라고 하지 않습니다. 대신 다음과 같이 적습니다:

  • "피타고라스 정리를 사용하려고 했지만, 숫자를 먼저 제곱하는 것을 잊었습니다."
  • "3단계에서 마이너스(-) 부호를 놓쳤습니다."
    이것이 바로 **구두 피드백(Verbal Feedback)**입니다. 모호한 실패를 구체적인 교훈으로 바꿔줍니다.

3. "재생성" (다시 하기)

이제 AI에게 두 번째 기회가 주어집니다. AI는 원래의 문제와 코치의 메모를 함께 가지고 다시 문제를 풉니다.

  • 마법 같은 일: 만약 AI가 메모를 올바르게 사용한다면, 마침내 정답을 맞힐 수 있습니다.
  • 공로 인정: 이제 시스템은 다음과 같이 알게 됩니다: "아! 우리가 숫자를 제곱해야 한다는 구체적인 메모를 주었더니, AI가 성공했구나." 이 과정을 통해 "실패"는 학습할 수 있는 "성공"으로 변모합니다.

4. 두 가지 학습 방식 (성적표)

논문은 이 새로운 과정을 평가하는 두 가지 구체적인 방법을 소개합니다.

  • 시나리오 A: "섞여 있는 결과" (GRPO)
    때로는 메모를 받은 후에도 AI가 8번 시도하는 동안, 어떤 시도는 여전히 틀리고 어떤 시도는 맞기도 합니다.

    • 비유: 이는 일부 선수는 실수했지만 다른 선수들은 훌륭하게 경기를 치른 스포츠 팀과 같습니다. 코치는 "잘해낸 선수들을 보고, 그들의 움직임을 따라 하라"고 말할 수 있습니다. AI는 자신의 잘된 시도를 자신의 잘못된 시도와 비교하며 학습합니다.
  • 시나리오 B: "완벽한 반전" (FCO)
    때로는 메모가 너무 훌륭해서 8번의 시도가 모두 정답이 되기도 합니다.

    • 비유: 팀 전체가 갑자기 완벽하게 경기를 펼치는 것과 같습니다. 표준적인 학습에서는 "나쁜" 예시가 없기 때문에 이것이 혼란을 줄 수 있습니다.
    • MulFeRL의 기술: 이 시스템은 전과 후를 비교합니다. "전(Before)"(모두가 실패했던 상태)과 "후(After)"(모두가 성공한 상태)를 비교합니다. 그리고 AI에게 이렇게 말합니다: "이전에 어떻게 실패했는지 기억해 봐? 그리고 메모를 받은 후 어떻게 성공했는지 기억해 봐? '후'의 버전을 더 많이 해라." 이것을 **피드백-대조 최적화(Feedback-Contrastive Optimization, FCO)**라고 부릅니다.

5. "고정된 슬롯" (포스트잇)

AI가 실제로 메모를 읽도록 만들기 위해, MulFeRL은 피드백을 페이지 하단에 붙여넣는 대신, 사고 과정 중간에 고정된 특별한 상자(<feedback> 태그) 안에 넣습니다.

  • 비 by 유: 이는 학생이 일주일 뒤에 받는 성적표를 읽는 것이 아니라, 계산기에 "부호를 확인하세요!"라고 적힌 포스트잇을 붙여 놓는 것과 같습니다. 이를 통해 AI가 작업하는 동안 피드백을 반드시 보도록 강제합니다.

이것이 왜 중요한가

이 논문은 이 "클립보드를 든 코치" 접근 방식을 통해 다음과 같은 성과를 보여줍니다:

  1. "침묵하는 실패" 문제를 해결합니다: AI가 처음에 모든 것을 틀렸을 때도 학습할 수 있는 방법을 찾아냅니다.
  2. 더 빠르게 학습합니다: AI는 단순히 점수만 받는 것이 아니라, 실수를 어떻게 고쳐야 하는지에 대한 구체적인 지침을 받기 때문에 더 빠르게 향상됩니다.
  3. 새로운 분야에도 적용됩니다: 수학 문제로 훈련되었음에도 불구하고 과학 및 일반 추론 과제에서도 성능이 좋아졌습니다. 이는 AI가 단순히 수학 답을 암기한 것이 아니라, 더 나은 사고 방식을 배웠음을 증명합니다.

요약

MulFeRL은 AI가 실패했을 때 정체되는 것을 막아주는 방법입니다. 실패한 시도를 무시하는 대신, 구두 피드백을 사용하여 AI가 다시 시도하도록 유도합니다. 그런 다음 AI가 정답을 맞혔는지뿐만 아니라, 피드백을 바탕으로 얼마나 개선되었는지를 보고 보상합니다. 이는 "나는 실패했다"를 "이렇게 고쳤다"로 바꾸어, 학습 과정을 훨씬 더 풍부하고 효과적으로 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →