← 최신 논문
🤖 machine learning

Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance

이 논문은 결과값(정답 여부)만으로도 은닉 상태(hidden state)의 분포 차이를 이용해 추론 과정의 오류 지점을 찾아낼 수 있음을 증명하고, 이를 통해 GRPO의 토큰별 보상 할당을 정교화하는 SHEAR 방법론을 제안하여 수학 및 코드 생성 성능을 향상시켰습니다.

원저자: Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weijie Yu

게시일 2026-04-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weijie Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 현재의 문제점: "결과만 보고 혼내는 선생님" (GRPO의 한계)

지금까지 AI를 학습시키는 방식(GRPO라고 부릅니다)은 마치 결과만 보고 점수를 매기는 아주 엄격한 선생님과 같습니다.

학생이 수학 문제를 풀 때, 처음에는 아주 논리적으로 잘 풀다가 마지막 계산에서 딱 한 번 실수해서 틀렸다고 해봅시다. 기존의 선생님은 학생이 쓴 풀이 전체를 보고 **"틀렸으니까 이 문제 전체는 0점이야!"**라고 말하며, 문제 앞부분의 완벽했던 논리까지도 "너 이거 다 틀렸어!"라며 혼냅니다.

이렇게 되면 학생은 "내가 어디서부터 잘못된 건지" 알 수 없고, 잘했던 부분까지 억지로 고치려다 오히려 실력이 엉망이 될 수 있습니다.

2. 이 논문의 아이디어: "학생의 '눈빛'을 읽는 관찰자" (SHEAR)

이 논문의 저자들은 아주 기발한 생각을 했습니다. "선생님이 일일이 풀이 과정을 검사하기 힘들다면, 학생이 문제를 풀 때 변하는 '눈빛(Hidden States)'을 관찰하면 어떨까?" 하는 것이죠.

여기서 **'눈빛(Hidden States)'**이란 AI 모델 내부에서 정보가 처리되는 상태를 말합니다.

  • 잘 풀고 있을 때의 눈빛: 확신에 차 있고, 논리가 일관되며, 눈빛이 반짝반짝합니다. (데이터 분포가 안정적임)
  • 실수하기 시작할 때의 눈빛: 당황하기 시작하고, 논리가 꼬이며, 눈빛이 흔들립니다. (데이터 분포가 갑자기 변함)

저자들은 AI의 내부 상태(눈빛)를 수학적인 방법(Wasserstein Distance, 두 집단 사이의 거리 측정법)으로 분석했더니, 실수가 발생하는 지점에서 눈빛이 급격하게 변한다는 사실을 발견했습니다.

3. 해결책: "눈빛이 흔들릴 때만 집중 교정하기" (SHEAR 방식)

이제 이 '눈빛 변화'를 이용해 학습 방식을 바꿉니다. 이것이 바로 SHEAR라는 방법입니다.

  1. 관찰: AI가 문제를 풀 때, 내부 상태(눈빛)가 정답을 맞힌 그룹과 틀린 그룹 사이에서 얼마나 차이가 나는지 실시간으로 체크합니다.
  2. 판단: "오, 이 부분부터는 정답을 맞힌 애들의 눈빛과 틀린 애들의 눈빛이 완전히 달라지는데? 여기서 사고가 터졌구나!"라고 판단합니다.
  3. 교정:
    • 잘못된 부분: 눈빛이 확 변하며 틀린 길로 들어선 부분에는 **"여기서부터 잘못됐어! 집중해서 고쳐!"**라며 강한 피드백을 줍니다.
    • 잘한 부분: 눈빛이 안정적이고 정답 그룹과 비슷하다면 **"이 부분은 아주 잘했어, 그대로 가!"**라며 가벼운 피드백만 줍니다.

4. 결과: "스스로 오답 노트를 쓰는 천재 학생"

이 방식을 적용했더니 놀라운 결과가 나왔습니다.

  • 추가 비용 없음: 사람이 일일이 "몇 번째 줄이 틀렸어"라고 알려줄 필요가 없습니다. AI가 자기 자신의 '눈빛'을 보고 스스로 어디가 틀렸는지 찾아내기 때문입니다. (Self-supervised)
  • 성적 향상: 수학 문제 풀이와 코딩 능력에서 기존 방식보다 훨씬 높은 점수를 기록했습니다. 특히 복잡하고 긴 풀이가 필요한 문제에서 실력이 압도적으로 좋아졌습니다.

요약하자면!

이 논문은 **"AI가 문제를 풀 때 발생하는 내부적인 '당황함(데이터 분포의 변화)'을 포착하여, 틀린 지점만 콕 집어 집중 학습시키는 기술"**에 관한 것입니다. 덕분에 AI는 마치 스스로 오답 노트를 정교하게 작성하는 학생처럼, 훨씬 효율적이고 똑똑하게 성장할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →