← 최신 논문
💬 NLP

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

이 논문은 여러 추론 롤아웃에 걸친 단계별 자기 일관성 점수를 기반으로 단계별 보상을 할당함으로써 대규모 언어 모델의 문맥 민감형 사실적 환각을 완화하고, 이를 통해 수학적 추론 및 환각 벤치마크에서 최첨단 성능을 달성하는 새로운 방법인 단계별 자기 일관성 그룹 상대적 정책 최적화(SSC-GRPO)를 소개한다.

원저자: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 창의적인 로봇에게 미스터리를 해결하는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 도서관에 있는 거의 모든 책을 읽었고 인간처럼 말할 수 있지만, 독특한 버릇이 하나 있습니다. 긴 이야기를 깊게 파고들다 보면 가끔 사실을 지어내기 시작한다는 점이죠. 분명히 증거는 정원사를 가리키고 있는데도, 로봇은 자신만만하게 "집사가 촛대로 범행을 저질렀습니다"라고 말할 수도 있습니다. 인공지능의 세계에서는 이를 '환각(hallucination)'이라고 부릅니다. 로봇이 의도적으로 거짓말을 하는 것이 아니라, 자신의 생각의 사슬이 너무 길어지면서 실제로 알고 있는 것조차 잊어버려 머릿속이 엉켜버리는 현상입니다.

오랫동안 과학자들은 이러한 실수가 단순히 로보가 답을 모르기 때문에 발생한다고 생각했습니다. 하지만 만약 로봇이 답을 알고 있음에도, 자신이 써 내려가는 이야기 때문에 혼란에 빠지는 것이라면 어떨까요? 이 논문이 다루는 퍼즐이 바로 이것입니다. 연구진은 AI 모델이 마치 탐정이 메모장에 단서를 적듯, 단계별로 어떻게 생각하는지를 조사하고 있습니다. 그들은 로봇이 지식이 부족해서가 아니라, 자신이 쓰고 있는 이야기의 맥락 때문에 진실을 잊어버려 스스로의 발에 걸려 넘어지는 경우가 많다는 것을 발견했습니다. 이를 해결하기 위해, 그들은 로봇에게 "잠깐, 이 문장이 내가 방금 쓴 다른 내용들과 말이 되는가?"라고 스스로 묻도록 가르치는 '자기 점검(self-check)' 시스템과 같은 새로운 훈련법을 발명했습니다.


문제점: 로봇의 "브레인 포그(Brain Fog)"

대규모 언어 모델(LLM)을 만나보세요. 인터넷 전체를 암기한 초스마트 앵무새라고 생각하면 됩니다. 당신이 어려운 수학 문제를 물어보면, 이 로봇은 단순히 답을 내뱉는 것이 아니라, 단계별로 추론 과정을 길게 적으며 문제를 "생각"하려고 노력합니다. 이는 복잡한 퍼즐을 푸는 데는 매우 유용하지만, 한 가지 결함이 있습니다. 사고의 과정이 길어질수록 로봇은 때때로 "맥락에 민감해지는(context-sensitive)" 현상을 보입니다.

당신이 머릿속으로 수학 문제를 풀고 있다고 상상해 보세요. 당신은 3×100=3003 \times 100 = 300이라는 것을 알고 있습니다. 그런데 갑에 숫자를 과일로 바꾸는 마법을 부리는 마법사에 대한 이야기를 쓰기 시작합니다. 갑자기 당신의 뇌가 혼란에 빠져, "그러므로 3×1003 \times 100은 확실히 바나나이다"라고 쓸 수도 있습니다. 당신은 그것이 300이라는 것을 알지만, 스스로에게 들려주는 우스꽝스러운 이야기가 당신을 헷갈리게 만든 것입니다.

연구진은 AI에게도 정확히 이런 일이 일어난다는 것을 발견했습니다. 그들은 이를 **맥락 민감적 사실 환각(Context-Sensitive Factual Hallucination)**이라고 부릅니다. 로봇의 뇌에는 올바른 사실이 저장되어 있지만, 긴 추론 과정의 "소음"이 로봇을 속여 실수를 유발하는 것입니다. 이는 마치 노래를 완벽하게 연주할 줄 아는 음악가가 관객의 소음에 정신이 팔려 엉뚱한 음을 내는 것과 같습니다.

발견: 지식의 공백이 아니다

이 문제를 밝혀내기 위해 팀은 탐정처럼 행동했습니다. 그들은 긴 추론 과정에서 실수를 저지른 로봇을 데려와 간단한 질문을 던졌습니다: "내가 그 틀린 문장 하나만 따로 떼어내서 그것에 대해 직접 물어본다면, 제대로 대답할 수 있겠니?"

결과는 거의 항상 **"예"**였습니다.

실수를 분리해냈을 때, 로봇은 "아, 당연하죠! 3×1003 \times 100은 바나나가 아니라 300입니다!"라고 답했습니다. 이는 로봇이 지식이 부족한 것이 아니라, 맥락 때문에 혼란을 겪고 있었다는 사실을 입증했습니다. 실제로 연구진의 분석에 따르면, 이러한 추론 모델들이 저지르는 실수의 거의 **70%**가 바로 이 특정 유형의 "브레인 포그", 즉 모델이 진실을 알고 있음에도 자신의 이야기에 휘말려 실수하는 경우였습니다.

해결책: "자기 일관성(Self-Consistency)" 코치

그렇다면 로봇이 자신의 이야기에 휘말리지 않도록 어떻게 가르칠 수 있을까요? 저자들은 SSC-GRPO(Step-Level Self-Consistency Group Relative Policy Optimization)라는 새로운 훈련법을 만들었습니다. 이름이 좀 길으니 게임 비유로 풀어보겠습니다.

당신이 8대의 로봇 팀이 동시에 같은 퍼즐을 풀도록 훈련시킨다고 상상해 보세요.

  1. 롤아웃(The Rollout): 각 로봇은 자신만의 단계별 해결책을 적습니다.
  2. 자기 점검(The Self-Check): 시스템은 단순히 최종 답이 맞는지 확인하는 대신, 로봇들에게 서로의 단계를 비교하도록 요청합니다. "로봇 A, 당신의 두 번째 단계가 로봇 B와 C가 쓴 내용과 일치합니까?"
  3. 보상(The Reward): 만약 로봇의 단계가 다른 로봇들이 말하는 것과 일치한다면(높은 일관성), 높은 점수를 받습니다. 만약 경로를 이탈하여 아무도 동의하지 않는 이상한 말을 한다면(낮은 일관성), 낮은 점수를 받습니다.

여기서 마법 같은 점은 로봇이 스스로의 판사가 된다는 것입니다. 로봇은 자신이 틀렸다고 말해줄 인간 교사나 사실 데이터베이스를 필요로 하지 않습니다. 그저 자신의 "동료들"(다른 버전의 자신들)을 보고 "어라, 나만 답이 바나나라고 하고 있네. 그럼 아마 틀렸을 거야"라고 깨닫기만 하면 됩니다.

시스템은 이 점수들을 사용하여 일관된 단계에는 "보상"을 주고, 환각이 발생한 단계에는 "벌칙"을 줍니다. 시간이 흐르면서 로봇은 집단 내에서 말이 되는 단계들을 신뢰하고, 단지 이야기에 맞추기 위해 사실을 지어내는 행동을 멈추게 됩니다.

결과: 더 똑똑하고 정직한 로봇들

연구팀은 이 새로운 방법을 사용 가능한 가장 어려운 수학 및 추론 과제들에 테스트했습니다. 그들은 Qwen3Llama3 같은 모델을 사용했습니다. 결과는 인상적이었습니다.

  • 더 나은 수학 능력: 표준 수학 테스트에서, 이 새로운 방법은 로봇이 이전보다 더 높은 점수를 받도록 도왔습니다. 예를 들어, 한 테스트에서 이 새로운 방법은 기존의 표준 훈련 방식보다 점수를 약 1.8% 향상시켰습니다.
  • 더 적은 환각: 가장 중요한 점은, "맥락 민감적" 실수가 훨씬 줄어들었다는 것입니다. 자신의 이야기에 의해 혼란을 겪는 횟수가 눈에 띄게 감소했습니다.
  • 외부 도움 불필요: 거대한 백과사전을 찾아봐야 하는(느리고 비용이 많이 드는) 다른 방식들과 달리, 이 방법은 로봇 자신의 뇌를 사용하여 스스로를 점검합니다.

연구진은 또한 훈련 과정 중에 흥미로운 점을 발견했습니다. 로봇이 학습함에 따라 "일관성"이 높아졌습니다. 로봇들은 점점 더 자기 자신과 일치되는 답변을 내놓기 시작했고, 혼란스럽고 지어낸 단계의 수는 줄어들었습니다. 이는 마치 산만하고 혼란스러워하던 학생이 집중력을 되찾고 자신감 넘치는 모습으로 변해가는 과정을 보는 것과 같았습니다.

이것이 왜 중요한가

이 논문은 AI의 가장 큰 문제 중 하나인 '틀리면서도 자신만만하게 말하는 경향'을 해결하는 새로운 방법을 제시합니다. 로봇이 답을 알고 있음에도 단지 이야기에 길을 잃는다는 점을 깨달음으로써, 저자들은 로봇이 궤도를 유지하도록 가르치는 방법을 찾아냈습니다.

그들은 단순히 추측한 것이 아니라 측정했습니다. 실수를 분리했을 때 지식이 존재한다는 것을 보여주었습니다. 또한 새로운 방법이 이러한 특정 유형의 오류를 줄인다는 것을 입증했습니다. 논문은 이 과정에서 약간 더 많은 컴퓨터 자원이 필요하다고 언급했지만(로봇이 여러 번 스스로를 체크해야 하기 때문), 신뢰할 수 있는 AI를 만들기 위한 기회비용으로서 충분히 가치가 있어 보입니다.

요약하자면, 저자들은 AI에게 새로운 도구, 즉 '거울'을 주었습니다. 이제 로봇은 단순히 다음 이야기를 향해 나아가는 것이 아니라, 뒤를 돌아보며 "이것이 내가 지금까지 말한 모든 내용과 일치하는가?"라고 스스로에게 묻는 법을 배웁니다. 그렇게 함으로써, 로봇은 사실을 지어내는 것을 멈추고 진실을 말하기 시작합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →