← 최신 논문
🤖 AI

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

이 논문은 최종 답변의 정확성과 귀추적 보상을 결합하여 대규모 언어 모델의 일반적인 귀추적 추론 능력을 향상시키는 프로세스 인지 강화 학습 프레임워크인 CEDAR-GRPO를 소개하며, 이는 베이스 모델 및 정확도 전용 학습과 비교하여 11개의 미학습 태스크 전반에서 상당한 성능 향상을 달성했습니다.

원저자: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이라는 광활한 풍경 속에서, 연구자들은 단순히 문장에서 다음 단어를 예측하는 법이 아니라 기계가 인간처럼 생각하는 법을 가르치기 위해 끊임없이 노력하고 있습니다. 인간적인 사고 방식 중 하나는 '가추법(abductive reasoning)'이라 불리는 것입니다. 이는 일련의 단서나 관찰 내용을 보고, 그것들에 대한 가장 가능성 높은 설명을 찾기 위해 역으로 추론해 나가는 정신적 과정입니다. 의사가 몇 가지 증상을 바탕으로 환자의 상태를 파악하는 방식, 탐정이 흩어진 증거로부터 범죄를 재구성하는 방식, 또는 엔지니어가 갑자기 작동을 멈춘 기계를 진단하는 방식이 바로 이와 같습니다. 오랫동안 과학자들은 대규모 언어 모델이 이를 잘 수행하도록 만드는 데 어려움을 겪어 왔습니다. 이러한 모델들은 사실을 회상하거나 엄격한 논리 규칙을 따르는 데는 뛰어나지만, 불완전한 정보로부터 숨겨진 원인을 추론해야 할 때는 종종 실수를 저지릅니다. 그들은 틀린 이유로 정답을 맞히거나, 그럴듯하게 들리지만 실제로는 제공된 증거와 부합하지 않는 사실을 지어내곤 합니다.

샤리프 공과대학교(Shariff University of Technology)와 테헤란 대학교의 연구팀은 이 문제를 해결하기 위해 나섰습니다. 그들은 AI 모델이 단순히 훈련받은 특정 퍼즐을 암기하는 것이 아니라, 새롭고 보지 못한 문제를 해결하는 데 도움이 되는 방식으로 가추적 추론 능력을 향상시킬 수 있는지 알고 싶었습니다. 그들은 CEDAR-GRPO라고 불리는 새로운 훈련 방법을 개발했습니다. 단순히 모델이 최종 정답을 맞혔을 때 보상을 주는 대신, 그 정답에 도달하는 과정에 대해서도 보상을 주는 시스템을 설계했습니다. 이 시스템은 모델의 사고 과정에 대해 두 가지 구체적인 사항을 점검합니다. 첫째, 모델이 제공된 모든 세부 사항을 실제로 살펴보고 설명했는지, 둘-째, 모델이 결론에서 시작하여 증거를 결론에 끼워 맞추는 것이 아니라, 관찰에서 시작하여 결론을 향해 올바른 방향으로 추론을 진행했는지 여부입니다.

이를 테스트하기 위해 연구진은 네 가지 서로 다른 오픈 소스 언어 모델을 가져와 정교하게 혼합된 과업들로 훈련시켰습니다. 이 과업들에는 짧은 이야기에서 최선의 설명을 선택하는 것부터 데이터의 패턴을 설명하는 코드를 작성하는 것까지 포함되었습니다. 결정적으로, 그들은 모델에게 단순히 정답만을 보여준 것이 아니라, 모델의 추론 단계에 피드백을 주는 코치 역할을 하는 강화 학습 기법을 사용했습니다. 모델들은 핵심적인 세부 사항을 놓쳤거나 논리가 거꾸로 된 경우, 정답을 맞히는 것만으로는 충분하지 않다는 것을 배웠습니다. 이 훈련 후에 연구진은 모델들이 한 번도 본 적 없는 11가지의 완전히 다른 과업들로 모델을 테스트했습니다. 이 새로운 과업들은 의료 상태 진단부터 컴퓨터 코드 디버깅, 복잡한 미스터리 해결, 그리고 길고 복잡한 이야기 이해에 이르기까지 다양했습니다.

결과는 전반적으로 뚜렷한 개선을 보여주었습니다. 이 새로운 방법으로 훈련된 모델들은 원래의 버전뿐만 아니라 정답만을 맞히도록 훈련된 모델들보다도 더 우수한 성능을 보였습니다. 평균적으로 새로운 방법은 기존 모델보다 7.4 퍼센트 포인트, 정답만을 추구하도록 훈련된 모델보다 2.7 퍼센트 포인트 더 높은 성능 향상을 보였습니다. 일부 특정 사례에서는 개선 폭이 무려 30.8 퍼센트 포인트에 달하기도 했습니다. 더 중요한 것은, 연구진이 모델이 생각하는 동안 작성한 실제 텍스트를 분석했다는 점입니다. 그들은 훈련된 모델들이 더 신중한 조사관처럼 행동하고 있다는 것을 발견했습니다. 모델들은 정답을 결정하기 전에 다양한 가능성을 탐색하고, 잘못된 아이디어를 명시적으로 배제하며, 불확정적인 상황에서 모호함을 인정하는 경향이 더 강해졌습니다. 또한 그들은 막연한 가정에 의존하기보다 자신들의 결론을 주어진 구체적인 사실들과 직접 연결하는 훨씬 강력한 습관을 보여주었습니다.

또한 연구진은 이러한 성공에 대한 몇 가지 대안적인 설명들을 배제했습니다. 연구진은 이러한 개선이 단순히 모델이 더 많은 예시를 보았기 때문이거나 일반적인 추론 능력의 향상 때문이 아님을 입증했습니다. 가추적 과업에 집중하지 않은 유사한 양의 일반 추론 데이터를 사용하여 모델을 훈련시켰을 때, 모델들은 특정 테스트에서 동일한 수준의 향상을 보이지 않았습니다. 이는 모델의 추론 과정에 대해 보상을 주는 특정한 방식이 핵심 요인이었음을 시사합니다. 이 연구 결과는 가추적 추론이 특정 유형의 퍼즐에만 작동하는 좁은 기술이 아니라, 다양한 분야로 전이될 수 있는 일반적인 기술으로서 강화될 수 있음을 나타냅니다. 모델에게 증거를 존중하고 관찰에서 설명으로 이어지는 논리적 경로를 따르도록 가르침으로써, 연구진은 주변 세계를 진정으로 이해하고 설명할 수 있는 인공지능을 만드는 데 있어 중요한 발걸음을 내디뎠습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →