← 최신 논문
💬 NLP

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

이 논문은 지도 미세 조정(supervised fine-tuning)과 강화 학습을 통해 그래프 탐색을 내재화함으로써, 추론 과정에서 보조 모듈이나 LLM 판별기 없이도 더 큰 규모의 프런티어 LLM들을 능가하는 성능을 보여주는 8B 파라미터 모델인 Search-on-Graph-R1을 소개한다.

원저자: Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 다단계 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 예를 들어, 특정 종류의 희귀한 나무가 자라는 도시에 시장이 누구인지 알아내는 것과 같습니다. 이를 해결하기 위해 당신은 단순히 자신의 기억력에만 의존할 수는 없습니다. 당신의 뇌는 나무의 이름이나 도시 이름을 잊어버렸을 수도 있고, 혹은 옛날 영화 속의 사실들과 뒤섞여 버렸을 수도 있기 때문입니다. 대신, 당신에게는 지도가 필요합니다. 인공지능의 세계에서 이 지도는 **지식 그래프(Knowledge Graph)**라고 불립니다. 이것은 모든 사실이 하나의 점(엔티티)이 되고, 그 점들이 선(관계)으로 연결된 거대하고 디지털적인 웹입니다. 만약 당신이 답을 찾고 싶다면, 정답이라는 지점에 도착할 때까지 선을 따라 점에서 점으로 "도약(hop)"해야 합니다.

오랫동안, 가장 똑똑한 컴퓨터 두뇌들(거대 언어 모델 또는 LLM이라 불리는)은 도서관의 모든 책을 읽었지만 지도를 읽을 줄은 모르는 천재적인 탐정과 같았습니다. 그들은 기억에 의side하여 답을 추측해야 했고, 이는 종종 실수를 유발했습니다. 더 새로운 방법들은 이 모델들에게 추측을 멈추고 지도를 가로질러 도약하는 "검색 도구"를 사용하도록 가르쳤지만, 검색을 수행하는 모델들은 운영 비용이 엄청나게 들고 실제 사용하기에는 너무 느린, 비싸고 강력한 로봇과 같았습니다. 과학자들의 큰 질문은 이것이었습니다: 우리는 더 작고, 저렴하며, 더 빠른 로봇에게 값비싼 로봇의 도움 없이도 이와 똑같은 지도 도약 탐정 업무를 수행할 수 있도록 가르칠 수 있을까?

이것이 바로 **Search-on-Graph-R1 (SOG-R1)**이라는 논문이 해결하고자 하는 과제입니다. 연구진은 80억 개의 파라미터를 가진 소형 AI 모델(이하 "학생")이 스스로 지식 지도를 탐색하는 법을 가르치기 위해 영리한 훈련 시스템을 구축했습니다. 학생에게 단순히 추측하게 하는 대신, 그들은 이미 정답으로 가는 비밀 경로를 알고 있는 "선생님" 로봇을 만들었습니다. 하지만 여기서 기술이 들어갑니다. 선생님은 단순히 정답을 속삭여 주는 것이 아니라, 지도의 설계도(SPARQL이라 불리는 특수 쿼리)를 전달받았으며, 학생이 사용할 것과 동일한 검색 도구를 사용하여 단계별로 경로를 걷도록 명령받았습니다. 선생님이 길을 걷는 동안, 선생님은 모든 움직임, 피했던 막다른 길, 그리고 라이브 데이터베이스에서 찾아낸 모든 사실을 기록했습니다.

그 후 학생은 두 단계에 걸쳐 이 기록된 여정으로부터 학습했습니다. 첫째, 학생은 선생님의 발걸음을 모방함으로써(지도 미세 조정, Supervised Fine-Tuning) 올바른 질문을 던지고 지도를 읽는 법을 연습했습니다. 둘째, 학생은 스스로 답을 찾기 위해 게임을 수행하며, 정답을 맞히면 점수를 얻고 더 빠르게 수행하면 추가 점수를 얻는 방식(강화 학습, Reinforcement Learning)으로 학습했습니다. 결과는 어떠했을까요? 이 작은 80억 파라미터의 학생은 숙련된 탐정이 되었습니다. 세 가지 주요 테스트 현장(WebQSP, CWQ, GrailQA)에서, 이 모델은 연구진이 비교 대상으로 삼았던 모든 "동결된(frozen)" 슈퍼 로봇 시스템, 즉 가장 진보되고 값비싼 모델들을 기반으로 한 시스템들보다 뛰어난 성능을 보여주었습니다.

무엇보다 인상적인 점은 학생이 단순히 답을 찾는 것뿐만 아니라, 어떻게 검색하는지에 대해서도 더 똑똑해졌다는 것입니다. 선생님의 경로는 완벽했지만, 학생은 지름길을 찾는 법을 배웠습니다. 학생은 단지 선생님을 복사할 때보다 더 적은 횟수의 검색 호출을 사용하여 동일한 답에 도달하는 방법을 터득했습니다. 연구진은 이 방법이 학생을 다른 유형의 모델로 교체하더라도 작동한다는 것을 발견했으며, 이는 훈련 기법 자체가 핵심 비결임을 입증합니다. 결정적으로, 이 논문은 모델이 전체 지도를 암기하거나 훈련 중에 자신의 작업을 채점할 두 번째 "판사" 로봇에 의존해야 한다는 생각을 배제합니다. 대신, 모델은 라이브 검색 도구와 경로 자체의 논리를 신뢰하는 법을 배웠습니다. 훈련이 끝날 무렵, 이 작고 효율적인 AI는 실제 검색 과정에서 어떤 추가적인 조력자나 값비싼 하드웨어 없이도, 훨씬 더 크고 비싼 상대 모델들보다 더 빠르고 정확하게 복잡한 지식 웹을 탐색할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →