← 최신 논문
💬 NLP

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

이 논문은 지식 그래프 기반 질문 응답에서 LLM 의 환각을 줄이고 일반화 성능을 향상시키기 위해, 강화 학습과 경로 정제 보상 모델을 통해 LLM 이 자율적으로 다양한 추론 경로를 탐색하도록 유도하는 'Explore-on-Graph(EoG)' 프레임워크를 제안하고, 이를 통해 여러 벤치마크에서 최첨단 성능을 달성했음을 보여줍니다.

원저자: Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

게시일 2026-02-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🗺️ 지식 지도 탐험가: "EoG"가 어떻게 AI를 똑똑하게 만드는가?

이 논문은 **"지식 그래프 (Knowledge Graph)"**라는 거대한 지도 위에서 **대형 언어 모델 (LLM, AI)**이 어떻게 더 똑똑하게 추론할 수 있는지 설명하는 연구입니다.

기존의 AI들은 종종 **"망상 (Hallucination)"**이라는 병에 걸려, 사실과 다른 엉뚱한 답을 내놓곤 했습니다. 이 문제를 해결하기 위해 연구팀은 AI에게 **"자신만의 탐험가 정신"**을 심어주는 새로운 방법, **EoG (Explore-on-Graph)**를 제안했습니다.


🧩 1. 문제: AI는 왜 '정해진 길'만 걷나요?

기존의 AI 추론 방식은 두 가지 큰 단점이 있었습니다.

  • 규칙 따르기 (Rule-based): "A 에서 B 로 가면 C 가 나온다"는 정해진 규칙만 따르게 했습니다. 마치 유치원생이 선생님이 그린 선만 따라 그리는 그림과 같습니다.
  • 모방하기 (Imitation-based): 다른 AI 가 잘한 답을 보고 따라 하는 것입니다. 마치 유명한 요리사의 레시피를 그대로 복사하는 것과 비슷합니다.

🚨 문제점:
세상은 복잡합니다. 질문이 "구글 직원이 런던에 사는 사람은 누구인가?"일 때, 보통은 "직접적인 고용 관계"로 답하지만, 가끔은 **"동료 (Colleague)"**나 **"자회사 (Subsidiary)"**를 통해 연결된 길을 찾아야 할 때도 있습니다.
기존 AI 는 배운 적 없는 (Out-of-Distribution) 새로운 길이나 복잡한 연결고리를 만나면 당황해서 엉뚱한 답을 내놓거나, 아예 길을 잃어버립니다.


🚀 2. 해결책: EoG (지식 위 탐험)

연구팀은 AI 에게 **"정해진 길만 걷지 말고, 지도를 직접 탐험해 보라!"**고 가르쳤습니다. 이를 위해 두 단계의 훈련을 시켰습니다.

📚 1 단계: 기초 체력 다지기 (SFT - 지도 읽기 연습)

먼저 AI 에게 정답이 있는 예제를 보여주며 "지식 지도를 어떻게 읽고, 논리적으로 생각해야 하는지"를 가르쳤습니다.

  • 비유: 마치 등산 학교에서 지도 보는 법과 등산로 기본 규칙을 배우는 단계입니다.

⚡ 2 단계: 자율 탐험과 보상 (RL - 실전 훈련)

이제 AI 를 혼자서 탐험하게 합니다. 이때 중요한 것은 **'보상 시스템 (Reward)'**입니다.

  • 기존 방식: "정답을 맞췄으면 점수 줌" (결과만 봄).
  • EoG 의 방식: "정답을 맞췄을 뿐만 아니라, **어떻게 그 길을 찾았는지 (경로)**도 점수에 반영함".

✨ 핵심 아이디어: "경로 정제 보상 (Path-Refined Reward)"
AI 가 엉뚱한 길로 돌아다니면 점수를 깎고, **올바른 논리적 연결고리 (예: A→B→C)**를 따라갔다면 보너스 점수를 줍니다.

  • 비유: 등산객이 **정답인 정상 (정답)**에 도달하는 것도 중요하지만, **올바른 등산로 (논리적 경로)**를 따라 올라갔을 때 더 큰 상금을 주는 것과 같습니다. 이렇게 하면 AI 는 헛걸음 (무의미한 탐험) 을 줄이고, 효율적이고 의미 있는 탐험을 하게 됩니다.

🏆 3. 결과: 왜 EoG 가 특별한가요?

이 방법을 적용한 AI 는 놀라운 성과를 냈습니다.

  1. 새로운 길 발견: 기존에 배운 적이 없는 복잡한 질문 (예: "일본에서 수입하는 국가는?"인데 중간에 숨은 연결고리가 있는 경우) 도 스스로 찾아냈습니다.
  2. 타고난 능력: 오픈소스 모델 (Qwen, Llama 등) 이지만, 구글의 GeminiOpenAI 의 GPT-5 같은 거대 상용 모델보다 더 좋은 성적을 냈습니다.
  3. 효율성: 엉뚱한 길을 헤매는 시간을 줄이고, 정답에 도달하는 데 필요한 노력을 최소화했습니다.

💡 4. 한 줄 요약 (비유로 정리)

기존 AI: "선생님이 알려준 길 (레시피) 만 따라가서, 새로운 길은 못 찾는다."

EoG (우리 방법): "지도는 주었지만, 정답을 찾으면 상금도 주되, 올바른 길을 걸었는지도 심사한다."

결과: AI 는 이제 스스로 새로운 길을 개척하는 탐험가가 되어, 복잡한 질문에도 정확하고 논리적인 답을 찾아냅니다.

이 연구는 AI 가 단순히 지식을 암기하는 것을 넘어, 지식 그래프 위에서 스스로 생각하고 탐험하는 능력을 키우는 새로운 기준을 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →