Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning
यह शोध पत्र Search-on-Graph-R1 को प्रस्तुत करता है, जो एक 8B-पैरामीटर वाला मॉडल है जो सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से ग्राफ नेविगेशन को आंतरिक रूप से आत्मसात करके नॉलेज ग्राफ क्वेश्चन आंसरिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है, और बिना किसी सहायक मॉड्यूल या इन्फरेंस के दौरान LLM जज की आवश्यकता के बड़े फ्रंटियर LLMs से बेहतर प्रदर्शन करता है।