← Nieuwste papers
💬 NLP

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

Dit paper introduceert Explore-on-Graph (EoG), een innovatief framework dat Large Language Models aanmoedigt om via versterkingstheorie met pad-gerefineerde beloningen autonoom diverse redeneringspaden op kennisgrafieken te verkennen, waardoor hallucinaties worden verminderd en state-of-the-art prestaties worden behaald op kennisgrafiek-vraagbeantwoordingsopgaven.

Oorspronkelijke auteurs: Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

Gepubliceerd 2026-02-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🗺️ De Grote Uitdaging: Verdwalen in de Kennisbibliotheek

Stel je voor dat een Kunstmatige Intelligentie (een Large Language Model of LLM) een enorme, onoverzichtelijke bibliotheek is vol met feiten. Als je deze AI een vraag stelt, probeert hij vaak het antwoord te "gissen" op basis van wat hij eerder heeft geleerd. Het probleem? Hij maakt vaak hallucinaties. Hij verzint feiten die niet bestaan, alsof hij een verhaal bedenkt in plaats van een waarheid te vinden.

Om dit op te lossen, geven we de AI een Kennisgrafiek (Knowledge Graph). Dit is als een gigantisch, digitaal stadsplan waar alle feiten (zoals "Google zit in Mountain View") als straten en kruispunten zijn aangelegd. De AI moet nu niet meer gissen, maar het juiste pad door dit stadsplan vinden om het antwoord te vinden.

🚧 Het Probleem met de Huidige Methoden: De "Vaste Route"

Tot nu toe volgden slimme AI's twee saaie strategieën om dit stadsplan te navigeren:

  1. De Regelboer: Ze volgden strikte regels. "Als je X ziet, ga dan altijd naar Y." Dit werkt goed voor bekende routes, maar als er een nieuw pad is dat ze nooit eerder hebben gezien, raken ze in de war.
  2. De Kloon: Ze keken naar voorbeelden van hoe anderen het deden en probeerden die na te bootsen. Dit is alsof je alleen maar de wegen rijdt die je al kent op je GPS.

Het grote probleem: Als de vraag een nieuw, onbekend pad vereist (bijvoorbeeld: "Wie is de collega van de baas van de dochteronderneming die in Londen woont?"), falen deze methoden. Ze durven niet af te wijken van hun vaste routes. Ze zijn te bang om het onbekende in te gaan.

🚀 De Oplossing: "Explore-on-Graph" (EoG)

De auteurs van dit paper hebben een nieuwe methode bedacht genaamd Explore-on-Graph (EoG). Ze vergelijken dit met het trainen van een avontuurlijke ontdekkingsreiziger in plaats van een blinde kloon.

De methode werkt in twee fases, net als het trainen van een hond of een kind:

Fase 1: De Lerenfase (Supervised Fine-Tuning)

Eerst leren we de AI de basis. We geven haar een boek met voorbeelden van hoe je logisch redeneert in dit stadsplan. We zeggen: "Kijk, als je deze vraag krijgt, ga dan eerst hierheen, dan daarheen, en zo kom je tot het antwoord."

  • Metafoor: Dit is als een schoolvak waar de leerlingen leren hoe ze een kaart moeten lezen en hoe ze logisch moeten denken. Ze krijgen een "lange denkketen" (Long Chain-of-Thought) om te oefenen.

Fase 2: De Ontdekkingsfase (Reinforcement Learning)

Dit is het echte geheim. Nu laten we de AI los in het stadsplan, maar we geven haar een beloningssysteem dat haar aanmoedigt om te verkenen.

  • De Beloning voor het Antwoord: Als de AI het juiste antwoord vindt, krijgt ze een punt.
  • De Nieuwe Beloning voor het Pad (Path-Refined Reward): Dit is de innovatie. De AI krijgt ook punten als ze een goed pad heeft bewandeld, zelfs als ze even afdwaalt. Ze krijgt een bonus als ze logische stappen zet die dicht bij de waarheid liggen, in plaats van zomaar rond te springen.

De Creatieve Analogie: De Schatzoeker
Stel je voor dat de AI een schatzoeker is in een donker bos (de Kennisgrafiek).

  • Oude methoden: De schatzoeker loopt alleen op de verlichte paden die hij al kent. Als de schat (het antwoord) net buiten dat pad ligt, vindt hij hem niet.
  • EoG: De schatzoeker krijgt een magische kompasnaald. Als hij een stap zet in de richting van de schat, krijgt hij een lichtje (een beloning). Als hij een stap zet die totaal in de verkeerde richting is, gaat het lichtje uit.
    • De nieuwe truc is dat de kompasnaald ook kijkt hoe hij loopt. Als hij een mooie, logische route door het bos vindt (zelfs als die route nieuw is), krijgt hij extra punten. Dit moedigt hem aan om nieuwe, spannende paden te ontdekken die niemand eerder heeft gelopen, in plaats van alleen maar de oude, veilige routes te volgen.

🏆 Wat is het Resultaat?

Door deze methode van "belonen voor het verkennen van nieuwe paden" te gebruiken, wordt de AI veel slimmer in het oplossen van complexe puzzels.

  • Ze raakt niet meer in de war bij moeilijke vragen die afwijken van het bekende.
  • Ze vindt antwoorden die zelfs de duurste, gesloten AI's (zoals GPT-5 of Gemini) soms missen.
  • Ze maakt minder fouten en "hallucineert" minder, omdat ze zich echt laat leiden door de feiten in de grafiek.

🎯 Conclusie in één zin

In plaats van de AI te dwingen om alleen de bekende wegen te bewandelen, geven we haar de vrijheid en de motivatie om het hele bos te verkennen, zolang ze maar logisch blijft nadenken onderweg. Hierdoor wordt ze de beste schatzoeker in de wereld van feiten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →