← Nieuwste papers
🤖 machine learning

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

Het artikel introduceert PIPE-Cypher, een geautomatiseerde pijplijn die live enterprise eigenschap-grafen en real-world gebruikersqueries transformeert naar uitvoerbare, diverse en gebalanceerde Text-to-Cypher benchmarks om herhaalbare en relevante evaluatie van grafische queriesystemen in de praktijk mogelijk te maken.

Oorspronkelijke auteurs: Suraj Ranganath, Anish Raghavendra

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Suraj Ranganath, Anish Raghavendra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je werkt voor een enorme bank of een complex logistiek bedrijf. Je bedrijf heeft een gigantische, levende kaart van data (een "property graph") die laat zien hoe geld beweegt, wie wie kent, en waar goederen reizen. Deze kaart is uniek voor jouw bedrijf; het gebruikt zijn eigen speciale namen, regels en geheime codes die niemand anders gebruikt.

Stel je nu voor dat je een slimme assistent wilt bouwen (een AI) waarmee werknemers vragen in gewone mensentaal kunnen stellen, zoals: "Laat me alle rekeningen zien die vorige week geld hebben overgemaakt naar een geblokkeerde gebruiker," en dat de AI automatisch de complexe computercode (genaamd Cypher) moet schrijven om dat antwoord te krijgen.

Het probleem? Je kunt deze AI niet testen op publieke, generieke kaarten. Het moet getest worden op jouw specifieke kaart, met jouw specifieke regels. Maar het bouwen van een test hiervoor is een nachtmerrie:

  1. De kaart verandert elke dag.
  2. De AI kan code schrijven die er goed uitziet, maar de verkeerde vraag stelt.
  3. Je kunt je geheime data niet naar een publieke AI-service sturen om de test te genereren.

PIPE-Cypher is de oplossing die de auteurs hebben gebouwd. Zie dit als een automatische "Testkeuken" die volledig binnen de beveiligde computers van jouw bedrijf leeft.

Hoe de "Testkeuken" werkt

In plaats van dat een mens duizenden testvragen schrijft, doet PIPE-Cypher het zware werk via een pipeline (een productielijn):

  1. De Kaartinspecteur (Schema Profiling):
    Eerst kijkt het systeem stilletjes naar de datakaart van jouw bedrijf. Het leert de namen van de nodes (zo zoals "Account" of "Persoon"), de wegen tussen hen (zoals "Transfers To") en de specifieke waarden die worden gebruikt (zoals "Credit Card" of "Blocked"). Het creëert een "menu" van wat mogelijk is.

  2. De Reverse Engineer (Reverse Grounding):
    Dit is het slimme gedeelte. In plaats van een vraag te raden en te hopen dat het antwoord bestaat, begint het systeem bij het antwoord. Het voert veilige, alleen-lezen-queries uit om echte datapunten te vinden die daadwerkelijk bestaan.
    Analogie: Stel je voor dat je een chef wilt testen. In plaats van te vragen om "een soep te maken" en te hopen dat hij ingrediënten heeft, controleer je eerst de voorraadkast om te zien of je wortelen en uien hebt. Daarna vraag je: "Maak een soep met wortelen en uien." Dit garandeert dat de vraag beantwoordbaar is.

  3. De Strikte Editor (Constrained Generation):
    Een lokale AI (die draait op je eigen servers, niet in de cloud) schrijft de Engelse vraag en de Cypher-code op basis van die echte ingrediënten. Maar de AI mag niet op gevaarlijke manieren creatief zijn. Het moet strikte regels volgen: "Lees alleen data, verwijder nooit data," "Gebruik exacte namen," en "Verzin geen wegen die niet bestaan."

  4. De Veiligheidsbewaker (Deterministic Validation):
    Voordat de test wordt geaccepteerd, controleert een niet-AI computerprogramma de code. Het werkt als een uitsmijter bij een club:

  • Is de code veilig? (Geen data verwijderen).
  • Gebruikt het echte namen? (Geen gefantaseerde termen).
  • Werkt het daadwerkelijk? (Als de code geen resultaten oplevert, wordt deze afgewezen).
  • Gaat het de juiste kant op? (In grafen is "A naar B" iets anders dan "B naar A").
  1. De Rechter (LLM Reviewer):
    Ten slotte fungeert een tweede lokale AI als rechter. Deze kijkt naar de vraag, de code en de daadwerkelijke resultaten. De AI vraagt zich af: "Beantwoordt deze code echt de vraag? Is het duidelijk?" Als de code wel draait maar het verkeerde antwoord geeft, wijst de rechter het af.

De Resultaten: Een "Levende" Benchmark

De auteurs gebruikten deze pipeline om een enorme testset van 3.000 vragen te maken met behulp van echte financiële en sociale netwerkdata.

  • Het is onderscheidend: Toen ze standaard AI-modellen op deze nieuwe benchmark testten, faalden de meeste spectaculair (ze kregen minder dan 4% van de antwoorden goed). Dit bewijst dat het feit dat een AI code kan schrijven die er correct uitziet, niet betekent dat de AI jouw specifieke datakaart begrijpt.
  • Het is verversbaar: Omdat de pipeline geautomatiseerd is, kun je, als jouw bedrijf volgende maand een nieuw type data toevoegt (zoals "Crypto Wallets"), de pipeline gewoon opnieuw draaien om direct nieuwe tests te genereren. Je hoeft niet te wachten tot een publieke dataset is bijgewerkt.
  • Het is privé: Alles vindt plaats op je eigen computers. Gegevens van gevoelige aard verlaten nooit je gebouw.

De Belangrijkste Conclusie

De paper betoogt dat voor enterprise AI, statische testsets dood zijn. Je kunt een systeem dat ontworpen is voor jouw unieke, veranderende bedrijf niet evalueren met een generieke, bevroren dataset.

PIPE-Cypher verandert het spel door benchmarkcreatie te veranderen in een herhaalbaar, geautomatiseerd fabrieks-proces. Het zorgt ervoor dat de tests:

  • Echt zijn: Gebaseerd op daadwerkelijke data die bestaat.
  • Veilig zijn: Gegarandeerd niet je database breken.
  • Eerlijk zijn: Strikt controleren of de AI het probleem daadwerkelijk oplost, en niet alleen of hij mooie code schrijft.

Kortom, PIPE-Cypher is een tool waarmee bedrijven hun eigen, hoogwaardige "rijtests" voor hun AI-assistenten kunnen bouwen, zodat zij er zeker van zijn dat ze de complexe, unieke wegen van de bedrijfsdata kunnen navigeren zonder te crashen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →