← Nieuwste papers
💻 computer science

Semantic Tracing in LLM-Based Multi-Agent Systems Using LangChain, LangGraph, and LangSmith for AI Governance

Dit artikel presenteert een semantisch sporend kader voor op LLM gebaseerde multi-agent systemen met gebruik van LangChain, LangGraph en LangSmith binnen de SHADOWAI-RISK prototype, waarmee wordt aangetoond dat het integreren van semantische evaluatie de semantische drift en schendingen van beperkingen aanzienlijk vermindert, terwijl er slechts een matige toename in latentie en nul lokale kosten optreden.

Oorspronkelijke auteurs: Audrey Rahimi

Gepubliceerd 2026-07-28
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Audrey Rahimi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Semantische Tracing in LLM-gebaseerde Multi-Agent Systemen

Probleemstelling
Organisaties die de overstap maken naar Large Language Model (LLM)-gebaseerde multi-agent systemen worden geconfronteerd met aanzienlijke governance-uitdagingen, waaronder "Shadow AI", hallucinatie-propagatie, instructie-drift en een gebrek aan inzicht in hoe beslissingen tot stand komen. Hoewel observabiliteitsplatforms zoals LangSmith executie-traces vastleggen, meten zij niet inherent of agenten de semantische betekenis, restricties en bewijslast-verplichtingen van hun oorspronkelijke instructies hebben behouden tijdens de overdracht van agent naar agent. Huidige frameworks missen een geïntegreerde methode om "behoud van betekenis" te behandelen als een primaire meetbare grootheid en deze metingen te koppelen aan enterprise AI-governance-controles (bijv. NIST AI RMF, EU AI Act).

Methodologie
De studie maakt gebruik van een mixed-methods benadering gecentreerd rond een lokale experimentele uitbreiding van de SHADOWAI-RISK prototype, een academisch onderzoeksinstrument voor enterprise AI-governance en risico-intelligentie. De methodologie maakt onderscheid tussen de oorspronkelijke deterministische baseline en een nieuwe experimentele conditie:

  1. Experimentele Architectuur:

    • Orkestratie: Geïmplementeerd met behulp van LangGraph (StateGraph) om stateful nodes (Inventaris, Bewijs, Governance, Menselijke Review) en conditionele routering te beheren, inclusclusief verplichte menselijke review-gates.
    • Redenering & Tools: Geïmplementeerd met behulp van LangChain (ChatOpenAI, ChatPromptTemplate, JsonOutputParser) voor genuante LLM-invocaties, tool-wrapping (bijv. NVD CVE lookup) en gestructureerde output-parsing met retry-mechanismen.
    • Observabiliteit: LangSmith wordt strikt gebruikt voor private tracing, span-capture en metadata-logging. Het berekent geen semantische metrieken en neemt geen governance-beslissingen.
    • Semantische Evaluatie: Een aparte, regelgebaseerde laag vergelijkt handoff-pakketten om drift, het weglaten van restricties en ononderbouwde claims te detecteren.
  2. Handoff-mechanisme:

    • Agents wisselen gestructureerde Handoff Packets (Pydantic-gevalideerd) uit die doel-identificatoren, restrictie-sets, bronnen van bewijs, betrouwbaarheidsniveaus en residu-risico bevatten.
    • Deze pakketten dienen als de eenheid van analyse voor het meten van semantische getrouwheid.
  3. Experimenteel Ontwerp:

    • Een gecontroleerde matrix van 450 workflow-executies werd voltooid (0 terminale fouten).
    • Condities:
      • Deterministische Baseline (behouden van het originele prototype).
      • LLM Multi-Agent zonder Semantische Evaluatie (160 runs).
      • LLM Multi-Agent met LangSmith Tracing + Semantische Evaluatie (160 runs).
      • Variabiliteits- en ablatie-studies (140 runs).
    • Metrieken: Een formeel pakket werd gedefinieerd, inclusief Semantic Preservation Score (SPS), Agent Handoff Fidelity (AHF), Instruction Drift Rate (IDR), Trace Completeness Score (TCS), Tool-Use Accuracy (TUA), Governance Compliance Rate (GCR), Hallucination Propagation Rate (HPR) en Workflow Reliability Score (WRS).

Belangrijkste Bijdragen
Het artikel draagt acht specifieke elementen bij, waarbij onderscheid wordt gemaakt tussen geïmplementeerde functies en voorgestelde architecturen:

  • C1: Een conceptueel construct voor semantische tracing en een handoff-packet representatie.
  • C2: Een LangSmith-gecentreerde observabiliteits-pipeline en een formeel pakket aan metrieken (waarbij opmerking wordt gemaakt dat menselijke kalibratie nog uitstaat).
  • C3: Een werkend lokaal prototype met vier agent-rollen en een Human Review Gate.
  • C4–C5: Genuine implementatie van LangChain LLM-invocatie en LangGraph-orkestratie met stateful routering.
  • C6: Een expliciete scheiding tussen orkestratie, redenering, deterministische waarborgen, trace-capture, semantische evaluatie en menselijke besluitvorming.
  • C7: Een baseline-versus-experimentele vergelijking tegenover het ongewijzigde SHADOWAI-RISK prototype.
  • C8: Een interpretatieve mapping van semantische-tracing-signalen naar governance-controles (NIST, ISACA, EU, etc.).

Resultaten
De voltooide experimentele matrix (450/450 runs) leverde de volgende vergelijkende bevindingen op tussen de LLM-conditie met semantische evaluatie en de LLM-conditie zonder:

  • Trace Completeness (TCS): Significant lager in de evaluatie-geactiveerde conditie (0.624 vs. 0.912; Holm-gecorrigeerde p < 0.001, Cliff's δ ≈ −0.33). De evaluatielaag identificeerde ontbrekende spans/velden die de ruwe trace niet zag.
  • Workflow Reliability (WRS): Significant lager met semantische evaluatie onder zowel gelijke als expert-wegingsschema's (kleine effecten).
  • Semantische & Governance Metrieken: Er werden geen statistisch significante verschillen gevonden voor SPS, AHF, IDR, TUA, GCR, HPR of HEP tussen de twee LLM-condities.
  • Beslissingsnauwkeurigheid: De correctheid binnen de beslissingsfamilie was vergelijkbaar (59/160 vs. 57/160; p ≈ 0.91).
  • Latency: De evaluatie-geactiveerde conditie ondervond significant hogere latency (~126.2s vs. ~101.7s; Cliff's δ ≈ 0.67, groot effect).
  • Kosten: Beide condities veroorzaakten $0 lokale kosten (gebruikmakend van lokale model-executie).
  • Drift Detectie: In gecontroleerde perturbatie-scenario's detecteerde de multi-agent conditie succesvol instructie-drift en ontbrekend bewijs, terwijl de deterministische baseline dit niet kon detecteren (hoewel deze ontbrekende data correct afhandelde via deterministische regels).

Significantie en Claims
Het artikel claimt bescheiden dat de primaire waarde van de multi-agent uitbreiding procestransparantie en controleerbaarheid is, en niet superieure uiteindelijke beslissingsnauwkeurigheid.

  • Governance Waarde: Het framework biedt een mechanisme om te inspecteren hoe agents informatie uitwisselen, waar restricties verloren gaan en waar governance-controles moeten ingrijpen. Het ondersteunt de "Measure" en "Govern" functies van de NIST AI RMF door auditeerbaar bewijs van agent-gedrag te creëren.
  • Operationele Realiteit: De studie demonstreert dat de conceptuele architectuur kan worden geoperationaliseerd met behulp van LangChain, LangGraph en LangSmith zonder bestaande productdeployments te wijzigen.
  • Beperkingen: De auteurs stellen expliciet dat de effectiviteit van semantisch behoud niet bewezen is in productie. Menselijke kalibratie van metriek-gewichten, inter-rater overeenstemming studies en externe validatie op geannoteerde corpora blijven nog uit. De bevindingen zijn gebaseerd op een lokale experimentele uitbreiding, niet op een productie-schaal deployment.
  • Conclusie: Voor vaste, regelgebaseerde governance-taken die slechts een finale aanbeveling vereisen, blijft de deterministische baseline voldoende. Echter, voor omgevingen die inzicht vereisen in intermediaire redenering, agent-communicatie en semantische verantwoording, biedt de multi-agent architectuur mogelijkheden die de deterministische workflow mist, zij het tegen de kosten van verhoogde latency en implementatiecomplexiteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →