← Nieuwste papers
💬 NLP

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

Dit artikel presenteert de CLEF 2026 LongEval-inzending van DS@GT ARC, waarin wordt betoogd dat hoewel frontier-modellen uitblinken in fluentie, een corrigerende pijplijn die pre-generatie filtering combineert met post-generatie implicatiecontroles noodzakelijk is om de citatiegetrouwheid en antwoordverankering in wetenschappelijke QA te verbeteren, wat de noodzaak benadrukt voor evaluatiemetrieken die strikte verankering prioriteren boven traditionele relevantiescores.

Oorspronkelijke auteurs: Brandon Michaels, Brendon Johnson

Gepubliceerd 2026-07-17
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Brandon Michaels, Brendon Johnson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: DS@GT ARC bij LongEval

Probleemstelling
Wetenschappelijke kennis is dynamisch en evolueert door voortdurend onderzoek en publicaties. Deze temporele drift vormt aanzienlijke uitdagingen voor Retrieval-Augmented Generation (RAG)-systemen, die het risico lopen op verouderde of irrelevante informatie te halen, bewijsmateriaal te missen, of antwoorden te genereren die niet feitelijk gebaseerd zijn op de verstrekte brondocumenten. Hoewel RAG theoretisch ideaal is voor wetenschappelijke vraag en antwoord (QA) door gebruik te maken van externe documenten, kampen huidige systemen vaak met "retrieval-gerelateerde fouten", waaronder de inclusie van afleidende documenten en het genereren van niet-gegronde claims. Er bestaat een kritische kloof tussen traditionele natuurlijke taal-evaluatiemetrieken (die de voorkeur geven aan vloeiendheid en lexicale overlap) en de vereiste van strikte citatie-integriteit en feitelijke onderbouwing in wetenschappelijke domeinen.

Methodologie
Het DS@GT ARC-team nam deel aan de CLEF 2026 LongEval Task 4, die gebruikmaakte van de CORE wetenschappelijke literatuurcorpus. De taak bood een query en een vaste set van tien vooraf opgehaalde documenten, waarbij deelnemers natuurlijke taalantwoorden moesten genereren die ondersteund worden door specifieke citaties uit die set. Het team evalueerde drie verschillende architecturale benaderingen:

  1. DS@GT Hybride Baseline: Een standaard RAG-implementatie met gebruik van een hybride retriever (BM25 + BGE dense embeddings) om overlappende semantische chunks te rangschikken. De top-kk chunks werden direct ingevoerd in een Gemma-4-31B instructie-afgestemde model voor antwoordsynthese.
  2. Corrective RAG (CRAG) + CiteFix Pipeline: Een tweestaps correctieve architectuur ontworpen om onderbouwing af te dwingen:
    • Pre-Generatie: Een lichtgewicht cross-encoder (CRAG) evalueert de opgehaalde chunks tegen de query en verwijdert de chunks die niet voldoen aan een implicatie-drempelwaarde om afleidende elementen te filteren vóór de generatie.
    • Post-Generatie: CiteFix analyseert de gegenereerde claims tegen de geciteerde document-chunks. Citaties die een gebrek aan implicatie vertonen om de specifieke claims te ondersteunen, worden verwijderd, wat strikte attributie afdwingt.
  3. Frontier Model Benchmarks: Twee handmatig samengestelde runs met state-of-the-art modellen (GPT-5.5 Thinking en Claude Opus 4.7 Thinking) die het chunken en scoren omzeilden en antwoorden direct synthetiseerden vanuit de ruwe tekst van de tien kandidaat-documenten.

Evaluatiestrategie
Het team hanteerde een duaal evaluatiekader:

  • Officiële Taakmetrieken: Standaardmetrieken inclusief ROUGE en BERT-scores voor lexicale/semantische gelijkenis met een verborgen gouden set, Citatieprecisie en Nugget Coverage.
  • Referentievrije RAGAs Diagnostiek: Een LLM-als-rechter opstelling (gebruikmakend van Claude Sonnet 4.6) om Globale Getrouwheid (onderbouwing van claims tegen de volledige 10-document context), Citatiegetrouwheid (onderbouwing van claims strikt tegen de geciteerde documenten) en Antwoordrelevantie te meten.

Belangrijkste Resultaten
De evaluatie toonde een significante divergentie tussen traditionele prestatie metrieken en feitelijke onderbouwing:

  • Frontier Modellen: GPT-5.5 en Claude Opus 4.7 behaalden de hoogste scores op officiële metrieken (ROUGE, BERT, Antwoordrelevantie) en Citatieprecisie. Echter, RAGAs diagnostiek legde een kritieke foutmodus bloot: deze modellen genereerden vaak zeer relevante antwoorden door te vertroueren op hun parametrische geheugen in plaats van de verstrekte context. Bijgevolg vertoonden ze een lage Citatiegetrouwheid (bijv. GPT-5.5 scoorde 0.417), wat aangeeft dat ze vaak citaties hallucineerden of er niet in slaagden specifieke details in de opgehaalde documenten te onderbouwen.
  • Correctieve Pipeline: De CRAG+CiteFix pipeline behaalde de hoogste Globale Getrouwheid (0.784) en Citatiegetrouwheid (0.758) van alle inzendingen. Deze strikte naleving van onderbouwing leidde echter tot lagere ROUGE en BERT scores vergeleken met de Hybride Baseline. Deze daling werd toegeschreven aan het "onthoudingsgedrag" van de pipeline, waarbij het systeem weigerde antwoorden te genereren wanneer de opgehaalde context onvoldoende bewijs bood, in plaats van te hallucineren vanuit het parametrische geheugen.
  • Statistische Significantie: Een Wilcoxon signed-rank test op de RAGAs-scores gaf aan dat de verbeteringen in getrouwheid door de correctieve interventies niet statistisch significant waren over de 47 test-queries, wat wijst op potentiële beperkingen in de NLI-modellen die voor verificatie worden gebruikt of de specifieke afstemming van de interventies.

Betekenis en Conclusies
Het artikel betoogt dat de evaluatie van betrouwbare RAG QA-systemen een verschuiving in metriekontwerp vereist. De resultaten demonstreren dat frontier-modellen de antwoordrelevantie en vloeiendheid kunnen maximaliseren terwijl ze falen in het benutten van de verstrekte context, een foutmodus die traditionele metrieken (ROUGE/BERT) niet afstraffen. Omgekeeld kunnen pipelines die strikte onderbouwing afdwingen minder presteren op lexicale overlap-metrieken vanwege veiliger onthoudingsgedrag.

De auteurs concluderen dat het beveiligen van RAG QA-pipelines in wetenschappelijke domeinen een evaluatie van metrieken vereist die structurele veiligheid en juiste foutmodi (zoals onthouding) belonen boven conversionele vloeiendheid die steunt op parametrisch geheugen. Zij stellen voor dat toekomstige benchmarks prioriteit moeten geven aan metrieken die strikte antwoordonderbouwing afdwingen om te waarborgen dat wetenschappelijke claims empirisch worden ondersteund door de geciteerde onderzoeksdocumenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →