CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
CausalDS is een uitgebreide benchmark die is ontworpen om de causale redeneervaardigheden van data science-agenten te evalueren door synthetische structurele causale modellen, realistische natuurlijke taal-narratieven en meerstaps programmeertaken te integreren over de drie treden van Pearls causaliteit, terwijl expliciet het gebruik van tools, onzekerheidskwantificering en het vermogen om te onthouden van onverantwoorde antwoorden wordt beoordeeld.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: CausalDS – Benchmarking van Causaal Redeneren in Data Science Agents
1. Probleemstelling
Huidige benchmarks voor Large Language Models (LLM's) op het gebied van data science en causaal redeneren lijden aan een fragmentatie die er niet in slaagt de complexiteit van realistische causale analyse te vatten. Bestaande evaluaties isoleren doorgaans specifieke capaciteiten:
- Data-science benchmarks (bijv. DS-1000, MLE-bench) leggen de nadruk op coderen, instrumentgebruik (tool use) en open-eind analyse, maar missen een verborgen, principiële causale datagenererende structuur.
- Causale redeneer-benchmarks (bijv. CLadder, CausalGraph2LLM) testen symbolisch graafredeneren, interventie en contrafactische logica, maar opereren vaak op puur symbolische niveaus of gebruiken gecureerde voorbeelden uit de bestaande literatuur.
Deze scheiding creëert een kloof waarbij modellen kunnen vertrouwen op "geamortiseerde causale inferentie" (het memoriseren van patronen uit bestaande datasets) in plaats van op werkelijk structuurgevoelig redeneren, een foutmodus die wordt aangeduid als de "causale papegaai" (causal parrot). Bovendien vereist realistische causale data science dat een agent niet alleen causale vragen beantwoordt, maar ook domeinbeschrijvingen interpreteert, observationele data inspecteert, identificeerbaarheid bepaalt, hoeveelheden schat, onzekerheid kwantificeert en herkent wanneer een vraag onbeantwoordbaar is (abstention/onthouding). Geen enkele bestaande benchmark evalueert gezamenlijk symbolisch redeneren, data-science executie, onzekerheidskwantificering, epistemische onthouding en instrumentgebruik binnen één enkel, synthetisch maar realistisch framework.
2. Methodologie: Het CausalDS Framework
CausalDS adresseert deze kloof door synthetische causale data-science scenario's te genereren die dienen als de benchmark-eenheid. Elk scenario bestaat uit een verborgen Structureel Causaal Model (SCM), een narratief in natuurlijke taal, tabulaire observationele data en een reeks taken die de drie niveaus van Pearls hiërarchie beslaan.
2.1 Scenario-generatie Pipeline
Het generatieproces volgt een strikte pipeline om te garanderen dat de grondwaarheid (ground truth) bekend is terwijl de narratieve coherentie behouden blijft:
- Graaf-sampling: Gerichte acyclische grafen (DAGs) worden gesampled uit canonieke motieven (ketens, forks, confounders, colliders, etc.) en kunnen worden uitgebreid via "anchor-based grafting", waarbij hulpmotieven via gedeelde knopen worden bevestigd om de complexiteit te vergroten terwijl de narratieve flow behouden blijft.
- SCM-instantiatie: Elke graaf wordt geïnstantieerd met een Structureel Causaal Model met getypeerde mechanismeprofielen (continu en binair) afkomstig uit registers die empirische biochemische/Booleaanse regels mengen met synthetische regimes.
- Observatielaag: Een cruciale ontwerpkeuze onderscheidt het conceptuele SCM van de data die aan de agent wordt verstrekt. Conceptuele variabelen kunnen worden vervangen door bundels van ruisgevoelige metingen (proxies). Deze laag verhoogt de moeilijkheidsgraad van de data-analyse zonder de onderliggende causale identificeerbaarheid te veranderen.
- Verbalisatie: Abstracte knopen worden in kaart gebracht naar domeinrelevante variabelen (optioneel gezaaid vanuit CauseNet) en geverifieerd door een auditor om te waarborgen dat het gegenereerde verhaal in natuurlijke taal de verborgen graaf getrouw reflecteert zonder "accidentele randen" te introduceren.
- Taakderivatie: Vanuit elk scenario worden taken afgeleid over Rung 1 (associatie/voorspelling), Rung 2 (interventie/identificatie/schatting) en Rung 3 (contrafactisch/mediatie).
2.2 Evaluatie Harness
Agents interageren met een gesandboxed omgeving (gebruikmakend van mini-swe-agent) waar zij moeten:
- Verstrekte bestanden lezen (verhalen, dataschema's, observationele data).
- Code uitvoeren (Python/bash) om analyses uit te voeren.
- Antwoordbestanden schrijven in een specifiek formaat.
- Omgaan met imperfecte observaties en besluiten wanneer zij zich onthouden (abstain) wanneer een doelwit niet-identificeerbaar is.
2.3 Scoring en Metrieken
De evaluatie is volledig deterministisch en scoort vijf verschillende assen:
- Symbolisch Causaal Redeneren: Graafherstel en identificatielogica.
- Data-Science Executie: Nauwkeurigheid van schattingen en voorspellingen.
- Onzekerheidskwantificering: Kalibratie van betrouwbaarheidsintervallen.
- Epistemische Onthouding: Het correct identificeren van niet-identificeerbare queries en het weigeren van antwoorden.
- Instrumentgebruik/Efficiëntie: Tokengebruik en het aantal tool-calls.
Een samengestelde score (CausalDSScore) aggregeert de prestaties en straft zowel inhoudelijke fouten als het falen om zich te onthouden bij niet-identificeerbare taken af.
3. Belangrijkste Bijdragen
- SCM-gegronde Synthetische Scenario's: De eerste benchmark die verborgen SCM's genereert, observationele data synthetiseert en private grondwaarheid berekent voor evaluatie, terwijl de compositie-assen (variabeletypes, graafstructuren) zijn verankerd aan empirische distributies uit real-world datasets om realisme te garandeen.
- Graafgetrouwe Vrije Formulier Verbalisatie: Een pipeline die abstracte graafknopen in kaart brengt naar coherente domeinvariabelen en verhalen in natuurlijke taal genereert, die gecontroleerd zijn om te waarborgen dat het narratief niet afwijkt van de onderliggende causale structuur.
- Gescheiden Observatielaag: Een mechanisme om de moeilijkheidsgraad van data science (via ruisgevoelige proxies) onafhankelijk van de causale identificeerbaarheid te variëren, waardoor de benchmark de schattingsvaardigheden kan testen zonder de causale vraag te veranderen.
- Brede Taakset: Een uitgebreide set taken die alle drie de niveaus van Pearls hiërarchie beslaat, inclus inclusief voorspelling, associatie, graafherstel, identificatie, effectschatting, biasdiagnostiek en contrafactisch redeneren.
- Abstention-Aware Deterministische Evaluatie: Een scoringsysteem dat onthouding (abstention) op niet-identificeerbare estimanden behandelt als een primaire uitkomst, waardoor modellen niet worden beloond voor het hallucineren van antwoorden op onbeantwoordbare vragen.
4. Experimentele Resultaten
De auteurs evalueerden zes modellen (drie frontier closed-source modellen: Claude Opus 4.8, Gemini 3.1 Pro, GPT-5.5; en drie open-weight modellen: Qwen 3.6 35B, Kimi K2.6, Gemma 4 26B) op een 100-scenario realistische-compositie examen.
- Prestatiedissociatie: De vijf evaluatieassen vallen niet samen in één enkele capaciteit. Modellen verschillen significant in inhoudelijke correctheid, onzekerheidskwantificering, herkenning van onthouding en efficiëntie van instrumentgebruik.
- Leaderboard: Claude Opus 4.8 behaalde de beste algemene
CausalDSScore(0.278), leidend in pass rate, genormaliseerde fout en signaal-ruisverhouding (SNR). Het was het enige model dat 100% inhoudelijke correctheid bereikte op binaire taken, terwijl het sterke prestaties leverde op het gebied van onthouding. - Onthouding als Differentiatie: Het vermogen om niet-identificeerbare queries te herkennen was een belangrijke differentiator. Frontier-modellen (met name GPT-5.5 en Claude) vertoonden aanzienlijk hogere pass rates voor onthouding (tot 75%) vergeleken met open-weight modellen (zo elelijk 18,8% voor Gemma 4 26B).
- Onzekerheidskwantificering: Alle modellen vertoonden overmoed (overconfidence). De empirische dekking van nominale 95% ATE-intervallen stortte in tot tussen de 20,0% en 71,4%, waarbij Claude Opus 4.8 het best presteerde (71,4%).
- Instrumentgebruik en Efficiëntie: Frontier-modellen (Claude, GPT-5.5) gebruikten een "near one-shot" strategie met minder tool-calls (2,1–3,4 per taak) en lager tokenverbruik, terwijl open-weight modellen zwaar itereren (11–18 calls/taak) en aanzienlijk meer tokens verbruiken.
- Observatie-Hardheid: Onder de moeilijkste observatievarianten (ruisgevoelige proxies) verslechterde de prestatie, met name voor open-weight modellen. GPT-5.5 vertoonde de grootste daling in continue schatting-kalibratie (gemiddelde genormaliseerde fout steeg naar 3.10), terwijl Claude Opus 4.8 een gecontroleerde fout behield.
5. Betekenis en Claims
Het artikel claimt dat CausalDS een noodzakelijke evolutie in benchmarking biedt door symbolisch redeneren, kwantitatieve schatting en agentische instrumentgebruik te integreren in één enkele, realistische setting. De primaire empirische bevinding is dat causale data-science competentie uiteenvalt (decomposes): modellen kunnen de onderdelen beheersen (structuur lezen, schattingen produceren), maar falen op het geheel (weten wat de kwaliteit van de schatting is of of een antwoord überhaupt toegestaan is).
De auteurs stellen dat een competente causale data-science agent alle vijf de assen tegelijkertijd moet doorstaan. De benchmark legt bloot dat huidige frontier-modellen deze capaciteit benaderen, waarbij Claude Opus 4.8 naar voren komt als de dichtstbijzijnde bij een "veelzijdige causale data-science agent", terwijl open-weight modellen en kleinere modellen aanzienlijk worstelen met epistemische assen (onthouding en onzekerheid) en de efficiëntie van instrumentgebruik. Het werk benadrukt dat "weten wanneer men zich moet onthouden" een aparte, geavanceerde vaardigheid is die robuuste agents onderscheidt van die vatbaar voor hallucinatie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.