← Nieuwste papers
📈 economics

CausalForge: A Formally Grounded, Self-Improving Agentic Framework for Automated Research in Causal Inference

CausalForge is een formeel gefundeerd, zelfverbeterend agentisch framework dat causaal inferentieonderzoek automatiseert door de op Lean gebaseerde Causalean-bibliotheek te combineren met een pijplijn die bewijzen genereert, formaliseert en auditeert om de betrouwbaarheid van machinaal gecontroleerde resultaten te waarborgen.

Oorspronkelijke auteurs: Jiyuan Tan, Vasilis Syrgkanis

Gepubliceerd 2026-07-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiyuan Tan, Vasilis Syrgkanis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen over oorzaak en gevolg. Je wilt weten: "Als ik dit medicijn neem, word ik dan beter?" of "Heeft die regen werkelijk de overstroming veroorzaakt?" In de wereld van de wetenschap wordt dit causale inferentie genoemd. Het is anders dan alleen maar kijken naar wat er gebeurt; het gaat erom uitzoeken wat er zou gebeuren als we iets veranderen. Al een lange tijd gebruiken wetenschappers wiskunde om te bewijzen dat deze oorzaak-gevolgverhalen waar zijn. Maar wiskunde is moeilijk, en één klein foutje in een bewijs kan het hele verhaal onwaar maken.

Onlangs zijn computers erg goed geworden in het schrijven van verhalen en het oplossen van puzzels met behulp van iets dat Large Language Models (LLMs) wordt genoemd. Dit zijn als superintelligente robots die bijna alles wat ooit geschreven is kunnen lezen en vervolgens hun eigen papers, bewijzen en theorieën kunnen schrijven. Maar er is een addertje onder het gras: deze robots zijn geweldig in het klinken als een expert, maar ze zijn verschrikkelijk in het controleren van hun eigen werk. Ze verzinnen vaak feiten, creëren verzonnen getallen of schrijven bewijzen die er perfect uitzien, maar in werkelijkheid onzin zijn. Als we een robot een wetenschappelijk artikel laten schrijven en vervolgens een andere robot vragen om het te controleren, kunnen ze simpelweg naar elkaar knikken en zeggen: "Yep, dat is waar!", zelfs als het volkomen onjuist is. Dit is een groot probleem, want in de wetenschap kan het fout zijn leiden tot slechte beslissingen.

Hier komt een nieuw project genaamd CausalForge om de hoek kijken. Denk aan CausalForge als een "zelfverbeterende robotwetenschapper", ontworpen specifiek voor onderzoek in causale inferentie, maar dan met een zeer strikt vangnet. In plaats van er simpelweg op te vertrouwen dat een robot het huiswerk van een andere robot controleert, gebruikt CausalForge een magisch, onbreekbaar wiskundig hulpmiddel genaamd Lean (een proof assistant). Lean is als een superstrenge docent die nooit een antwoord accepteert, tenzij elke stap logisch perfect is. Als de wiskunde niet klopt, zegt Lean: "Nee!" en weigert het te valideren.

Maar er is een tweede probleem: zelfs als de wiskunde perfect is, kan de robot misschien het verkeerde bewijzen. Stel je voor dat een robot bewijst dat "Alle katten zijn honden" met perfecte logica. De wiskunde is deugdelijk, maar de bewering is belachelijk. CausalForge lost dit op door een "Statement Audit" toe te voegen. Het is als een vertaler die controleert: "Heeft de robot daadwerkelijk bewezen wat hij zei dat hij zou gaan bewijzen?"

Dus, wat heeft CausalForge eigenlijk gedaan? Het team heeft twee hoofdonderdelen gebouwd. Ten eerste hebben ze een enorme bibliotheek genaamd Causalean gecreëerd, die meer dan 7.000 vooraf gecontroleerde, perfecte wiskundige feiten over oorzaak en gevolg bevat. Het is als een gigantische gereedschapskist waarin elk gereedschap al is getest om te controleren of het werkt. Ten tweede hebben ze een robot-pipeline gebouwd genaamd CausalSmith. Deze robot kan een onderzoeksonderwerp kiezen, proberen een nieuw theorema te bedenken, het bewijs schrijven in de taal van Lean, en vervolgens het systeem laten controleren of het bewijs echt is en of de bewering overeenkomt met de wiskunde.

De resultaten zijn een mix van succes en realiteitschecks. Van de 123 pogingen die het systeem maakte om nieuwe dingen te ontdekken, werden er 9 volledig geaccepteerd als correct, nieuw en door de machine geverifieerd. Het systeem was verrassend goed in het vinden van kleine, technische hiaten in bestaand onderzoek (zoals het repareren van een klein foutje in een formule), maar had moeite wanneer het werd gevraagd om vanuit het niets geheel nieuwe, grote ideeën te bedenken. Het artikel laat zien dat we robots weliswaar nog niet volledig kunnen vertrouwen om hun eigen creativiteit te beoordelen, maar dat we ze wel kunnen vertrouwen om het zware werk van het schrijven en controleren van wiskunde te doen, zolang we een strikte "magische docent" (Lean) en een zorgvuldige "vertaler" (de audit) hebben die toezicht houden. Het is geen toverstaf die alle wetenschappelijke problemen oplost, maar het is een krachtige nieuwe manier om ervoor te zorgen dat onze wetenschappelijke verhalen ook daadwerkelijk waar zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →