← Nieuwste papers
📊 statistics

Using large language models for sensitivity analysis in causal inference: cases studies on Cornfield inequality and E-value

Dit onderzoek toont aan dat grote taalmodellen, wanneer ze worden gestuurd door gestructureerde prompts, effectief kunnen worden ingezet om gevoeligheidsanalyses uit te voeren en ongemeten verstorende factoren te identificeren in causale inferentie, zoals geïllustreerd door de Cornfield-ongelijkheid en de E-waarde.

Oorspronkelijke auteurs: Qingyan Xiang, Jiahao Zhang, Bojian Feng

Gepubliceerd 2026-03-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Qingyan Xiang, Jiahao Zhang, Bojian Feng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen: "Is roken de oorzaak van longkanker?" of "Helpt een nieuw medicijn tegen Alzheimer?" In de echte wereld (in plaats van een gecontroleerd laboratorium) is het lastig om zeker te zijn. Er zijn altijd onzichtbare verdachten die je niet hebt gemeten, zoals erfelijkheid, stress of een onbekend virus. In de statistiek noemen we deze onbekende verwarrende factoren.

Deze paper is als een test om te zien of kunstmatige intelligentie (AI), specifiek grote taalmodellen zoals ChatGPT, Claude en Gemini, goed genoeg is om als een slimme statistische detective te werken.

Hier is de uitleg, vertaald naar alledaags Nederlands met wat creatieve vergelijkingen:

1. Het Probleem: De Onzichtbare Schaduw

Wanneer onderzoekers kijken naar gegevens uit het echte leven, willen ze weten of A echt B veroorzaakt. Maar soms is er een "onzichtbare schaduw" (een ongemeten factor) die zowel A als B beïnvloedt.

  • Voorbeeld: Stel, mensen die meer koffie drinken, hebben ook meer kans op stress. Als we zien dat koffie- drinkers meer hartkloppingen hebben, is het dan de koffie of de stress?
  • Om dit op te lossen, gebruiken wetenschappers twee speciale gereedschappen:
    • De Cornfield-ongelijkheid: Dit is als een rekenregelspelletje. Het vraagt: "Hoe sterk zou die onzichtbare schaduw moeten zijn om onze conclusie volledig onwaar te maken?" Als de schaduw onmogelijk sterk moet zijn (bijvoorbeeld 100 keer sterker dan alles wat we kennen), dan is onze conclusie waarschijnlijk wel waar.
    • De E-waarde: Dit is een getal dat de "sterkte" van die onzichtbare schaduw aangeeft. Een hoge E-waarde betekent: "Je hebt een superkrachtige onzichtbare schaduw nodig om dit resultaat te ontkrachten. Dat is onwaarschijnlijk, dus ons resultaat is sterk." Een lage E-waarde betekent: "Een kleine schaduw kan dit al verklaren. Wees voorzichtig."

Het probleem is dat het rekenen en interpreteren van deze getallen voor artsen en onderzoekers vaak lastig en saai is.

2. De Oplossing: De AI als Rekenmachine en Vertaler

De auteurs van dit artikel dachten: "Wat als we de slimme AI-modellen (ChatGPT, Claude, DeepSeek, Gemini) vragen om dit voor ons te doen?" Ze wilden weten of deze AI's:

  1. De moeilijke wiskunde (de E-waarde) correct kunnen uitrekenen.
  2. De uitslag goed kunnen uitleggen in gewone taal.
  3. Slimme suggesties kunnen doen voor welke "onbekende verdachten" er misschien nog zijn.

3. De Test: Vier Verhalen

Ze namen vier bestaande onderzoeken als proefballon:

  • Roken en longfibrose.
  • Gewicht en rugpijn.
  • Alzheimer-medicatie en overleving.
  • Milieugif en hoge bloeddruk.

Ze gaven de AI's de gegevens van deze studies en vroegen hen om de E-waarde te berekenen en te zeggen of de resultaten betrouwbaar zijn.

4. De Resultaten: Wie is de beste detective?

  • De Rekenmachine (Berekening):

    • ChatGPT, Claude en Gemini waren perfect. Ze rekenden de E-waarden exact hetzelfde uit als de originele onderzoekers. Het was alsof ze een rekenmachine hadden die nooit een foutje maakt.
    • DeepSeek maakte kleine rekfoutjes. Het was alsof deze AI een beetje slaperig was en soms een cijfer verkeerd overkreeg.
  • De Vertaler (Interpretatie):

    • De slimme AI's (ChatGPT, Claude, Gemini) begrepen het verhaal goed. Als de E-waarde hoog was, zeiden ze: "Dit resultaat is sterk, onbekende factoren verklaren dit waarschijnlijk niet." Als de E-waarde laag was, zeiden ze: "Wees voorzichtig, dit kan makkelijk door iets anders verklaard worden."
    • Ze waren zelfs slimmer dan de originele auteurs! Soms concludeerden de originele onderzoekers "alles is goed" voor een heel onderzoek, terwijl de AI's zagen: "Nee, bij dit ene onderdeel is het resultaat zwak, maar bij dat andere is het sterk." Ze waren dus meer gedetailleerd.
  • De Suggesties (Onbekende verdachten):

    • De AI's konden fantastische suggesties doen voor ongemeten factoren.
    • Voorbeeld: Bij het onderzoek naar roken en longen, dachten de AI's direct aan "stof in de werkplek" of "genetische aanleg". Dit zijn dingen die de originele studie misschien niet gemeten had, maar die wel logisch zijn. Het was alsof de AI's een brede horizon hadden en dachten: "Hé, hebben we dat ook al bedacht?"

5. Conclusie: De AI als Hulpkracht

De boodschap van dit artikel is optimistisch maar voorzichtig.
Stel je voor dat je een onderzoeker bent die een complex dossier moet oplossen. Deze AI's zijn als super-assistenten. Ze kunnen de saaie wiskunde doen, de resultaten helder uitleggen en je helpen denken aan factoren die je misschien bent vergeten.

Ze zijn nog niet de eindverantwoordelijke (de mens moet nog steeds oordelen), maar ze zijn een krachtig hulpmiddel om te voorkomen dat we door onzichtbare schaduwen in de war worden gebracht.

Kort samengevat in één zin:
Deze studie toont aan dat moderne AI's uitstekend kunnen helpen bij het controleren van de betrouwbaarheid van medisch onderzoek, door de moeilijke statistiek correct te rekenen en slimme vragen te stellen over wat er misschien nog ontbreekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →