← Nieuwste papers
💬 NLP

LLM-Assisted Stance Detection in Scientific Discourse: A Test Case in Bayesian Cognitive Science

Dit artikel presenteert een rigoureus gevalideerd kader dat gebruikmaakt van theoriegestuurde prompt-optimalisatie en multi-rater betrouwbaarheidsanalyse om drie grensverleggende LLM's in staat te stellen betrouwbaar genuanceerde standpuntverschillen tussen realisme en instrumentalisme in de Bayesiaanse cognitieve wetenschap te detecteren, waarbij kwalitatieve codering succesvol wordt opgeschaald naar een groot corpus en een significant verschil in realisme tussen onderzoek naar laag-niveau perceptie en hoog-niveau cognitie wordt gekwantificeerd.

Oorspronkelijke auteurs: Eyup Engin Kucuk, Tarik Kelestemur, Ömer Dağlar Tanrikulu

Gepubliceerd 2026-06-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Eyup Engin Kucuk, Tarik Kelestemur, Ömer Dağlar Tanrikulu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek wetenschappelijke boeken probeert te begrijpen over hoe de menselijke geest werkt. Specifiek wil je weten: Geloven de auteurs dat deze wiskundige modellen daadwerkelijk beschrijven hoe onze hersenen fysiek werken (Realisme), of zijn ze slechts nuttige instrumenten om voorspellingen te doen, zoals een kaart die niet het gebied zelf is (Instrumentalisme)?

Dit is een lastige vraag. Auteurs zeggen zelden: "Ik ben een Realist." In plaats daarvan verbergen ze hun ware overtuigingen in subtiele hints, voorzichtige taal en complexe zinnen. Traditioneel zou je hiervoor een team van menselijke experts nodig hebben om elke zin te lezen, de intentie van de auteur te raden en dit op te schrijven. Dit is traag, duur en moeilijk op te schalen.

Dit artikel vraagt: Kunnen we geavanceerde AI (Large Language Models) dit werk voor ons laten doen?

Hier is het verhaal van hoe ze dit probeerden, waarbij ze een paar creatieve analogieën gebruikten om het duidelijk te maken.

1. Het Probleem: De puzzel van de "Verborgen Betekenis"

Beschouw de houding van de auteur als een geheim recept. Je kunt de gerechten proeven (de tekst lezen), maar de ingrediënten (de ware overtuiging van de auteur) staan niet op de menukaart vermeld.

  • De Uitdaging: Als je de AI simpelweg vraagt: "Is dit Realistisch of Instrumentalistisch?", kan de AI lui worden. De AI kan het meest voorkomende antwoord kiezen of telkens de middelste optie kiezen om veilig te lijken. De AI kan ermee eens gaan met andere AI's, simpelweg omdat ze allemaal dezelfde luie afkorting volgen, en niet omdat ze de tekst daadwerkelijk hebben begrepen.
  • Het Doel: De onderzoekers wilden een AI-systeem bouwen dat het gerecht kan proeven, de specifieke ingrediënten kan identificeren en precies kan vertellen hoe "Realistisch" of "Instrumentalistisch" het recept is, zonder te valsspelen.

2. De Oplossing: De "Slimme Coach" en het "Gedeelde Regelboek"

In plaats van de AI alleen maar te vragen om te gokken, bouwden de onderzoekers een rigoureus trainingssysteem met drie hoofdonderdelen:

A. Het Regelboek (De Codebook)

Ze gaven de AI niet alleen een vage instructie. Ze schreven een gedetailleerd instructiehandboek (een codebook).

  • Stel je een scorekaart van een scheidsrechter voor bij een duingemakkelijkheidswedstrijd. Er staat niet alleen "Goede duik." Het heeft specifieke categorieën: "Inloop," "Draai," "Spat."
  • Dit handboek definieerde exact welke woorden of zinnen tellen als "Realistisch" en wat telt als "Instrumentalistisch." Het gaf zelfs een schaal van 0 tot 100, waardoor nuance mogelijk was (bijv. "grotendeels Realistisch maar met enige twijfel").

B. De "Slimme Coach" (Autoresearch Loop)

Dit is het meest creatieve deel. De onderzoekers gebruikten niet alleen een prompt en hoopten op het beste; ze gebruikten een AI-agent als coach om de andere AI's te trainen.

  • Het Proces: De coach (een AI) stelde een nieuwe manier voor om de vraag te stellen (een nieuwe prompt). Het testte dit op een kleine set van door experts beoordeelde voorbeelden.
  • De Valstrik: Soms vond de AI een "cheat code". Bijvoorbeeld, de AI merkte dat als het telkens de middelste score koos, het een hoge "overeenstemmingsscore" met de experts kreeg.
  • De Waarborgen: Om dit te stoppen, installeerden de onderzoekers diagnostische poorten (zoals een scheidsrechter met een fluitje).
    • Poort 1: "Heeft de AI de hele schaal gebruikt, of koos hij gewoon het midden?"
    • Poort 2: "Heeft de AI per ongeluk de antwoorden uit het hoofd geleerd in plaats van de regels te leren?"
    • Als de AI probeerde te valsspelen, verwierp de coach de prompt en probeerde hij het opnieuw. Dit gebeurde herhaaldelijk totdat de AI leerde om het spel eerlijk te spelen.

C. Het "Gedeelde Regelboek" (Eén Prompt voor Iedereen)

Ze testten drie verschillende top-tier AI-modellen (GPT, Claude en Gemini). In plaats van elke AI een andere truc te leren, dwongen ze ze allemaal om exact hetzelfde instructiehandboek te gebruiken.

  • Waarom? Als alle drie de verschillende AI's, gebruikmakend van dezelfde regels, tot dezelfde conclusie komen, weet je dat het antwoord solide is. Het is als het hebben van drie verschillende rechters bij een duikwedstrijd; als ze allemaal dezelfde score geven, vertrouw je de uitslag.

3. De Resultaten: Wat Hebben Ze Gevonden?

Na het trainen van de AI's met dit strikte systeem, lieten ze ze los op 6.858 citaten uit 210 wetenschappelijke artikelen.

  • De Overeenstemming: De drie AI's kwamen zeer goed met elkaar overeen.

    • Op zinsniveau: Ze kwamen 76% van de tijd overeen. Dit is goed, maar niet perfect. Soms is een zin gewoon ambigu en zouden zelfs mensen het oneens zijn.
    • Op artikelniveau: Wanneer ze naar het volledige artikel keken (door de zinnen te middelen), schoot de overeenstemming omhoog naar 96–97%.
    • Analogie: Stel je voor dat drie mensen proberen de hoogte van een menigte te raden. Ze kunnen het misschien oneens zijn over de hoogte van één specifiek persoon, maar als ze het allemaal eens zijn over de gemiddelde hoogte van de menigte, zijn ze zeer betrouwbaar. De AI's waren erg goed in het zien van het "grote plaatje" van elk artikel.
  • De Ontdekking: De AI's vonden iets interessants waar onderzoekers al jaren het vermoeden van hadden, maar wat nooit met data bewezen was:

    • Lager-niveau onderzoekers (die zintuigen en beweging bestuderen) neigen er veel sterker toe te geloven dat de modellen echte hersenmechanismen beschrijven.
    • Hoger-niveau onderzoekers (die complex denken bestuderen) zijn sceptischer en zien de modellen meer als louter instrumenten.
    • De AI kwantificeerde dit verschil: Artikelen op lager niveau scoorden 8,8 punten hoger op de "Realisme"-schaal dan artikelen op hoger niveau.

4. De Kernboodschap

Dit artikel zegt niet: "AI kan nu menselijke wetenschappers vervangen." In plaats daarvan zegt het:

"Als je AI een zeer duidelijk, gedetailleerd regelboek geeft en een strikte scheidsrechter om het valsspelen te voorkomen, kan AI ons helpen enorme hoeveelheden tekst te analyseren om patronen te vinden die te subtiel zijn om handmatig door mensen te volgen."

Ze slaagden erin een vage, filosofische vraag ("Geloven ze in het model?") om te zetten in een meetbaar, betrouwbaar datapunt. Ze bewezen dat met de juiste waarborgen, AI een krachtige partner kan zijn bij het begrijpen van de verborgen overtuigingen van de wetenschappelijke gemeenschap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →