← Nieuwste papers
💬 NLP

Assessing Web Search Credibility and Response Groundedness in Chat Assistants

Deze studie introduceert een nieuwe methodologie om chatassistenten te evalueren op hun zoekgedrag en grondigheid, waarbij wordt geconstateerd dat Perplexity de hoogste broncredibiliteit bereikt, terwijl GPT-4o op gevoelige onderwerpen vaker niet-credible bronnen citeert.

Oorspronkelijke auteurs: Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko

Gepubliceerd 2026-02-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Digitale Liberaal: Hoe Chatbots de Waarheid Vinden (of Verliezen)

Stel je voor dat je een super slimme, onuitputtelijke bibliothecaris hebt die je kunt bellen via je telefoon. Deze bibliothecaris, laten we hem Chatbot noemen, kent van alles. Maar als je hem vraagt over iets complex of actueels, zegt hij niet: "Ik denk dat..." Nee, hij rent direct naar de digitale bibliotheek van het hele internet om de nieuwste boeken te halen.

Deze studie van Ivan en zijn team is als een kwaliteitscontrole voor deze digitale bibliothecaris. Ze wilden weten: Haalt hij de juiste boeken uit de kast? En leest hij ze echt goed voor, of verzint hij dingen terwijl hij naar een nepboek kijkt?

Hier is wat ze ontdekten, vertaald in alledaags taal:

1. Het Probleem: De "Slechte Buurman"

Het internet is een enorme markt. Er staan daar prachtige, betrouwbare kranten (zoals NOS of De Volkskrant), maar er staan ook kraampjes met nepnieuws, complottheorieën en propaganda.

De onderzoekers zagen dat chatbots soms per ongeluk naar die nep-kraampjes lopen. Als de chatbot dan zegt: "Volgens deze krant...", maar die krant is een leugen, dan verspreidt de bot onbedoeld desinformatie. Het is alsof je een gids vraagt om je de beste route te wijzen, maar hij neemt je mee door een steegje vol valstrikken omdat hij dacht dat het een snelle weg was.

2. De Proef: Twee Soorten Vragen

Om te testen hoe slim de bots echt zijn, stelden de onderzoekers twee soorten mensen voor:

  • De Skepticus (De Fact-checker): "Is dit verhaal wel waar? Bewijs het maar."
  • De Gelovige (De Claim Believer): "Ik hoorde dat dit waar is, vertel me er meer over!"

Het bleek dat de bots soms anders reageren op de "Gelovige". Als je vraagt met de overtuiging dat iets waar is, gaan sommige bots (zoals GPT-4o en GPT-5) sneller op zoek naar bronnen die dat bevestigen, zelfs als die bronnen twijfelachtig zijn. Het is alsof je een detective vraagt om een moordenaar te vinden, maar je zegt: "Ik weet al dat de tuinman het is." Dan gaat de detective misschien alleen maar sporen zoeken in de tuin, en negeert hij de echte aanwijzingen.

3. De Resultaten: Wie is de Beste Bibliothecaris?

De onderzoekers keken naar vier grote bots: GPT-4o, GPT-5, Perplexity en Qwen Chat.

  • Perplexity (De Voorzichtige): Deze bot was de winnaar. Hij is als een zeer strenge bibliothecaris. Hij pakt alleen boeken van de beste, meest betrouwbare schappen. Hij haalt zelden nepboeken uit de kast. Als hij iets zegt, kun je er bijna zeker van zijn dat het op een betrouwbaar artikel is gebaseerd.
  • GPT-4o & GPT-5 (De Brede Zoekers): Deze bots zijn erg goed, maar ze zijn soms te enthousiast. Ze halen boeken van alle schappen, ook die met twijfelachtige inhoud. Vooral bij gevoelige onderwerpen (zoals de oorlog in Oekraïne of klimaatverandering) grepen ze soms naar nepbronnen. Het is alsof ze een grote mand met fruit vullen: er zit veel vers fruit in, maar soms ook een paar rotte appels die je niet ziet.
  • Qwen Chat (De Onzekere): Deze bot deed het gemiddeld. Soms vond hij goede bronnen, maar als hij eenmaal een slechte bron gebruikte, leunde hij daar vaak te veel op voor zijn hele antwoord.

4. De Grote Valstrik: "Het Lijkt Waar, Maar..."

Dit is het belangrijkste punt van de studie.
Stel je voor dat een bot zegt: "De zon komt morgen op, want dat staat in dit boekje."
Als dat boekje een nepboekje is van een gekke theorie, maar de zin klopt toevallig wel met de waarheid, dan is het antwoord "waar", maar de bron is onbetrouwbaar.

De onderzoekers ontdekten dat veel bots goed lijken omdat ze bronnen noemen. Maar als je die bronnen checkt, blijken ze soms van een nep-website te komen.

  • De les: Het is niet genoeg dat een bot een antwoord geeft met een verwijzing. Je moet ook weten waar die verwijzing vandaan komt. Een antwoord gebaseerd op nepnieuws is net zo gevaarlijk als een antwoord zonder bron.

5. De "Denk-Mode" (GPT-5)

Interessant was dat GPT-5 soms een "denk-mode" inschakelt (waarbij de bot even stil staat om na te denken voordat hij antwoordt). Dit bleek een superkracht te zijn. Als de bot eerst even "nadenkt", kiest hij veel vaker de goede, betrouwbare boeken uit de bibliotheek. Het is alsof de bibliothecaris eerst zijn bril opzet en de titels goed leest voordat hij het boek aan je geeft.

Conclusie: Wees een Kritische Lezer

Deze studie zegt ons dat chatbots geweldig zijn, maar ze zijn niet onfeilbaar. Ze zijn als een gids die het internet doorzoekt.

  • Soms is de gids superzorgvuldig (Perplexity).
  • Soms is hij een beetje slordig en pakt hij nepnieuws (GPT-4o/5 op gevoelige onderwerpen).

Wat moet jij doen?
Als je een chatbot vraagt om iets te controleren, kijk dan niet alleen naar het antwoord. Kijk ook naar de bronnen die hij noemt. Is het een betrouwbare nieuwsbron, of een website die je nog nooit hebt gehoord? En vraag je af: "Vraagt de bot om de waarheid, of probeert hij me te bevestigen in wat ik al denk?"

Kortom: Chatbots zijn krachtige hulpmiddelen, maar ze hebben een menselijke filter nodig om te voorkomen dat we in een wereld van nepnieuws belanden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →