← Nieuwste papers
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

Dit artikel introduceert ShareChat, een grootschalige, multi-platform dataset van 142.808 real-world chatbot-gesprekken die de native interface-aanbodmogelijkheden behoudt over 95 talen heen om een authentiekere evaluatie van Large Language Models mogelijk te maken die verder gaat dan uniforme, tekst-only benchmarks.

Oorspronkelijke auteurs: Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je bestudeert hoe mensen met robots praten, maar je hebt ze altijd alleen maar door een enkel, plain glazen raam geobserveerd. Je ziet de woorden die ze typen, maar je mist de unieke kenmerken van de ruimte waarin ze zich bevinden: de specifieke gereedschappen aan de muur, de manier waarop de robot hardop nadenkt, of de verschillende manieren waarop verschillende robots zijn ontworpen om te helpen.

Dat is het probleem dat de auteurs van dit artikel, SHARECHAT, proberen op te lossen. Ze hebben een enorme nieuwe bibliotheek gebouwd van echte gesprekken tussen mensen en vijf verschillende AI-chatbots (ChatGPT, Perplexity, Grok, Gemini en Claude) om aan te tonen dat waar je met een AI praat, beïnvloedt hoe je met haar praat.

Hier is een eenvoudige uiteenzetting van wat ze hebben gedaan en wat ze hebben gevonden:

1. Het "Glazen Raam"-probleem

De meeste eerdere studies keken naar AI-gesprekken door een "one-size-fits-all" lens. Ze haalden alle unieke kenmerken van elke app weg om de data gelijk te laten lijken.

  • De Analogie: Stel je voor dat je bestudeert hoe mensen eten bestellen door alleen naar een lijst met ingrediënten te kijken, en je negeert of ze zich bevinden bij een drive-thru van fastfood, een chique restaurant waar je aan tafel zit, of een foodtruck. Je mist de context!
  • De Oplossing: SHARECHAT is als een high-definition video-opname van mensen die bestellen bij al die vijf locaties. Het behoudt de "drive-thru-luidspreker" (de sociale medialink van Grok), de "speciale notities van de chef" (de codetools van Claude) en de "menu-citaties" (de bronlinken van Perplexity).

2. Wat zit er in de bibliotheek?

De onderzoekers verzamelden 142.808 gesprekken (ruim 660.000 heen-en-weer berichten) van mensen die vrijwillig hun chatlinks online deelden.

  • De Grootte: Het is enorm. Terwijl andere bibliotheken korte, afgebroken chats hadden (zoals een snel sms-bericht), bevat SHARECHAT lange, diepgaande gesprekken waarbij gebruikers vervolgvragen stellen, van mening veranderen en complexe problemen oplossen over vele beurten.
  • De Variatie: Het dekt 95 verschillende talen, niet alleen Engels.
  • De Privacy: Ze hebben alle namen, e-mailadressen en telefoonnummers uit de chats verwijderd zodat niemand geïdentificeerd kan worden, net als het wazig maken van gezichten in een menigtefoto.

3. Drie Grote Ontdekkingen (De Casestudies)

De auteurs gebruikten deze bibliotheek om drie specifieke tests uit te voeren om te zien hoe verschillend de robots echt zijn:

A. De "Heb Je Het Begrepen?"-test (Gespreksvolledigheid)
Ze controleerden of de AI daadwerkelijk afrondde wat de gebruiker had gevraagd.

  • De Bevinding: Sommige robots zijn als betrouwbare bibliothecarissen die altijd het hele boek vinden (ChatGPT en Claude). Anderen zijn meer zoals zoekmachines die je een geweldige eerste pagina geven, maar misschien stoppen voordat je het antwoord vindt (Perplexity en Grok). In de echte wereld eindigen veel gesprekken met de gebruiker die slechts gedeeltelijk tevreden is, een nuance die eerdere studies misten omdat ze alleen naar afzonderlijke vragen keken.

B. De "Waar Keek Je Naar?"-test (Bronverankering)
Ze keken hoe twee zoekgerichte robots (Grok en Perplexity) hun antwoorden vonden.

  • De Bevinding: Ze zijn als twee verschillende detectives.
    • Grok is bezeten van sociale media. Het citeert voornamelijk berichten van X (Twitter) en nieuwswebsites, en fungeert als een real-time nieuwsticker.
    • Perplexity is een onderzoeker. Het citeert Wikipedia, wetenschappelijke tijdschriften en forums zoals Reddit, en fungeert als een bibliothecaris die door archieven grift.
    • De Les: Ze zijn niet zomaar "AI"; ze zijn gebouwd met verschillende tools voor verschillende taken.

C. De "Snelheid van Denken"-test (Timing)
Ze maten hoe lang het duurde voordat gebruikers een reactie typten nadat de AI had gesproken.

  • De Bevinding: Het ritme van het gesprek verandert afhankelijk van de robot.
    • Bij ChatGPT wordt de robot sneller naarmate het gesprek vordert (misschien leert het je stijl of cacheert het antwoorden).
    • Bij Grok wordt de robot trager naarmate het gesprek langer wordt (misschien wordt het overweldigd door de hele geschiedenis).
    • Dit toont aan dat de "persoonlijkheid" van de chat niet alleen gaat over de woorden; het gaat om de timing en het verloop.

4. Waarom Dit Belangrijk Is

Het artikel betoogt dat als we AI alleen bestuderen door een generieke, afgevlakte lens, we het belangrijkste deel missen: de realiteit van de gebruiker.

  • Het Echte Leven is Rommelig: Mensen stellen niet gewoon één vraag en gaan dan weg. Ze hebben lange, kronkelende gesprekken.
  • Tools Maken Uit: Gebruikers behandelen verschillende AI's als verschillende tools. Ze gebruiken er één voor coderen, een andere voor nieuws, en weer een andere voor creatief schrijven.
  • Betere Training: Door onderzoekers deze "wereldwijde" data te geven met al zijn unieke kenmerken intact, kunnen we betere AI bouwen die niet alleen begrijpt wat er gezegd moet worden, maar ook hoe het gezegd moet worden in de specifieke context van de app waarin het leeft.

Kortom: SHARECHAT is een enorme, diverse verzameling van echte AI-chats die bewijst dat we deze robots niet kunnen begrijpen door ze in een vacuüm te bekijken. We moeten ze zien in hun natuurlijke habitat om te begrijpen hoe ze echt werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →