← Nieuwste papers
💬 NLP

Expectation, Backlash, Recovery, and Excitement: How Model Releases Shape Reddit Perceptions of Conversational AI Systems

Dit artikel analyseert langdurige discussies op Reddit om aan te tonen dat de releases van conversationele AI-modellen dynamische, door gebruikers ervaren interventies zijn die het publieke sentiment en het discours aanzienlijk hervormen, waarbij duidelijke patronen van verwachting, weerstand en herstel worden waargenomen bij aanbieders zoals Anthropic, OpenAI, Grok en DeepSeek.

Oorspronkelijke auteurs: Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

Gepubliceerd 2026-08-26
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Verwachting, Terugslag, Herstel en Enthousiasme

Probleemstelling

Conversational AI-systemen (CAISes) zijn geen statische producten; ze evolueren continu door modelreleases, feature-updates, veiligheidsinterventies en verschuivingen in toegangsbeleid. Waar eerder onderzoek uitgebreid de perceptie van gebruikers van AI heeft in kaart gebracht via statische momentopnames (enquêtes, dwarsdoorsneden van sociale media), schieten deze benaderingen tekort in het vastleggen van de dynamische aard van gebruikerssentiment als reactie op specifieke systeeminterventies. De bestaande literatuur behandelt modelwijzigingen vaak als louter technische updates, waarbij de sociale en relationele impact op gebruikers wordt genegeerd. Deze studie adresseert het gat in het begrip van hoe de perceptie van gebruikers van CAISes dynamisch verschuift voor en na specifieke modelrelease-events bij meerdere aanbieders.

Methodologie

De auteurs voerden een langdurige, grootschalige analyse uit van Reddit-discussies van oktober 2022 tot december 2025, waarbij 20 subreddits en 668.063 berichten werden behandeld. De methodologie is gestructureerd rond een "release-gecentreerd ontwerp" waarbij modelreleases worden behandeld als interventiepunten.

1. Dataconstructie en Normalisatie:

  • Corpus: Berichten werden gefilterd uit 20 relevante subreddits (bijv. r/ChatGPT, r/ClaudeAI, r/grok) met een focus op zes grote aanbieders: OpenAI, Anthropic, Google, xAI, Meta en DeepSeek.
  • Extractie van vermeldingen: Er werd een taxonomie-gestuurde LLM-pipeline ontwikkeld om modelvermeldingen te identificeren en te normaliseren in een vierniveau-hiërarchie: <aanbieder, familie, generatie, tier>. Deze taxonomie, afgeleid van de LLM Arena leaderboard, bracht 189 vermeldingen over 9 aanbieders in kaart. De extractor behaalde een hoge precisie (F1 > 0,95) bij het mappen van ruwe tekst naar dit schema.
  • Filtering: De analyse richtte zich op "single-mention" berichten om de duidelijkheid van attributie te waarborgen, wat resulteerde in een dataset van 363.546 berichten met 505.250 modelvermeldingen.

2. Meting van Perceptie:

  • Sentimentclassificatie: Een door mensen gevalideerde LLM-classifier wijsde berichten toe aan de categorieën positief, neutraal of negatief op basis van expliciet tekstueel bewijs. De classifier behaalde een gewogen F1 van 0,82 ten opzichte van menselijke meerderheidslabels.
  • Thematische Conceptinductie: Door het LLooM-framework aan te passen, induceerden de auteurs 236 interpreteerbare "Canonieke Concepten" (bijv. "Coding Productivity," "Expectation Gap," "Forced Upgrade Frustration") uit het corpus. Deze concepten werden tegen berichten gescoord met behulp van inclusiecriteria, waardoor het mogelijk was om de thematische prevalentie te volgen zonder afhankelijk te zijn van vooraf gedefinieerde taxonomieën.

3. Interventieanalyse:

  • Window Design: Voor elke modelrelease werden symmetrische pre- en post-release vensters gedefinieerd op basis van aanbieder-specifieke statistieken over de release-gap (variërend van 25 dagen voor DeepSeek tot 104 dagen voor Google).
  • Delta-berekening: De studie berekende sentiment-delta's (verandering in het aandeel positieve/negatieve berichten) en concept-delta's (verandering in conceptprevalentie) tussen de pre- en post-release vensters. Statistische significantie werd beoordeeld met chi-kwadraat-testen en twee-proportie z-testen met Benjamini-Hochberg FDR-correctie.

Belangrijkste Resultaten

1. Lange-termijn Sentimenttrends:

  • OpenAI en Google: Beiden vertoonden een langetermijnverschuiving van neutraal naar negatief sentiment. Voor OpenAI daalde het neutrale sentiment met ~19 procentpunten (pp) terwijl het negatieve sentiment met ~19 pp steeg over de observatieperiode.
  • Anthropic: Viel op als de enige aanbieder die een positieve trend liet zien, waarbij het positieve sentiment steeg van ~20% naar ~35% en het negatieve sentiment significant daalde.
  • Meta: Toonde een neutraal-naar-positieve verschuiving, terwijl xAI en DeepSeek geen duidelijke langetermijnrichting vertoonden vanwege kortere observatievensters of hoge volatiliteit.

2. Release-specifieke Dynamiek:

  • Anthropic (Claude 4): Toonde het duidelijkste positieve interventieprofiel (+5,3 pp positief, -10,5 pp negatief). Dit werd gedreven door de publieke release van "Claude Code", die de modelcapaciteiten afstemde op gebruikersworkflows (coding/automatisering), waardoor het discours verschoof van algemene productiviteit naar specifieke programmeerproductiviteit.
  • OpenAI (GPT-5): Veroorzaakte de sterkste negatieve verschuiving (-3,5 pp positief, +10,3 pp negatief). De backlash werd gekenmerkt door "Forced Upgrade Frustration" en "Feature Removal Frustration", waarbij gebruikers het gevoel hadden een "persoonlijke metgezel" te verliezen en geconfronteerd werden met onderbroken workflows.
  • OpenAI (GPT-5.1): Toonde een gedeeltelijk herstel, waarbij het volume aan backlash-concepten afnam, maar het enthousiasme niet volledig werd hersteld, wat wijst op een verschuiving van platform-brede opstand naar nauwere productklachten.
  • DeepSeek R1: Veroorzaakte een "demand shock" met een 19-voudige toename in berichtvolume. Het sentiment was gemengd: hoge lof voor engineering-capaciteiten ("Model Comparison & Evaluation") ging samen met ernstige frustratie over toegang, betrouwbaarheid en censuur ("Reliability Availability Frustration").
  • xAI (Grok 3): Produceerde een verdeelde ontvangst met gelijktijdige toenames in zowel positief als negatief sentiment. Het discours was sterk gepolitiseerd en koppelde modelprestaties aan de identiteit van de aanbieder (Elon Musk) en politieke agenda's, naast standaard betrouwbaarheidszorgen.
  • OpenAI (GPT-4o): Gekenmerkt door een enorme "Expectation Gap" (+19,4 pp). Gebruikers reageerden op de discrepantie tussen de "omni" demo-mogelijkheden (real-time stem, video) en de beperkte functies bij de lancering, wat leidde tot gemengd sentiment gedreven door toegangsbeperkingen in plaats van modelkwaliteit alleen.

Betekenis en Claims

Het artikel beweert dat modelreleases niet louter technische updates zijn, maar "gebruikersgerichte interventies" die publieke discussie, sentiment en verwachtingen hervormen. De studie toont aan dat:

  1. Percepties Dynamisch Zijn: Statische momentopnames zijn onvoldoende; gebruikersvertrouwen en sentiment zijn zeer gevoelig voor specifieke typen interventies (bijv. gedwongen upgrades versus de beschikbaarheid van nieuwe functies).
  2. Aanbiederidentiteit Ertoe Doet: De ontvangst van een release wordt diep beïnvloed door de merkidentiteit van de aanbieder, de politieke houding en de relatie met de gebruiker (bijv. de "relationele hechting" aan GPT-4o versus de "engineering bewondering" voor DeepSeek).
  3. Product-Model Fit Cruciaal Is: Succesvolle releases (zoals Claude 4) stemmen technische capaciteiten af op duidelijke gebruikersworkflows, terwijl mislukkingen vaak voortkomen uit misalignement van verwachtingen (GPT-4o) of gedwongen veranderingen die gevestigde gebruikersgewoonten verstoren (GPT-5).

De auteurs concluderen dat aanbieders releases moeten behandelen als consequente socio-technische gebeurtenissen, waarbij ze de aankondiging van capaciteiten moeten afstemmen op de werkelijke toegang, modelcontinuïteit moeten waarborgen tijdens transities en gebruikersreacties over tijd moeten monitoren in plaats van de ontvangst als een eenmalige gebeurtenis te behandelen.

Beperkingen

De studie erkent verschillende beperkingen:

  • Databron: De analyse is beperkt tot tekstgebaseerde Reddit-berichten, waardoor multimedia-content wordt uitgesloten en mogelijk technisch betrokken vroege adoptanten worden oververtegenwoordigd.
  • AI-gegenereerde Content: De dataset kan AI-gegenereerde of door AI ondersteunde berichten bevatten, die moeilijk te filteren zijn.
  • Methodologische Beperkingen: Het gebruik van LLM's voor extractie en classificatie introduceert potentiële fouten, en de batch-gebaseerde conceptinductie kan redundantie introduceren.
  • Window Sensitivity: Hoewel robuustheidscontroles stabiliteit tonen, kan de keuze voor symmetrische vensters directe, kortstondige reacties kunnen afvlakken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →