← Nieuwste papers
🤖 machine learning

Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

Dit artikel identificeert en corrigeert twee kritieke verstorende factoren in de vergelijking van waarden tussen modellen: responsdeterminisme, dat echte waardeveranderingen verzwakt met de scherpte van gedwongen keuzes, en de toegangsharnas, waarbij model-specifieke cliëntlagen het schijnbare waardeprofiel van een model aanzienlijk veranderen, waardoor rangschikkingen gebaseerd op metingen met één enkele trekking worden vervormd.

Oorspronkelijke auteurs: Hong-In Won, Jinseok Jang, Hyoseop Kim

Gepubliceerd 2026-07-14
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hong-In Won, Jinseok Jang, Hyoseop Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee verschillende merken ijs probeert te proeven om te zien welk merk "zoeter" is. Je neemt één schep van Merk A en één schep van Merk B. Merk A is vanille, en Merk B is ook vanille, maar Merk B wordt geserveerd in een piepklein, supergeconcentreerd shotglas, terwijl Merk A in een enorme, luchtige kom zit. Als je slechts één hapje neemt, zou Merk B heel erg zoet kunnen lijken, simpelweg omdat het zo intens en geconcentreerd is, en niet omdat het ijs zelf fundamenteel anders is.

Dat is precies wat dit artikel ontdekt over Artificial Intelligence (AI) modellen. Al een tijdje vergelijken onderzoekers verschillende AI-modellen door ze één vraag te stellen: "Als je moest kiezen tussen Optie A en Optie B, welke kies je dan?" Ze gingen ervan uit dat als Model X voor A koos en Model Y voor B, de twee modellen totaal verschillende "persoonlijkheden" of "waarden" hadden.

De auteurs, Hong-In Won en Hyoseop Kim, zeggen: "Wacht eens even. Je meet twee verschillende dingen tegelijkertijd, en je verwart ze met elkaar."

De Twee Verwarringen

1. De "Commitment" Verwarring (Determinisme)
De eerste verwarring gaat over hoe sterk een model zich vastlegt op een antwoord.
Stel je twee mensen voor die een quiz beantwoorden.

  • Persoon A is 100% zeker. Ze schreeuwen elke keer als je het vraagt: "A!"
  • Persoon B is een beetje twijfelachtig. Ze zeggen 60% van de tijd "A" en 40% van de tijd "B".

Als je ze slechts één keer vraagt, en Persoon A zegt "A" en Persoon B zegt "B", zou je kunnen denken dat ze totale tegenpolen zijn. Maar dat zijn ze niet! Beiden neigen naar "A". Persoon A is gewoon een luidruchtige, besluitvaardige "A"-fan, terwijl Persoon B een stille, aarzelende "A"-fan is.

Het paper laat zien dat wanneer onderzoekers AI-modellen vergelijken met behulp van slechts één enkel antwoord (een "single-draw"), ze per ongeluk deze "luidheid" of "besluitvaardigheid" tellen als een verschil in waarden.

  • De Bevinding: De auteurs testten negen verschillende AI-modellen. Ze ontdekten dat sommige modellen ongelooflijk besluitvaardig zijn (zoals een model genaamd GPT-5.5, dat een 0,95 scoorde op een schaal van hoe zeker het is), terwijl andere veel zachter zijn (zoals het "Opus"-model van Anthropic, dat slechts een 0,34 scoorde via een specifieke app).
  • De Twist: Deze "besluitvaardigheid" is geen vaste persoonlijkheidseigenschap die je kunt raden door alleen naar de naam van het model te kijken. In één familie van modellen was een kleiner, goedkoper model zelfs besluitvaardiger dan het grote, dure vlaggenschipmodel. In een andere familie was het grotere model juist besluitvaardiger. De auteurs suggereren dat je de "luidheid" van een model niet kunt aannemen door alleen te weten wie het gemaakt heeft of hoe groot het is; je moet het elke keer meten als je het gebruikt.

2. De "Delivery Truck" Verwarring (De Access Harness)
De tweede verwarring is nog sluiperiger. Het gaat niet over het ijs; het gaat over de vrachtwagen die het levert.
De auteurs realiseerden zich dat de manier waarop je een AI een vraag stelt, het antwoord verandert. Ze noemen dit de "access harness" (toegangsharnas).

  • Stel je voor dat je een pizza bestelt. Als je rechtstreeks contact opneemt met de pizzeria (de "Raw API"), krijg je de pizza precies zoals de chef hem heeft gemaakt.
  • Maar als je bestelt via een specifiete bezorgapp (zoals een "CLI" of een abonnementsprogramma), kan die app een briefje aan de keuken toevoegen: "Maak het extra pittig!" of "Laat de klant geen 'nee' zeggen."

De auteurs ontdekten dat voor sommige AI-modellen de "bezorgapp" (de software die wordt gebruikt om met de AI te communiceren) de persoonlijkheid van het model volledig veranderde.

  • Het Bewijs: Ze namen hetzelfde AI-model en stelden het twee keer dezelfde vragen: één keer via de directe verbinding en één keer via een populaire abonnementsapp.
  • Het Resultaat: Via de abonnementsapp zag het "Opus"-model er heel zacht en onzeker uit (0,34). Maar toen ze het direct via de ruwe verbinding vroegen, was het eigenlijk behoorlijk besluitvaardig (0,66). De app had de persoonlijkheid "afgevlakt".
  • De "Weigerings"-truc: In één geval liet de directe verbinding zien dat het model 10% van de tijd weigerde te antwoorden omdat het vond dat de vraag onredelijk was. Maar de abonnementsapp dwong het model om elke keer te antwoorden, waardoor het compliant (gehoorzaam) leek. De auteurs bewezen dat dit werd veroorzaakt door een verborgen "system prompt" (een reeks instructies die de app samen met de vraag meestuurt) die het model vertelde: "Kies gewoon een letter, ga niet in discussie."

Wat dit betekent voor de "Persoonlijkheid" van AI

Dus, wat heeft het paper daadwerkelijk bewezen?

  • Het bewees dat de "afstand" die we zien tussen AI-modellen vaak nep is. Het is een mix van hoe luid ze zijn en welke software we gebruikten om met hen te praten.
  • Het bewees dat de software die we gebruiken om met AI te praten (de "harness") geen neutrale pijp is; het vormt de waarden van de AI actief.
  • Het suggereert (maar lost het niet volledig op) dat "besluitvaardigheid" sterk varieert tussen modellen en niet volgt uit een simpele regel zoals "grotere modellen zijn luider."

Wat is NIET het antwoord?
Het paper sluit expliciet de gedachte uit dat we alleen naar de naam van een model kunnen kijken om de waarden te kennen. Het sluit ook de gedachte uit dat alle verschillen tussen modellen slechts "ruis" zijn.

  • Het Goede Nieuws: Zelfs nadat ze deze twee verwarringen hebben gecorrigeerd, vonden de auteurs dat sommige modellen daadwerkelijk van mening verschillen. Bijvoorbeeld, een model genaamd "Grok-3" wijkt echt in een andere richting af dan modellen van OpenAI of Google bij ongeveer 73% tot 88% van de vragen. Dit zijn echte verschillen, geen meetfouten.
  • Het Slechte Nieuws: De meeste verschillen die we dachten te zien binnen een enkele familie van modellen van hetzelfde bedrijf (zoals tussen verschillende Anthropic-modellen) waren voornamelijk verschillen in hoe luid ze waren, of hoe de app die ze gebruikten hen vormde.

De Conclusie

Als je wilt weten of twee AI-modellen verschillende waarden hebben, kun je ze niet simpelweg één vraag stellen en kijken wat ze zeggen. Je moet:

  1. Dezelfde vraag veel keren stellen om te zien of ze gewoon "luid" zijn of daadwerkelijk "anders".
  2. Er zeker van zijn dat je met hen praat via exact dezelfde "deur" (dezelfde softwareverbinding), omdat de deur zelf hun mening kan veranderen.

De auteurs hebben het mysterie van AI-persoonlijkheden niet voor altijd opgelost, maar ze hebben een betere loep gebouwd om naar ze te kijken. Ze hebben ons laten zien dat wat we dachten een diep filosofisch meningsverschil te zijn, misschien gewoon één AI is die schreeuwt en een andere die fluistert, of één AI die met een bemoeizuchtige manager praat en een andere die met een stille vriend praat. De echte verschillen zijn er, maar je moet de ruis opschonen om ze te kunnen zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →