← Nieuwste papers
📊 statistics

The Information Geometry of Softmax: Probing and Steering

Dit artikel onderzoekt hoe AI-systemen semantische structuur coderen in de informatiegeometrie van hun representatieruimten en introduceert een methode genaamd "dual steering" om concepten robuust te manipuleren met behulp van lineaire probes.

Oorspronkelijke auteurs: Kiho Park, Todd Nief, Yo Joong Choe, Victor Veitch

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kiho Park, Todd Nief, Yo Joong Choe, Victor Veitch

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorm, complex schip probeert te sturen (een AI-model) naar een specifieke bestemming (een nieuw concept, zoals een zin veranderen van "hij" naar "zij" of een afbeelding van een "hond" naar een "kat").

Een lange tijd probeerden onderzoekers dit schip te sturen door simpelweg het stuurwiel in een rechte lijn te duwen. Ze namen aan dat de oceaan vlak en uniform was, als een gigantische ijsplaat. Als ze naar het Noorden wilden, duwden ze het stuur gewoon naar het Noorden. Dit wordt Euclidische sturing genoemd.

Dit artikel betoogt echter dat de oceaan waarop AI-modellen varen niet uit vlak ijs bestaat. Het is eigenlijk een gebogen, bobbelig landschap waar de "nabijheid" van twee punten afhangt van hoe vergelijkbaar het gedrag van het schip is, en niet alleen van hoe ver ze op een kaart uit elkaar liggen. De auteurs noemen dit Informatiegeometrie.

Hier is de uiteenzetting van hun ontdekking en hun nieuwe methode, Dual Steering, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Vlakke Kaart"-valstrik

Het paper begint met de stelling dat de meeste huidige methoden de interne gedachten (representaties) van AI behandelen alsof ze in een platte, rechte wereld bestaan.

  • De Analogie: Stel je voor dat je twee kleuren verf mengt. Als je rood en blauw in een rechte lijn mengt, krijg je paars. Maar als je kansen mengt (zoals de kans op regen versus de kans op zonneschijn), is de wiskunde anders.
  • Het Probleem: Wanneer onderzoekers de AI in een rechte lijn duwen om iets te veranderen (bijv. "hond" naar "kat"), laten ze per ongeluk overal verf morsen. De AI kan plotseling over "fietsen" of "wolken" gaan praten, simpelweg omdat de rechtlijnige duw de balans van het hele systeem heeft verstoord. Dit wordt "off-target lekkage" genoemd.

2. De Oplossing: De "Gebogen Kaart" (Informatiegeometrie)

De auteurs realiseerden zich dat de "hersenen" van de AI werken als een kansmachine. Wanneer de AI beslist welk woord hij als volgende moet zeggen, gebruikt hij een wiskundig hulpmiddel genaamd Softmax om getallen om te zetten in percentages (kansen).

  • Het Inzicht: Omdat de AI met kansen werkt, is de ruimte waarin hij leeft gebogen. In deze gebogen ruimte is het "rechtste" pad geen rechte lijn; het is een curve die de regels van de waarschijnlijkheid respecteert.
  • De Analogie: Denk aan de Aarde. Als je van New York naar Londen wilt vliegen, is de kortste route geen rechte lijn door de grond, maar een curve langs het oppervlak (een grootcirkel). Als je in een rechte lijn door de Aarde zou proberen te vliegen, zou je neerstorten. Op dezelfde manier, als je probeert een AI in een "rechte lijn" door zijn gebogen waarschijnlijkheidsruimte te sturen, stort je neer in ongewenste concepten.

3. De Nieuwe Methode: "Dual Steering"

Het paper introduceert een nieuwe manier om de AI te sturen, genaamd Dual Steering. In plaats van de AI in een rechte lijn te duwen (Euclidisch), duwen ze hem langs de natuurlijke curven van de waarschijnlijkheidsruimte.

  • Hoe het werkt:

    • Euclidische Sturing (De Oude Manier): Je grijpt het stuurwiel vast en trekt het recht naar "Kat". Hierbij stoot je per ongeluk de "Hond" en "Vogel" beelden op het dashboard omver.
    • Dual Steering (De Nieuwe Manier): Je navigeert met behulp van een speciale kaart die weet dat het terrein gebogen is. Je stuurt het schip langs een pad dat de "Hond" verandert in een "Kat" zonder de "Vogel" of "Fiets" beelden aan te raken.
  • Het "Dual" Concept: Het paper legt uit dat er twee manieren zijn om de data van de AI te bekijken:

    1. Primal Space: De ruwe getallen die de AI ziet.
    2. Dual Space: De werkelijke kansen (het gedrag) die de AI produceert.
      De auteurs ontdekten dat om het gedrag schoon te veranderen, je de sturing in de "Dual Space" (de wereld van kansen) moet doen en dit vervolgens terug moet vertalen naar de ruwe getallen.

4. Wat Ze Hebben Bewezen

De auteurs hebben wiskundig bewezen dat Dual Steering de "Goldilocks"-methode is (de methode die precies goed is):

  • Het verandert succesvol het doelconcept (bijv. zorgt dat de AI "kat" zegt in plaats van "hond").
  • Het minimaliseert de schade aan alles wat eromheen komt. Het houdt de waarschijnlijkheid van ongerelateerde zaken (zoals "vriend" of "fiets") exact hetzelfde als ze daarvoor waren.

5. Praktijktests

Ze hebben dit getest op echte AI-modellen (zoals Gemma-3 voor tekst en MetaCLIP voor afbeeldingen).

  • Tekstvoorbeeld: Wanneer ze de AI vroegen om een zin te veranderen van "Hij is mijn..." naar "Zij is mijn...", zorgde de oude methode er per ongeluk voor dat de AI op vreemde manieren over "vrienden" of "neven/tantes" begon te praten. De nieuwe methode veranderde "Hij" naar "Zij" perfect, terwijl de rest van de zinsstructuur en de betekenis intact bleven.
  • Afbeeldingvoorbeeld: Wanneer ze een afbeelding van een "kat" veranderden in een "hond", voegde de oude methode soms per ongeluk een "hond-kat hybride" of een "fiets" toe aan de afbeelding. De nieuwe methode verving de kat voor een hond op een schone manier, waarbij de achtergrond en andere objecten ongemoeid bleven.

Samenvatting

Het paper beweert dat AI-modellen niet op een platte kaart leven, maar op een gebogen, op waarschijnlijkheid gebaseerd landschap. Als je probeert ze met een rechte lijn te sturen, veroorzaak je chaos. Door Dual Steering te gebruiken, wat de natuurlijke curven van dat landschap respecteert, kun je de AI van gedachten doen over één specifiek ding zonder per ongelien de rest van de boel te breken.

Noot: Het paper richt zich strikt op de geometrie van hoe deze modellen werken en hoe je ze kunt sturen met lineaire probes. Het claimt geen algemene AI-veiligheidsproblemen op te lossen, noch bespreekt het klinische of medische toepassingen. Het gaat puur over het preciezer maken van het "stuur" van AI en het minder waarschijnlijk maken van onbedoelde bijwerkingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →