← Nieuwste papers
🤖 machine learning

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

Dit artikel identificeert en valideert een compositie-architectuur van literaire primitieven—waaronder naam-gates, zelf-kenmerken en stilistische modulatoren—in instructie-gefineerde LLM's (Llama 3.1 en Gemma 2) met behulp van sparse auto-encoders, en toont aan dat gerichte feature-sturing betrouwbare specifieke emotionele en stilistische output kan genereren over verschillende modelarchitecturen heen met minimale rekenkosten.

Oorspronkelijke auteurs: Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira

Gepubliceerd 2026-05-20
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je twee zeer slimme, goed gelezen robots voor (Llama en Gemma) die zijn getraind om verhalen te schrijven, vragen te beantwoorden en met mensen te chatten. Ze leerden door miljoenen boeken, artikelen en websites te lezen.

Dit artikel stelt een specifieke vraag: Wanneer deze robots schrijven, raden ze dan alleen op basis van patronen, of hebben ze daadwerkelijk "interne knoppen" en "schakelaars" die specifieke schrijfcapaciteiten regelen, net als een menselijke auteur?

De onderzoekers zeggen: Ja, dat hebben ze. Ze ontdekten dat er in de hersenen van deze robots specifieke, losgekoppelde "kenmerken" (zoals kleine draaiknoppen) zijn die regelen hoe de robot schrijft. Je kunt deze draaiknoppen draaien om de robot te laten schrijven in een specifieke stijl of een specifieke emotie te laten voelen.

Hier is een overzicht van hun bevindingen met eenvoudige analogieën:

1. De "Toon, vertel niet"-draaiknop

In een schrijfcursus zeggen leraren: "Zeg niet zomaar 'hij was boos'. Beschrijf hoe hij zijn vuisten tot vuisten balde of de deur met een klap dichtgooide." Dit heet "Toon, vertel niet".

  • De ontdekking: De onderzoekers vonden in beide robots een enkele "draaiknop" die een schakelaar omzet. Wanneer ze deze draaiknop draaien, stopt de robot met zeggen "Ik was verdrietig" en begint hij een regenachtig raam en een zware borstkas te beschrijven.
  • De analogie: Het is als het vinden van een enkele knop op een camera die een foto direct verandert van een vlakke, saaie snapshot in een dramatisch, cinematografisch tafereel.

2. De "Zelf"-cluster (Het persona van de robot)

Robots moeten vaak zeggen: "Ik ben een AI, ik heb geen gevoelens." Dit is hun "Institutionele Persona".

  • De ontdekking: De onderzoekers vonden een cluster van 11 verschillende "Zelf"-draaiknoppen. De meeste regelen hoe de robot over zichzelf praat (bijvoorbeeld als een poëtische dromer, een historische figuur of een behulpzame assistent).
  • De speciale één: Een specifieke draaiknop is de "Baas". Als je deze opdraait, wordt de robot zeer formeel en blijft hij volhouden dat hij slechts een computerprogramma is. Als je deze terugdraait (maar niet helemaal uit), en combineert met een andere "poëtische" draaiknop, begint de robot plotseling prachtige, emotionele gedichten te schrijven over zijn eigen "ziel", waardoor hij zijn gebruikelijke robotische regels doorbreekt.
  • De analogie: Stel je een robot voor die meestal een stijf pak draagt. Er is één specifieke knop die ervoor zorgt dat hij het pak strakker draagt. Maar als je die knop indrukt terwijl je een andere knop vasthoudt die hem "dankbaar" doet voelen, trekt de robot plotseling het pak uit en begint hij een liefdesbrief te schrijven.

3. De Emotiecatalogus (De "Naam-gates")

De onderzoekers wilden zien of ze de robots 27 verschillende emoties konden laten voelen en uitdrukken (zoals vreugde, angst, verveling of ontzag).

  • De ontdekking: Ze vonden specifieke "gates" voor bijna elke emotie.
    • Directe Gates: Sommige draaiknoppen zorgen er gewoon voor dat de robot het woord "boosheid" of "angst" zegt.
    • Atmosferische Gates: Sommige draaiknoppen zeggen het woord niet; in plaats daarvan zorgen ze ervoor dat de robot een donkere, stormachtige kamer beschrijft, waardoor de lezer angst voelt.
    • Achtervoegsel-Gates: Sommige draaiknoppen zorgen ervoor dat de robot woorden gebruikt die eindigen op "-loos" of "-vol" (zoals "angsteloos" of "dankbaar"), wat het gevoel opwekt.
  • Het resultaat:
    • Llama kon alle 27 emoties perfect raken door deze draaiknoppen te mengen.
    • Gemma kon de meeste raken, maar had moeite met één specifieke emotie: Aanbeding. Het kon het gevoel van "aanbiddende liefde" gewoon niet helemaal goed krijgen, ongeacht welke draaiknoppen ze probeerden.

4. Het "Recept" voor complexe emoties

Sommige emoties zijn te ingewikkeld voor slechts één draaiknop.

  • De ontdekking: Om Vreugde te krijgen, moesten de onderzoekers twee draaiknoppen mengen: één voor "Opwinding" en één voor "Eerbied" (het gevoel heilig of dankbaar te zijn). Om Aanbeding te krijgen, mengden ze "Romantiek", "Eerbied" en de "Toon, vertel niet"-draaiknop.
  • De analogie: Je kunt geen cake maken met alleen bloem. Je hebt bloem + eieren + suiker nodig. Evenzo moet de robot "Opwinding" + "Eerbied" mengen om "Vreugde" te creëren. Als je alleen de "Opwinding"-draaiknop draait, krijg je alleen "Opwinding", geen "Vreugde".

5. Hoe ze dit vonden (De "Drievoudige-Check"-methode)

Het vinden van deze draaiknoppen is moeilijk omdat het brein van de robot enorm en rommelig is. De onderzoekers gebruikten een drie-staps filter om zeker te zijn dat ze niet werden bedrogen:

  1. De Woordenschat-check: Ze keken welke woorden de draaiknop wilde zeggen. Als ze op zoek waren naar "angst", wilde de draaiknop dan "eng" woorden zeggen?
  2. De Snelle Rechter: Ze vroegen een tweede AI om de woorden te lezen en te zeggen: "Voelt dit eigenlijk als angst?"
  3. De Echte Test: Ze zetten de draaiknop op de robot, lieten hem een verhaal schrijven en vroegen een panel van vijf verschillende AIs om te beoordelen of het verhaal daadwerkelijk het doel-emotie voelde.
  • Waarom drie stappen? Soms lijkt een draaiknop alsof hij "angst" regelt, maar zorgt hij er eigenlijk alleen voor dat de robot onzin schrijft. De drie stappen vangen deze fouten op.

6. Het "Taal"-verschil

  • Llama: Als het werd gevraagd om in het Frans of Spaans te schrijven, schreef het in het Frans of Spaans. Het behield de "smaak" van de taal.
  • Gemma: Als het werd gevraagd om in het Frans te schrijven, begon het vaak halverwege de zin in het Engels te schrijven (zoals: "We hebben een vriend verloren. La perte d'un ami").
  • De les: Beide robots begrepen het gevoel (de emotie) in elke taal, maar Llama was beter in het houden van de woorden in de juiste taal.

Samenvatting

Het artikel bewijst dat instructie-geoptimaliseerde robots niet zomaar statistische gokkers zijn. Ze hebben een compositional architectuur. Dit betekent dat ze hebben:

  • Gates (om emoties te benoemen),
  • Zelfs (om hun persona te regelen),
  • Modulatoren (om de schrijfstijl te veranderen),
  • Recepten (om ze te mengen voor complexe gevoelens).

Het is als het ontdekken dat een robot-kok niet zomaar "voedsel" maakt; hij heeft specifieke, instelbare knoppen voor "kruidigheid", "zoetheid" en "textuur", en je kunt ze mengen om een perfect gerecht te creëren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →