Probability Distributions Computed by Autoregressive Transformers
Dit artikel karakteriseert de kansverdelingen die door autoregressieve transformer-taalmodellen kunnen worden uitgedrukt, en toont aan dat hun autoregressieve en probabilistische aard de expressiviteit kan vergroten en equivalenties kan doorbreken die worden aangetroffen in niet-probabilistische taalherkenners.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een Transformer (het AI-model achter tools zoals ChatGPT) voor als een zeer slimme, maar lichtjes stijve, robotbibliothecaris. Jarenlang hebben onderzoekers deze bibliothecaris bestudeerd door hem een simpele "Ja of Nee"-vraag te stellen: "Hoort dit specifieke boek in het 'Science Fiction'-gedeelte?" Als de robot "Ja" zegt, wordt het boek geaccepteerd; als "Nee", wordt het afgewezen. Dit is wat het paper een Classificator noemt.
In de echte wereld vragen we de bibliothecaris echter niet alleen om boeken te sorteren. We vragen hem om een verhaal te schrijven. We geven hem de eerste paar woorden, en hij raadt het volgende woord, dan het volgende, en dan het volgende, waardoor hij een kansverdeling creëert (een gok over wat er als volgt komt). Dit is wat het paper een Autoregressor noemt.
Het paper stelt een fundamentele vraag: Is de robot beter in het schrijven van verhalen dan in het sorteren van boeken? Of, omgekeerd, zegt zijn vermogen om boeken te sorteren ons alles wat we moeten weten over zijn vermogen om te schrijven?
Hier is de uiteenzetting van hun bevindingen met behulp van eenvoudige analogieën:
1. De Twee Manieren van Denken
De auteurs realiseerden zich dat het meeste eerdere onderzoek de Transformer behandelde als een Rechter (Classificator), terwijl de daadwerkelijke AI die we gebruiken werkt als een Verhalenschrijver (Autoregressor).
- De Rechter: Kijkt naar een hele zin en zegt: "Waar" of "Onwaar".
- De Verhalenschrijver: Kijkt naar een zin tot nu toe en zegt: "Er is een 90% kans dat het volgende woord 'kat' is en een 10% kans dat het 'hond' is."
2. De "Booleaanse" Wereld (Het Eenvoudige Geval)
Stel je een wereld voor waarin de robot alleen zwart en wit hanteert (Waar/Onwaar).
- De Bevinding: In deze eenvoudige wereld zijn de Rechter en de Verhalenschrijver in wezen dezelfde persoon. Als de robot een boek correct kan sorteren, kan hij ook een verhaal schrijven dat dezelfde regels volgt, en omgekeerd.
- De Haken en Ogen: Hoewel ze even krachtig zijn, heeft de Verhalenschrijver soms een veel complexer intern "handleiding" (logica) nodig om dezelfde taak te verrichten als de Rechter. Het is alsof de Rechter een patroon direct kan herkennen, maar de Verhalenschrijver een lang, complex recept moet schrijven om datzelfde patroon woord voor woord te genereren.
3. De "Real-Gewogen" Wereld (Het Complexe Geval)
Stel je nu voor dat de robot werkt met schakeringen van grijs (kansen, zoals 0,5, 0,9, enzovoort). Dit is hoe echte AI werkt.
- De Bevinding: Hier zijn de Rechter en de Verhalenschrijver niet hetzelfde. Ze hebben verschillende superkrachten.
- De Verhalenschrijver is flexibeler: Hij kan bepaalde soorten kanspatronen genereren die de Rechter simpelweg niet kan herkennen.
- De Rechter is stijver: Er zijn specifieke kanspatronen die de Rechter kan identificeren die de Verhalenschrijver niet kan genereren, omdat de Verhalenschrijver strikte regels moet volgen om ervoor te zorgen dat zijn kansen altijd optellen tot 100%.
- De Analogie: Denk aan de Rechter als een beveiligingsagent die een nep-ID direct kan herkennen. De Verhalenschrijver is een vervalser die probeert een nep-ID te maken. Soms kan de vervalser een nep-ID maken die de agent niet opmerkt (omdat de agent alleen controleert tegen een specifieke lijst). Maar soms is de vervalser zo gebonden aan de regels van papier en inkt dat hij geen specifiek type nep-ID kan maken dat de agent gemakkelijk kan herkennen.
4. De "Tijdsreizen"-Logica
Het paper maakt gebruik van een speciale vorm van logica genaamd "Lineaire Temporele Logica" (LTL) om te beschrijven wat deze robots kunnen doen. Het is als een set regels voor tijdsreizen:
- "Gisteren" (Y): Terugkijken naar het vorige woord.
- "Historisch" (H): Terugkijken naar alle vorige woorden.
- "Sinds" (S): Terugkijken vanaf een specifiek punt.
De auteurs ontdekten dat:
- Als de robot toegang heeft tot "Gisteren" en "Historisch" (terugkijken), de Rechter en Verhalenschrijver gelijk zijn.
- Als de robot beperkt is (bijvoorbeeld, hij kan alleen een paar stappen terugkijken of alleen "Historisch" gebruikt), wordt de Verhalenschrijver strikt krachtiger dan de Rechter. De Verhalenschrijver kan patronen verwerken die de beperkte Rechter niet aankan.
5. Het "Tellen"-Probleem
Het paper keek ook naar robots die goed zijn in tellen (zoals het tellen van hoeveel 'a's er in een string voorkomen).
- Eerdere onderzoeken toonden aan dat deze robots als Rechter alleen konden tellen tot een bepaald limiet, gebaseerd op hun grootte.
- Als Verhalenschrijvers konden ze echter iets complexere teltaken aan. De daad van het stap voor stap voorspellen van het volgende woord gaf hen een klein beetje meer "hersencapaciteit" dan het gewoon beoordelen van de hele string in één keer.
Samenvatting
De belangrijkste conclusie is dat we niet kunnen aannemen dat wat een Transformer kan doen als een "Rechter" (patronen herkennen) exact hetzelfde is als wat hij kan doen als een "Verhalenschrijver" (tekst genereren).
- In simpele, zwart-wit scenario's zijn ze grotendeels hetzelfde.
- In het complexe, realistische scenario van kansen heeft de "Verhalenschrijver" unieke vaardigheden die de "Rechter" niet heeft, en omgekeerd.
Dit betekent dat wetenschappers voorzichtig moeten zijn bij het testen van AI-vaardigheden. Het feit dat een robot faalt in een "sorteertest" betekent niet dat hij zal falen in "een verhaal schrijven", en een robot die geweldig is in sorteren, kan worstelen met de specifieke regels van het genereren van een verhaal. Het paper biedt een kaart om precies te begrijpen waar deze verschillen liggen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.