Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities
Dit artikel introduceert "Absurd World", een benchmarkkader dat realistische scenario's systematisch omzet in logisch samenhangende maar absurde contexten om te evalueren of grote taalmodellen robuuste logische redeneervermogens bezitten die onafhankelijk zijn van gememoriseerde realistische patronen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je hebt een zeer slimme robotassistent die bijna elk boek, artikel en elke website op internet heeft gelezen. Je stelt hem een simpele vraag: "Als ik 3 appels heb en er 1 eet, hoeveel heb ik dan nog over?" Hij antwoordt direct "2". Het lijkt perfect.
Maar wat als je de robot vertelt: "In deze magische wereld krijg je, als je een appel eet, eigenlijk een appel bij"? Een mens zou de nieuwe regel direct begrijpen en zeggen: "Oké, dus ik heb nu 4 appels." Maar dit artikel suggereert dat veel van onze huidige AI-assistenten in de war kunnen raken. Ze zouden je nieuwe regel kunnen negeren en gewoon "2" zeggen, omdat dat is wat ze hebben geleerd te verwachten in de "echte wereld".
Dit artikel introduceert een nieuw testterrein genaamd Absurd World om te zien of AI daadwerkelijk jouw regels kan volgen, of dat het gewoon blind zijn eigen geheugen volgt over hoe de wereld normaal werkt.
Het Grote Idee: Het "Magische Voetbal" Spel
De onderzoekers creëerden een eenvoudig spel gebaseerd op een strafschopreeks bij voetbal. In een normaal spel krijg je een punt als je de bal in het net schiet. Als je mist, krijg je niets.
In Absurd World namen ze dit bekende spel en draaiden ze de regels een beetje om, waardoor er "absurde" versies ontstonden die voor mensen nog steeds makkelijk te begrijpen zijn, maar vreemd voor AI:
- De "Mist"-regel: In deze versie krijg je een punt als je het net mist, en krijg je nul als je het net raakt.
- De "Minst"-regel: Het team met het laagste aantal punten wint.
- De "Ijsje"-regel: In plaats van punten verdienen teams ijsjes.
- De "Wissel"-regel: De teams schieten het net op de bal (de rollen van de objecten worden omgewisseld).
Het doel was niet om de wiskunde moeilijk te maken. De wiskunde was nog steeds gewoon simpel tellen. Het doel was om te zien of de AI zijn echte wereldtraining kon ** negeren** en strikt de vreemde, nieuwe instructies in de prompt zou volgen.
Hoe Ze Het Testten
Ze deden alsof ze gekke wetenschappers waren, waarbij ze een standaard voetbalwedstrijd opbraken in bouwstenen:
- Symbolen: De spelers, de bal, het net.
- Acties: Schieten of missen.
- Regels: Hoe punten worden gescoord en wie wint.
Vervolgens wisselden ze deze blokken om om honderden van deze "absurde" scenario's te creëren. Ze vroegen verschillende AI-modellen om een kort verhaal over een wedstrijd te lezen en de winnaar aan te geven.
De Verrassende Resultaten
Het artikel vond drie hoofdconclusies die je misschien doen nadenken over hoe "slim" deze AI's echt zijn:
1. De "Duurdere" Modellen Waren Eigenlijk Slechter
Je zou denken dat de duurste, krachtigste AI-modellen het beste zouden zijn in het volgen van nieuwe regels. Verrassend genoeg deden de "goedkope" modellen het vaak beter dan de "duurde" modellen zonder redeneringsvermogen. De dure modellen leken vast te komen zitten in hun eigen hoofd, waarbij ze te veel vertrouwden op wat ze dachten dat er zou gebeuren in een echt voetbalwedstrijd, in plaats van wat de prompt daadwerkelijk zei.
2. De "Redenerende" Modellen Waren De Kampioenen
De modellen die specifiek waren ontworpen om te "denken" (vaak redenerende modellen genoemd), waren de enigen die een perfecte score behaalden. Ze konden naar de absurde regel kijken ("Misten geeft een punt") en zeggen: "Oké, ik negeer mijn kennis van de echte wereld en volg deze nieuwe regel." Ze raakten niet in de war door de magie.
3. Voorbeelden Geven Werkte averechts
Normaal gesproken, als je AI iets wilt leren, geef je eerst een paar voorbeelden (dit heet "few-shot prompting"). Je zou kunnen zeggen: "Hier is een voorbeeld van hoe je speelt, probeer jij het nu."
- De Twist: In deze studie maakte het geven van voorbeelden aan de AI het slechter. Het leek erop dat het zien van voorbeelden van de "oude" manier van doen de AI in de war bracht toen het probeerde over te schakelen naar de "absurde" regels. Het was alsof je iemand een foto van een kat laat zien voordat je vraagt om een hond te tekenen; ze bleven dan katkenmerken tekenen.
De Conclusie
Het artikel betoogt dat we moeten stoppen met het testen van AI op moeilijke, complexe puzzels. In plaats daarvan moeten we ze testen op simpele taken met rare regels.
Als een AI niet in staat is een simpele regel te volgen die zegt "Mis het doel om te winnen", dan is het misschien niet veilig om het te vertrouwen met complexere taken waarbij de regels verschillen van wat het heeft geleerd in zijn trainingsdata. Absurd World is een tool om te controleren of een AI echt naar je luistert, of dat het gewoon opzegt wat het denkt dat je zou moeten horen.
Kortom: Alleen omdat een AI alles weet over de echte wereld, betekent niet dat het volgens jouw regels kan spelen in een magische wereld. Dit artikel bouwde een speeltuin om uit te vinden welke AI's daadwerkelijk kunnen schakelen en welke vastzitten in de neutraalstand.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.