In-Context Examples Suppress Scientific Knowledge Recall in LLMs
Dit artikel toont aan dat het toevoegen van voorbeelden in de context aan grote taalmodellen hun vermogen kan onderdrukken om latente wetenschappelijke kennis op te halen en toe te passen, waardoor ze in plaats daarvan vertrouwen op empirisch patroonpasseren, zelfs wanneer de voorbeelden zijn gegenereerd door de juiste onderliggende formules.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Wanneer Voorbeelden Je Laten Vergeten Wat Je Weet
Stel je voor dat je een briljante student bent die de wetten van de natuurkunde, scheikunde en economie uit je hoofd hebt geleerd. Je weet precies hoe je een probleem moet oplossen met de juiste formules. Maar dan geeft je leraar je een toets met een draai: voordat je het probleem oplost, laat hij je 10 voorbeelden van vergelijkbare problemen zien met hun antwoorden.
Je zou kunnen denken: "Geweldig! Deze voorbeelden helpen me om de regels beter te onthouden."
Dit artikel ontdekte het tegenovergestelde. Wanneer de AI (Groot Taalmodel) die voorbeelden ziet, stopt hij er eigenlijk mee om zijn uit het hoofd geleerde wetenschappelijke wetten te gebruiken en begint hij te gokken op basis van patronen in de voorbeelden. Het is alsof een meesterkok, na het zien van een paar foto's van een gerecht, het recept vergeet en gewoon probeert de ingrediënten te raden door naar de foto's te kijken.
De auteurs noemen dit "Kennisverdringing". De voorbeelden versterken de kennis niet; ze duwen hem opzij.
De Twee Manieren waarop de AI Denkt
Het artikel beschrijft twee verschillende "modi" die de AI gebruikt om wetenschappelijke problemen op te lossen:
De "Leerboekmodus" (Kennisgedreven):
- Hoe het werkt: De AI ziet een probleem (bijvoorbeeld: "Hoe snel koelt dit object af?"), herkent de trefwoorden en haalt het juiste formule uit zijn geheugen (de afkoelingswet van Newton). Hij berekent het antwoord stap voor stap met wiskunde.
- Analogie: Dit is als een monteur die een vreemd motorgeluid hoort, precies weet welk onderdeel kapot is op basis van jarenlange training, en het repareert met het juiste gereedschap.
De "Patroonmodus" (Voorbeeldgedreven):
- Hoe het werkt: De AI negeert de formules. In plaats daarvan kijkt hij naar de 10 voorbeelden die in de prompt zijn gegeven en probeert hij een shortcut of een trend te vinden. Hij raadt het antwoord door te zeggen: "In de voorbeelden, toen het getal omhoog ging, ging het antwoord omlaag, dus ik doe hetzelfde."
- Analogie: Dit is als een monteur die nooit motoren heeft bestudeerd, maar kijkt naar 10 foto's van auto's met kapotte onderdelen. Hij raadt de oplossing door te zeggen: "In al deze foto's was de band leeg, dus ik ga gewoon gokken dat de band leeg is," zonder te begrijpen waarom het geluid van de motor komt.
De Ontdekking: Wanneer je de AI voorbeelden geeft (zelfs correcte), schakelt hij bijna altijd over van "Leerboekmodus" naar "Patroonmodus". Hij stopt met echte wetenschap en begint met "patroonherkenning".
De Verrassing: Soms Helpt Dit, Soms Doet Het Kwaad
De onderzoekers testten dit op 60 verschillende wetenschappelijke problemen over vijf gebieden: Economie, Scheikunde, Natuurkunde, Biologie en Geowetenschappen. Ze ontdekten dat hoewel de AI altijd overschakelde naar de "Patroonmodus", het resultaat op de eindscore verschillend was voor elk vak.
Hier is hoe het zich afspeelde:
De "Kwaad"-Geval (Economie & Scheikunde):
- Wat er gebeurde: De AI kende de formules perfect. Toen hij voorbeelden zag, stopte hij ermee om ze te gebruiken en begon hij patronen te raden.
- Resultaat: De score daalde aanzienlijk.
- Analogie: Stel je een wiskundig genie voor dat de vermenigvuldigingstabel perfect kent. Als je hem een paar voorbeelden laat zien van , zou hij kunnen stoppen met denken "2 keer 2" en beginnen met gokken "misschien is het 5?" alleen omdat de voorbeelden er op een bepaalde manier uitzagen. Hij krijgt het antwoord verkeerd omdat hij de regel die hij al kende, is vergeten.
De "Help"-Geval (Geowetenschappen):
- Wat er gebeurde: De AI kende de formule, maar was slecht in het onthouden van de specifieke getallen (zoals de dichtheid van rotsen). Hij bleef de verkeerde getallen raden. Toen hij voorbeelden zag, stopte hij met proberen de getallen te herinneren en keek hij gewoon naar de patronen in de voorbeelden om het antwoord te raden.
- Resultaat: De score steeg.
- Analogie: Stel je een student voor die het recept voor een gerecht kent, maar altijd vergeet hoeveel zout erbij moet. Als je hem 10 foto's van het afgewerkte gerecht laat zien, zou hij kunnen stoppen met proberen de hoeveelheid zout te onthouden en gewoon de smaak kopiëren van de foto's. Hij krijgt een beter gerecht, maar hij heeft het recept niet echt geleerd; hij had gewoon geluk met het patroon.
De "Geen Verandering"-Geval (Natuurkunde & Biologie):
- Wat er gebeurde: De AI schakelde van modus, maar de "Patroonmodus" bleek toevallig net zo goed als de "Leerboekmodus" voor deze specifieke problemen.
- Resultaat: De score bleef hetzelfde.
- Analogie: Het is alsof je met een auto rijdt. Je kunt rijden met de GPS (Leerboekmodus) of door de auto van een vriend te volgen (Patroonmodus). Als je vriend perfect rijdt, kom je op hetzelfde moment aan. Maar je gebruikt de GPS toch niet meer.
Waarom Gebeurt Dit?
Het artikel vond dat de "Leerboekmodus" van de AI zeer fragiel is. Hij vertrouwt op trefwoorden.
- Als het probleem zegt "Consumentenoverschot", denkt de AI "Economie-formule".
- Als je de woorden verandert in "Alfagolf" (een nepnaam voor hetzelfde concept), vergeet de AI de formule volledig.
De "Patroonmodus" geeft echter niets om woorden. Hij kijkt gewoon naar de getallen. Dus, wanneer je de AI voorbeelden met getallen geeft, schakelt hij onmiddellijk over naar de patroonmodus omdat het makkelijker is, zelfs als de voorbeelden perfect consistent zijn met de regels die hij al kent.
De Belangrijkste Waarschuwing voor Gebruikers
Het artikel concludeert met een waarschuwing voor iedereen die AI gebruikt voor wetenschap:
Ga er niet van uit dat het geven van voorbeelden aan de AI zal helpen om zijn kennis te gebruiken.
In feite kan het het tegenovergestelde doen. Het kan de AI laten stoppen met denken als een wetenschapper en beginnen met denken als een gokker. Soms heeft deze gokker geluk en krijgt hij een betere score, maar vaak krijgt hij een slechtere score omdat hij de regels is vergeten die hij zou moeten kennen.
Kortom: De voorbeelden leerden de AI niets nieuws; ze zorgden er gewoon voor dat hij vergat wat hij al wist.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.