Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs
यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल (large language models) की बार-बार आने वाले टोकन को गिनने में विफलता उनके आंतरिक रूप से सही गणना को दर्शाने में असमर्थता के कारण नहीं, बल्कि एक विशिष्ट फॉर्मेट-ट्रिगर वाली एमएलपी (MLP) तंत्र के कारण होती है जो आउटपुट जनरेशन के दौरान सटीक प्रतिनिधित्व को एक निश्चित गलत उत्तर के साथ ओवरराइट कर देती है।