Function-Vector Heads Are Two Populations: Writers and Cancellers in In-Context Learning
यह शोध पत्र इस धारणा को चुनौती देता है कि फंक्शन-वेक्टर हेड्स (function-vector heads) एक सजातीय समूह हैं, यह प्रकट करते हुए कि वे दो विरोधी उप-जनसंख्याओं—सही नियमों को बढ़ावा देने वाले 'राइटर्स' (writers) और उन्हें दबाने वाले 'कैंसलर्स' (cancellers)—से बने हैं, जो केवल परिमाण-आधारित रैंकिंग (magnitude-only ranking) के लिए अदृश्य हैं लेकिन जब उनकी पहचान कर ली जाती है और उन्हें हटाया (ablated) जाता है, तो मॉडल के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़े लैंग्वेज मॉडल (जैसे वे जो आपसे चैट करते हैं) की कल्पना एक विशाल ऑर्केस्ट्रा के रूप में करें जो कुछ उदाहरणों के आधार पर एक पहेली को हल करने की कोशिश कर रहा है। इस ऑर्केस्ट्रा में, विशिष्ट संगीतकार हैं जिन्हें अटेंशन हेड्स (attention heads) कहा जाता है। लंबे समय तक, शोधकर्ताओं का मानना था कि सबसे महत्वपूर्ण संगीतकार वे थे जो बस सबसे तेज़ स्वर बजा रहे थे। उन्होंने माना कि यदि कोई संगीतकार बहुत ज़ोर से बजा रहा था, तो वह निश्चित रूप से ऑर्केस्ट्रा को सही धुन बजाने में मदद कर रहा था।
हालाँकि, यह शोध पत्र खोज निकालता है कि यह धारणा गलत है। यह पता चला है कि "सबसे तेज़" संगीतकार वास्तव में दो पूरी तरह से अलग, विरोधी समूहों से संबंधित हैं: लेखक (The Writers) और निरस्त करने वाले (The Cancellers)।
इस शोध के निष्कर्षों का विवरण यहाँ दिया गया, जिसमें सरल उपमाओं का उपयोग किया गया है:
1. बड़ी गलतफहमी: वॉल्यूम बनाम दिशा
पहले, शोधकर्ता इन संगीतकारों को देखते थे और उन्हें वॉल्यूम (उनके योगदान की मात्रा) के आधार पर रैंक करते थे। उन्होंने माना कि शीर्ष 20 सबसे तेज़ संगीतकार सभी "सहायक" थे।
इस शोध के लेखकों ने महसूस किया कि केवल वॉल्यूम पर्याप्त नहीं है; आपको दिशा जानने की आवश्यकता है।
- लेखक (The Writers): ये संगीतकार एक तेज़ स्वर बजाते हैं जो ऑर्केस्ट्रा को सही उत्तर की ओर धकेलता है।
- निरस्त करने वाले (The Cancellers): ये संगीतकार भी एक तेज़ स्वर बजाते हैं, लेकिन वे ऑर्केस्ट्रा को गलत उत्तर की ओर धकेलते हैं। वे सक्रिय रूप से सही उत्तर को रद्द करने की कोशिश कर रहे हैं।
उपमा: रस्साकशी (tug-of-war) की कल्पना करें।
- लेखक वह टीम है जो रस्सी को फिनिश लाइन की ओर खींच रही है।
- निरस्त करने वाले दूसरी टीम है जो उतनी ही ज़ोर से खींच रही है, लेकिन विपरीत दिशा में।
- यदि आप केवल यह देखते हैं कि वे कितनी ज़ोर से खींच रहे (परिमाण/magnitude), तो आपको लगता है कि वे दोनों समान रूप से महत्वपूर्ण "खींचने वाले" हैं। लेकिन यदि आप दिशा देखते हैं, तो आप देखते हैं कि वे एक-दूसरे से लड़ रहे हैं।
2. खोज: दो आबादी (Two Populations)
शोधकर्ताओं ने इसे कई अलग-अलग मॉडलों (छोटे से लेकर बड़े तक) और विभिन्न प्रकार की तर्क पहेलियों पर परखा। उन्होंने पाया कि लगभग हर मामले में, "शीर्ष" संगीतकार इन दो विरोधी समूहों में विभाजित हो जाते हैं।
- "लेखक" सही उत्तर की संभावना को बढ़ाते हैं।
- "निरस्त करने वाले" सही उत्तर की संभावना को कम करते हैं।
जब शोधकर्ताओं ने निरस्त करने वालों को चुप कराया (एब्लेट किया/silenced), तो मॉडल पहेलियों को हल करने में वास्तव में बेहतर हो गया। यह रस्साकशी की टीम से एक तोड़-फोड़ करने वाले (saboteur) को हटाने जैसा था; अचानक, "लेखक" बिना किसी प्रतिरोध के रस्सी को फिनिश लाइन तक खींच सके।
3. पिछले शोध ने इसे क्यों मिस कर दिया
यह पेपर बताता है कि पिछले अध्ययनों (जैसे टॉड एट अल., 2024) ने एक ऐसी विधि का उपयोग किया जो केवल योगदान की "तेज़ी" (loudness) को देखती थी। इस कारण से, उन्होंने अनजाने में लेखकों और निरस्त करने वालों का मिश्रण पकड़ लिया, और यह मिश्रण पहेली के आधार पर बदलता रहता था।
- कुछ पहेलियों पर, "निरस्त करने वाले" अधिक तेज़ थे, इसलिए पुराने तरीके ने सोचा कि वे मुख्य सहायक हैं।
- अन्य पहेलियों पर, "लेखक" अधिक तेज़ थे, इसलिए पुराने तरीके ने सोचा कि वे मुख्य सहायक हैं।
यह पेपर दिखाता है कि "चिह्न" (sign/दिशा) को अनदेखा करके, पिछला शोध अनिवार्य रूप से नायकों और खलनायकों को मिला रहा था, यह सोचकर कि वे सभी केवल "तेज़ सहायक" हैं।
4. क्या निरस्त करने वाले केवल गलतियाँ हैं?
शोधकर्ता यह सुनिश्चित करना चाहते थे कि "निरस्त करने वाले" मॉडल के टूटे हुए हिस्से या आकस्मिक शोर (noise) नहीं हैं:
- वे अलग चीज़ें पढ़ते हैं: लेखक उदाहरणों में "लेबल" (उत्तरों) पर ध्यान केंद्रित करते हैं। निरस्त करने वाले "फॉर्मेट" (विराम चिह्न और स्पेसिंग) पर ध्यान केंद्रित करते हैं। वे पृष्ठ के अलग-अलग हिस्सों को देख रहे हैं।
- वे सामग्री-संचालित (content-driven) हैं: निरस्त करने वाले केवल उत्तरों को बेतरतीब ढंग से दबा नहीं रहे हैं; वे विशेष रूप से उस उत्तर को दबाने की कोशिश कर रहे हैं जो अभी-अभी उदाहरणों में प्रदर्शित किया गया था।
- वे "कॉपी सप्रेसर" नहीं हैं: पेपर ने इस विचार को खारिज कर दिया कि ये केवल सामान्य "कॉपी न करने" वाले तंत्र हैं। वे कार्य के तर्क के प्रति विशिष्ट हैं।
5. "L11.H4" चरित्र अध्ययन
पेपर एक विशिष्ट संगीतकार, L11.H4 पर ज़ूम करता है, यह देखने के लिए कि यह कैसे काम करता है।
- यह तर्क पहेलियों (logic puzzles) पर एक "निरस्त करने वाला" है (यह गलत उत्तर की ओर धकेलता है)।
- हालाँकि, यदि आप पहेली को शब्दावली कार्य (जैसे विलोम शब्द मिलाना) में बदल देते हैं, तो यही संगीतकार अपनी भूमिका बदल देता है और एक "लेखक" बन जाता है (यह सही उत्तर में मदद करता है)।
- सबक: यह संगीतकार स्वाभाविक रूप से "अच्छा" या "बुरा" नहीं है। इसका काम है जो अभी प्रदर्शित किया गया है उसे दबाना। यदि प्रदर्शन सही उत्तर है, तो यह उसे दबाता है (निरस्त करने वाला)। यदि प्रदर्शन गलत उत्तर है (एक अलग संदर्भ में), तो यह गलत उत्तर को दबाता है, जिससे प्रभावी रूप से सही उत्तर की मदद मिलती है (लेखक)।
6. मुख्य निष्कर्ष (The Takeaway)
मुख्य निष्कर्ष यह है कि हम एआई मॉडल के सबसे "सक्रिय" हिस्सों को एक एकल, समान समूह के रूप में नहीं मान सकते।
- पुराना दृष्टिकोण: "ये शीर्ष 20 सबसे महत्वपूर्ण हेड्स हैं। आइए इनका उपयोग मॉडल को निर्देशित करने के लिए करें।"
- नया दृष्टिकोण: "ये शीर्ष 20 हेड्स वास्तव में एक गृहयुद्ध (civil war) हैं। आधे मॉडल को सही जगह धकेल रहे हैं, और आधे उसे गलत जगह धकेल रहे हैं। यदि आप मॉडल को निर्देशित करना चाहते हैं, तो आपको केवल लेखकों को बढ़ाने के बजाय निरस्त करने वालों को चुप कराना होगा।"
यह पेपर यह दावा नहीं करता है कि यह इसे "सुरक्षित" बनाता है या वास्तविक दुनिया के चिकित्सा या कानूनी उपयोग के लिए तैयार करता है। यह केवल यह बताता है कि यह समझने के लिए कि ये मॉडल उदाहरणों से नियम कैसे सीखते हैं, हमें यह पहचानना होगा कि उनके आंतरिक "संगीतकार" अक्सर एक-दूसरे से लड़ रहे होते हैं, न कि मिलकर काम कर रहे होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।