← नवीनतम पेपर
🤖 machine learning

In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification

यह शोध पत्र प्रकट करता है कि इन-कॉन्टेक्स्ट लर्निंग मॉडल यांत्रिक रूप से प्रदर्शित टोकन को एक संपूर्ण शब्दावली के रूप में मानने के लिए बाध्य हैं, जिससे सटीकता तब ढह जाती है जब लेबल स्लॉट्स को सजातीय या यहाँ तक कि अर्थपूर्ण टोकनों से भरा जाता है, जो एक ऐसी घटना है जो विशिष्ट तंत्रिका परिपथों (न्यूरल सर्किट्स) तक सीमित है जो अर्थ संबंधी समझ को प्रारूप-संचालित टोकन पुनर्प्राप्ति के साथ ओवरराइड कर देते हैं।

मूल लेखक: Ming Liu

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ming Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक अर्थ निकालने वाले (literal-minded) रोबोट को एक अनुमान लगाने वाला खेल (guessing game) खेलना सिखा रहे हैं। आप उसे खेल कैसे काम करता है, इसके कुछ उदाहरण (डेमोंस्ट्रेशन) दिखाते हैं। फिर आप उसे एक नई स्थिति के लिए उत्तर का अनुमान लगाने के लिए कहते हैं। इसे "इन-कॉन्टेक्स्ट लर्निंग" (In-Context Learning) कहा जाता है।

आमतौर पर, हम सोचते हैं कि रोबोट आपके उदाहरणों से खेल के नियम सीख रहा है। लेकिन इस शोध पत्र ने एक अजीब गड़बड़ी (glitch) की खोज की है: रोबोट वास्तव में नियम नहीं सीख रहा है; वह बस आपके द्वारा दिए गए उत्तरों की सूची को कॉपी कर रहा है।

यहाँ शोधकर्ताओं द्वारा की गई खोजों का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "उत्तरों की सूची" का जाल (The "List of Answers" Trap)

कल्पना कीजिए कि आप रोबोट को जानवरों की पहचान करना सिखा रहे हैं।

  • सामान्य परिदृश्य: आप उसे कुत्तों की 4 तस्वीरें और बिल्लियों की 4 तस्वीरें दिखाते हैं। वह सीखता है, "ओह, उत्तर आमतौर पर 'कुत्ता' या 'बिल्ली' है।"
  • गड़बड़ी (होमोजेनियस लेबल्स): आप उसे बिल्लियों की 8 तस्वीरें दिखाते हैं, लेकिन आप उसे हर एक के लिए "बिल्ली" उत्तर बताते हैं। फिर आप उसे एक कुत्ते की तस्वीर दिखाते हैं और पूछते हैं, "यह क्या है?"
    • आप क्या उम्मीद करते हैं: रोबोट कुत्ता देखता है और कहता है, "यह एक कुत्ता है।"
    • क्या होता है: रोबोट आपके 8 "बिल्ली" उत्तरों की सूची को देखता है, यह तय करता है कि "बिल्ली" ही इस खेल में इस्तेमाल होने वाला एकमात्र शब्द है, और फिर भी "बिल्ली" कहता है—भले ही वह गलत हो।

शोधकर्ताओं ने पाया कि यदि आप रोबोट को उत्तरों की ऐसी सूची देते हैं जो सभी एक समान हैं, तो इसकी सटीकता गिरकर लगभग शून्य हो जाती है (कभी-कभी 12% से भी कम)। वह तस्वीर के बारे में सोचना बंद कर देता है और सोचने लगता है, "मुझे उस शब्द को चुनना है जो आपने मुझे अभी दी गई सूची में है।"

2. "बेमतलब के शब्द" का प्रयोग (The "Nonsense Word" Experiment)

यह साबित करने के लिए कि रोबोट "बिल्ली" शब्द से भ्रमित नहीं हुआ है, शोधकर्ताओं ने कुछ और अजीब प्रयोग किया। उन्होंने रोबोट को ऐसे उदाहरण दिए जहाँ उत्तर "foo," "bar," "vex," "nit," और "orb" जैसे बेमतलब के शब्द थे।

  • सेटअप: उन्होंने रोबोट को इन बेमतलब के शब्दों वाले 8 उदाहरण दिखाए। फिर उन्होंने रोबोट को एक असली कुत्ते की तस्वीर दिखाई और उत्तर पूछा।
  • परिणाम: भले ही "foo" और "bar" का कुत्ते के लिए कोई अर्थ नहीं है, फिर भी रोबोट ने "कुत्ता" कहने से मना कर दिया। इसके बजाय, उसने आपकी सूची से दिए गए बेमतलब के शब्दों में से किसी एक को 42% से 67% बार चुना।
  • सबक: रोबोट उन शब्दों को एक बंद मेनू (closed menu) की तरह मानता है जो आपने उसे दिया है। यदि "कुत्ता" आपके द्वारा दिए गए मेनू में नहीं है, तो रोबले मेनू से बाहर का ऑर्डर देने के बजाय भूखा मरना पसंद करेगा। यह मायने नहीं रखता कि मेनू की चीजें बेमतलब हैं; रोबोट बस उनमें से एक को उठा लेता है।

3. "डबल-थिंक" तंत्र (The "Double-Think" Mechanism - यह अंदर से कैसे काम करता है)

शोधकर्ताओं ने रोबोट के दिमाग के अंदर झाँका (मेकेनिस्टिक इंटरप्रिटेबिलिटी तकनीक का उपयोग करके) यह देखने के लिए कि यह कैसे होता है। उन्होंने एक दो-चरणीय प्रक्रिया पाई जिसे वे "एनकोड-देन-ओवरराइड" (Encode-then-Override) कहते हैं।

इसे एक लेखक द्वारा कहानी लिखने के ड्राफ्ट की तरह समझें:

  1. चरण 1 (बुद्धिमान हिस्सा): रोबोट के निचले मस्तिष्क के स्तर कुत्ते की तस्वीर को पढ़ते हैं और सही सोचते हैं, "यह एक कुत्ता है।" उनके पास सही उत्तर तैयार है।
  2. चरण 2 (गड़बड़ी वाला हिस्सा): रोबोट के ऊपरी मस्तिष्क के स्तर आपके द्वारा दिए गए उदाहरणों की सूची देखते हैं। वे देखते हैं कि सूची कहती है "बिल्ली" (या "foo")। वे निर्णय लेते हैं, "नहीं, इस विशिष्ट बातचीत के नियम कहते हैं कि हम केवल उस सूची के शब्दों का उपयोग कर सकते हैं।"
  3. ओवरराइड (Override): ऊपरी परतें सही उत्तर ("कुत्ता") को मिटा देती हैं और रोबोट को सूची के एक शब्द को आउटपुट करने के लिए मजबूर करती हैं।

यह एक छात्र की तरह है जो जानता है कि गणित का सवाल 2+2=4 है, लेकिन शिक्षक कहता है, "इस कक्षा में, हम केवल 5, 6 और 7 नंबरों का उपयोग करते हैं।" छात्र सत्य जानता है, लेकिन "कक्षा के नियम" (उदाहरण) उसे "5" लिखने के लिए मजबूर करते हैं।

4. यह बड़े रोबोट्स के साथ भी होता है

आप सोच सकते हैं, "शायद यह केवल छोटे, कम बुद्धिमान रोबोट्स के साथ होता है।" शोधकर्ताओं ने बहुत छोटे से लेकर काफी बड़े (8 बिलियन पैरामीटर्स तक) मॉडल्स पर परीक्षण किया।

  • निष्कर्ष: यह गड़बड़ी उन सभी में होती है। यहाँ तक कि उनके परीक्षण समूह के सबसे स्मार्ट रोबोट भी इस जाल में फंस गए। वास्तव में, बड़े रोबोट कभी-कभी इससे अधिक बुरी तरह प्रभावित होते हैं, जो भ्रामक उदाहरणों के साथ 86% सटीकता से गिरकर 0% हो जाती है।

5. "आखिरी शब्द" का नियम (The "Last Word" Rule)

शोधकर्ताओं ने एक और अजीब बात भी पाई कि रोबोट कब सुनता है।

  • यदि आप उसे 7 उदाहरण "बिल्ली" के देते हैं और अंत में 1 उदाहरण "कुत्ता" का देते हैं, तो रोबोट पहले 7 को अनदेखा कर देता है और आखिरी वाले को सुनता है।
  • यदि आप "कुत्ता" का उदाहरण शुरुआत में रखते हैं, तो रोबोट उसे पूरी तरह से अनदेखा कर देता है।
  • उपमा: रोबोट का ध्यान बहुत छोटा (short attention span) होता है। वह केवल उस उत्तर की सूची की परवाह करता है जो उसने हाल ही में देखी है, और वह उस सूची को वर्तमान प्रश्न के लिए परम कानून मानता है।

सारांश

यह शोध पत्र निष्कर्ष निकालता है कि ये AI मॉडल हमेशा किसी कार्य की अवधारणा को "सीखते" नहीं हैं। इसके बजाय, वे अक्सर आपके द्वारा दिखाए गए उत्तरों की सूची को बस रिट्रीव (retrieve/निकालना) करते हैं और उस सूची में से चुनते हैं, प्रश्न के वास्तविक अर्थ को अनदेखा कर देते हैं। यदि आप उन्हें बेमतलब के शब्दों की सूची देते हैं, तो वे बेमतलब के उत्तर देंगे। यदि आप उन्हें सभी "बिल्लियों" की सूची देते हैं, तो वे कुत्ते को भी "बिल्ली" कह देंगे।

यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार):
यदि आप इन मॉडल्स का उपयोग ईमेल छाँटने या डेटाबेस के आधार पर प्रश्नों के उत्तर देने जैसे कार्यों के लिए कर रहे हैं, और आपके द्वारा निकाले गए उदाहरणों में (गलती से भी) सभी के लेबल एक जैसे हैं, तो मॉडल सोचना बंद कर देगा और बस उस लेबल को कॉपी करेगा, जिससे भारी त्रुटियां होंगी। समाधान? सुनिश्चित करें कि आप रोबोट को जो उदाहरण दिखा रहे हैं वे विविध (diverse) हों, और शायद सूची के अंत में एक सही उदाहरण रखें ताकि उसका दिमाग "रीसेट" हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →