Agentic Context Learning with Self-Discovered Specification
यह शोध पत्र पहचानता है कि लार्ज लैंग्वेज मॉडल्स के लिए कॉन्टेक्स्ट लर्निंग में प्राथमिक चुनौती केवल सामग्री तक पहुँच प्राप्त करना नहीं है, बल्कि कॉन्टेक्स्ट में वितरित निहित, कार्य-विशिष्ट विशिष्टताओं (specifications) को प्राप्त करना है, और यह प्रदर्शित करता है कि PSCI नामक एक सरल हस्तक्षेप, जो एडवरसेरियल चेकिंग के माध्यम से इन विशिष्टताओं को निकालता और लागू करता है, CL-Bench बेंचमार्क पर मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपको अभी-अभी एक बिल्कुल नए, अत्यंत जटिल वीडियो गेम के लिए 40,000 पन्नों का एक विशाल निर्देश मैनुअल (instruction manual) थमाया गया है। यह मैनुअल लोरे (lore), पात्रों की पृष्ठभूमि और दुनिया के इतिहास से भरा हुआ है। फिर, आपका एक दोस्त आपसे एक साधारण सवाल पूछता है: "अगर मैं एक लेवल छोड़ दूँ तो क्या होगा?"
आप सोच सकते हैं कि सबसे कठिन काम उस विशाल किताब में उत्तर ढूँढना होगा। आप सोचेंगे, "अगर मैं सिर्फ 'skip level' खोजूँगा, तो मुझे नियम मिल जाएगा!" लेकिन यहाँ एक मोड़ है: यह शोध पत्र तर्क देता है कि आधुनिक AI मॉडल्स के लिए, असली समस्या उत्तर (कंटेंट) ढूँढना नहीं है। असली समस्या खेल के उन नियमों (स्पेसिफिकेशन) को ढूँढना है जो आपको वह उत्तर सही ढंग से लिखने के लिए बताते हैं।
"नियर-मिस" (Near-Miss) का रहस्य
शोधकर्ताओं ने इसका परीक्षण CL-Bench नामक एक बेंचमार्क पर किया, जिसमें 1,899 पेचीदा कार्य शामिल हैं जहाँ AI को लंबे टेक्स्ट से नए नियम सीखने होते हैं। परिणाम आश्चर्यजनक थे। यहाँ तक कि सबसे स्मार्ट AI मॉडल्स (जैसे GPT-5.1) भी केवल 22.55% कार्यों को पूरी तरह से सही कर पाए।
लेकिन जब उन्होंने बारीकी से देखा, तो उन्हें कुछ अजीब पता चला। AI आमतौर पर तथ्यों को गलत नहीं कर रहा था। वह फॉर्मेट (प्रारूप) को गलत कर रहा था।
- तथ्य (The Fact): AI जानता था कि गायब ID "404" है।
- नियम (The Rule): मैनुअल में लिखा था, "यदि आप कोई गायब ID देखते हैं, तो आपको सटीक फ्लैग
Sequence_Gap_Warningलिखना चाहिए।" - गलती (The Mistake): AI ने "404" तो लिखा, लेकिन फ्लैग लिखना भूल गया।
यह एक "नियर-मिस" (पास से चूक जाना) था। AI तथ्य तो जानता था लेकिन स्थानीय स्पेसिफिकेशन (local specification) को मिस कर गया। वास्तव में, पेपर ने पाया कि टेस्ट के सभी नियमों में से 55.4% इन विशिष्ट व्यवहारों (फॉर्मेट, क्रम, सटीक वाक्यांश) के बारे में थे, जबकि केवल 22.6% तथ्यात्मक सामग्री के बारे में थे।
"खोजने" (Searching) से काम क्यों नहीं चला
एक स्वाभाविक अनुमान होगा: "शायद AI मैनुअल का सही पेज नहीं ढूँढ पा रहा है।" इसलिए, शोधकर्ताओं ने AI को बेहतर तरीके से खोजने में मदद करने के लिए 12 अलग-अलग तरीके आजमाए, जैसे टेक्स्ट का सारांश बनाना या प्रासंगिक अंश निकालना।
परिणाम? इनमें से कोई भी तरीका अच्छा काम नहीं आया। सबसे अच्छे सर्च-आधारित तरीकों ने भी केवल लगभग 23% स्कोर किया। यह सुझाव देता है कि केवल सही पेज ढूँढना ही समस्या नहीं है। समस्या यह है कि नियम अक्सर बैकग्राउंड में छिपे होते हैं—जैसे "इवेंट सिमेंटिक्स" वाले पैराग्राफ में एक फुटनोट की तरह—और AI को तब तक यह एहसास नहीं होता कि उसे उनका पालन करना है, जब तक कि वह स्पष्ट रूप से उन्हें न खोज ले।
"प्राइवेट कॉन्ट्रैक्ट" (निजी अनुबंध) समाधान
इसे साबित करने के लिए, शोधकर्ताओं ने एक सरल ट्रिक डिज़ाइन की जिसे PSCI (Private Specification-Contract Induction) कहा जाता है। इसे इस तरह समझें:
AI द्वारा उत्तर देने की कोशिश करने से पहले, वे उसे एक "प्री-गेम मीटिंग" करने के लिए मजबूर करते हैं।
- इंड्यूस (Induce): AI पूरे मैनुअल को पढ़ता है और अपने द्वारा खोजे गए सभी छिपे हुए नियमों का एक "प्राइवेट कॉन्ट्रैक्ट" लिखता है (जैसे, "नियम 1: हमेशा फ्लैग
Sequence_Gap_Warningका उपयोग करें")। - जेनरेट (Generate): AI अपना उत्तर लिखता है, लेकिन उसे उस कॉन्ट्रैक्ट का पालन करना होता है।
- चेक (Check): एक "रेफरी" (एक अन्य AI स्टेप) उत्तर की कॉन्ट्रैक्ट के विरुद्ध जाँच करता है। क्या आपने फ्लैग का उपयोग किया? क्या आपने क्रम का पालन किया?
- रिपेयर (Repair): यदि रेफरी कहता है "नहीं," तो AI आपको दिखाने से पहले उत्तर को ठीक करता है।
परिणाम? इस सरल चार-चरणीय प्रक्रिया ने GPT-5.1 के स्कोर को 22.55% से बढ़ाकर 28.14% कर दिया। यह 5.59 प्रतिशत अंक की छलांग है, जो इस दुनिया में बहुत बड़ी बात है। यह Qwen3.5-27B (14.14% से 19.42% तक उछलकर) और Gemini 3 Pro (16.14% से 22.31% तक उछलकर) जैसे अन्य मॉडल्स पर भी काम कर गया।
यह क्या खारिज करता है
पेपर बहुत स्पष्ट है कि क्या काम नहीं करता:
- सिर्फ अधिक खोजना: समस्या में अधिक सर्च टूल्स डालने से कोई मदद नहीं मिली।
- सिर्फ अधिक गहराई से सोचना: मूल CL-Bench मूल्यांकन से "GPT 5.1 (High)" सेटिंग का उपयोग करने पर मॉडल केवल 23.7% तक ही पहुँच पाया, जो PSCI ट्रिक द्वारा प्राप्त 28.14% से अभी भी कम है।
- जेनेरिक चेकलिस्ट: यदि आप AI से केवल अपना काम "चेक करने" के लिए कहते हैं, बिना पहले इस विशिष्ट संदर्भ से नियम लिखवाए, तो इससे कोई मदद नहीं मिलती। नियम इस कार्य के लिए विशिष्ट होने चाहिए।
वे कितने आश्वस्त हैं?
लेखक अपने निष्कर्षों को लेकर काफी आश्वस्त हैं क्योंकि उन्होंने इसका कड़ाई से परीक्षण किया। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने 17 अलग-अलग "एब्लेशन" प्रयोग (मेथड को अलग-अलग करके यह देखने के लिए कि क्या काम करता है) चलाए।
- उन्होंने सिद्ध किया कि यदि नियमों को आपस में बदल दिया जाए (AI को गलत कॉन्ट्रैक्ट दिया जाए), तो स्कोर गिरकर 19.80% हो जाता है, जो साबित करता है कि नियम विशिष्ट कार्य से मेल खाने चाहिए।
- उन्होंने सिद्ध किया कि यदि आप "कॉन्ट्रैक्ट" स्टेप को छोड़ देते हैं और बस AI को बाद में अपना काम खुद चेक करने के लिए कहते हैं, तो यह विफल हो जाता है। कॉन्ट्रैक्ट उत्तर जेनरेट करने से पहले लिखा जाना चाहिए।
- उन्होंने मानव विशेषज्ञों से AI के 100 उत्तरों की जाँच भी करवाई। मानव कंप्यूटर के निर्णय से 96% बार सहमत थे, जिससे पुष्टि हुई कि AI वास्तव में बेहतर हो रहा था, न कि केवल अनुमान लगा रहा था।
मुख्य निष्कर्ष (The Bottom Line)
पेपर सुझाव देता है कि लंबे टेक्स्ट से नए नियम सीखने के लिए, AI को केवल एक अच्छा लाइब्रेरियन नहीं होना चाहिए जो सही किताब ढूँढ सके। उसे एक अच्छा वकील होना चाहिए जो बारीक अक्षरों (fine print) को पढ़े, नियमों का एक अनुबंध लिखे, और फिर कोई भी काम करने से पहले उस अनुबंध पर हस्ताक्षर करे।
हालांकि 28.14% का स्कोर अब तक का सर्वश्रेष्ठ है, लेखक नोट करते हैं कि यह अभी भी एक "हल" (solved) समस्या नहीं है। अभी भी सुधार की बहुत गुंजाइश है, विशेष रूप से "एनफोर्समेंट" (लागू करने) के भाग में—यह सुनिश्चित करने में कि AI वास्तव में उस कॉन्ट्रैक्ट का पालन करता है जो उसने अपने लिए लिखा है। लेकिन मुख्य संदेश स्पष्ट है: कॉन्टेक्स्ट लर्निंग केवल उत्तर ढूँढने के बारे में नहीं है; यह पहले खेल के नियमों को खोजने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।