← नवीनतम पेपर
🤖 AI

Agentic Context Learning with Self-Discovered Specification

यह शोध पत्र पहचानता है कि लार्ज लैंग्वेज मॉडल्स के लिए कॉन्टेक्स्ट लर्निंग में प्राथमिक चुनौती केवल सामग्री तक पहुँच प्राप्त करना नहीं है, बल्कि कॉन्टेक्स्ट में वितरित निहित, कार्य-विशिष्ट विशिष्टताओं (specifications) को प्राप्त करना है, और यह प्रदर्शित करता है कि PSCI नामक एक सरल हस्तक्षेप, जो एडवरसेरियल चेकिंग के माध्यम से इन विशिष्टताओं को निकालता और लागू करता है, CL-Bench बेंचमार्क पर मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Jike Zhong, Ming Li, Yuxiang Lai, Ziyan Yang, Jingyu Xie, Jihyung Kil, Zheda Mai, Shao-Yuan Lo, Ren Xiang, Konstantinos Psounis, Yuanyuan Lei

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jike Zhong, Ming Li, Yuxiang Lai, Ziyan Yang, Jingyu Xie, Jihyung Kil, Zheda Mai, Shao-Yuan Lo, Ren Xiang, Konstantinos Psounis, Yuanyuan Lei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपको अभी-अभी एक बिल्कुल नए, अत्यंत जटिल वीडियो गेम के लिए 40,000 पन्नों का एक विशाल निर्देश मैनुअल (instruction manual) थमाया गया है। यह मैनुअल लोरे (lore), पात्रों की पृष्ठभूमि और दुनिया के इतिहास से भरा हुआ है। फिर, आपका एक दोस्त आपसे एक साधारण सवाल पूछता है: "अगर मैं एक लेवल छोड़ दूँ तो क्या होगा?"

आप सोच सकते हैं कि सबसे कठिन काम उस विशाल किताब में उत्तर ढूँढना होगा। आप सोचेंगे, "अगर मैं सिर्फ 'skip level' खोजूँगा, तो मुझे नियम मिल जाएगा!" लेकिन यहाँ एक मोड़ है: यह शोध पत्र तर्क देता है कि आधुनिक AI मॉडल्स के लिए, असली समस्या उत्तर (कंटेंट) ढूँढना नहीं है। असली समस्या खेल के उन नियमों (स्पेसिफिकेशन) को ढूँढना है जो आपको वह उत्तर सही ढंग से लिखने के लिए बताते हैं।

"नियर-मिस" (Near-Miss) का रहस्य

शोधकर्ताओं ने इसका परीक्षण CL-Bench नामक एक बेंचमार्क पर किया, जिसमें 1,899 पेचीदा कार्य शामिल हैं जहाँ AI को लंबे टेक्स्ट से नए नियम सीखने होते हैं। परिणाम आश्चर्यजनक थे। यहाँ तक कि सबसे स्मार्ट AI मॉडल्स (जैसे GPT-5.1) भी केवल 22.55% कार्यों को पूरी तरह से सही कर पाए।

लेकिन जब उन्होंने बारीकी से देखा, तो उन्हें कुछ अजीब पता चला। AI आमतौर पर तथ्यों को गलत नहीं कर रहा था। वह फॉर्मेट (प्रारूप) को गलत कर रहा था।

  • तथ्य (The Fact): AI जानता था कि गायब ID "404" है।
  • नियम (The Rule): मैनुअल में लिखा था, "यदि आप कोई गायब ID देखते हैं, तो आपको सटीक फ्लैग Sequence_Gap_Warning लिखना चाहिए।"
  • गलती (The Mistake): AI ने "404" तो लिखा, लेकिन फ्लैग लिखना भूल गया।

यह एक "नियर-मिस" (पास से चूक जाना) था। AI तथ्य तो जानता था लेकिन स्थानीय स्पेसिफिकेशन (local specification) को मिस कर गया। वास्तव में, पेपर ने पाया कि टेस्ट के सभी नियमों में से 55.4% इन विशिष्ट व्यवहारों (फॉर्मेट, क्रम, सटीक वाक्यांश) के बारे में थे, जबकि केवल 22.6% तथ्यात्मक सामग्री के बारे में थे।

"खोजने" (Searching) से काम क्यों नहीं चला

एक स्वाभाविक अनुमान होगा: "शायद AI मैनुअल का सही पेज नहीं ढूँढ पा रहा है।" इसलिए, शोधकर्ताओं ने AI को बेहतर तरीके से खोजने में मदद करने के लिए 12 अलग-अलग तरीके आजमाए, जैसे टेक्स्ट का सारांश बनाना या प्रासंगिक अंश निकालना।

परिणाम? इनमें से कोई भी तरीका अच्छा काम नहीं आया। सबसे अच्छे सर्च-आधारित तरीकों ने भी केवल लगभग 23% स्कोर किया। यह सुझाव देता है कि केवल सही पेज ढूँढना ही समस्या नहीं है। समस्या यह है कि नियम अक्सर बैकग्राउंड में छिपे होते हैं—जैसे "इवेंट सिमेंटिक्स" वाले पैराग्राफ में एक फुटनोट की तरह—और AI को तब तक यह एहसास नहीं होता कि उसे उनका पालन करना है, जब तक कि वह स्पष्ट रूप से उन्हें न खोज ले।

"प्राइवेट कॉन्ट्रैक्ट" (निजी अनुबंध) समाधान

इसे साबित करने के लिए, शोधकर्ताओं ने एक सरल ट्रिक डिज़ाइन की जिसे PSCI (Private Specification-Contract Induction) कहा जाता है। इसे इस तरह समझें:

AI द्वारा उत्तर देने की कोशिश करने से पहले, वे उसे एक "प्री-गेम मीटिंग" करने के लिए मजबूर करते हैं।

  1. इंड्यूस (Induce): AI पूरे मैनुअल को पढ़ता है और अपने द्वारा खोजे गए सभी छिपे हुए नियमों का एक "प्राइवेट कॉन्ट्रैक्ट" लिखता है (जैसे, "नियम 1: हमेशा फ्लैग Sequence_Gap_Warning का उपयोग करें")।
  2. जेनरेट (Generate): AI अपना उत्तर लिखता है, लेकिन उसे उस कॉन्ट्रैक्ट का पालन करना होता है।
  3. चेक (Check): एक "रेफरी" (एक अन्य AI स्टेप) उत्तर की कॉन्ट्रैक्ट के विरुद्ध जाँच करता है। क्या आपने फ्लैग का उपयोग किया? क्या आपने क्रम का पालन किया?
  4. रिपेयर (Repair): यदि रेफरी कहता है "नहीं," तो AI आपको दिखाने से पहले उत्तर को ठीक करता है।

परिणाम? इस सरल चार-चरणीय प्रक्रिया ने GPT-5.1 के स्कोर को 22.55% से बढ़ाकर 28.14% कर दिया। यह 5.59 प्रतिशत अंक की छलांग है, जो इस दुनिया में बहुत बड़ी बात है। यह Qwen3.5-27B (14.14% से 19.42% तक उछलकर) और Gemini 3 Pro (16.14% से 22.31% तक उछलकर) जैसे अन्य मॉडल्स पर भी काम कर गया।

यह क्या खारिज करता है

पेपर बहुत स्पष्ट है कि क्या काम नहीं करता:

  • सिर्फ अधिक खोजना: समस्या में अधिक सर्च टूल्स डालने से कोई मदद नहीं मिली।
  • सिर्फ अधिक गहराई से सोचना: मूल CL-Bench मूल्यांकन से "GPT 5.1 (High)" सेटिंग का उपयोग करने पर मॉडल केवल 23.7% तक ही पहुँच पाया, जो PSCI ट्रिक द्वारा प्राप्त 28.14% से अभी भी कम है।
  • जेनेरिक चेकलिस्ट: यदि आप AI से केवल अपना काम "चेक करने" के लिए कहते हैं, बिना पहले इस विशिष्ट संदर्भ से नियम लिखवाए, तो इससे कोई मदद नहीं मिलती। नियम इस कार्य के लिए विशिष्ट होने चाहिए।

वे कितने आश्वस्त हैं?

लेखक अपने निष्कर्षों को लेकर काफी आश्वस्त हैं क्योंकि उन्होंने इसका कड़ाई से परीक्षण किया। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने 17 अलग-अलग "एब्लेशन" प्रयोग (मेथड को अलग-अलग करके यह देखने के लिए कि क्या काम करता है) चलाए।

  • उन्होंने सिद्ध किया कि यदि नियमों को आपस में बदल दिया जाए (AI को गलत कॉन्ट्रैक्ट दिया जाए), तो स्कोर गिरकर 19.80% हो जाता है, जो साबित करता है कि नियम विशिष्ट कार्य से मेल खाने चाहिए।
  • उन्होंने सिद्ध किया कि यदि आप "कॉन्ट्रैक्ट" स्टेप को छोड़ देते हैं और बस AI को बाद में अपना काम खुद चेक करने के लिए कहते हैं, तो यह विफल हो जाता है। कॉन्ट्रैक्ट उत्तर जेनरेट करने से पहले लिखा जाना चाहिए।
  • उन्होंने मानव विशेषज्ञों से AI के 100 उत्तरों की जाँच भी करवाई। मानव कंप्यूटर के निर्णय से 96% बार सहमत थे, जिससे पुष्टि हुई कि AI वास्तव में बेहतर हो रहा था, न कि केवल अनुमान लगा रहा था।

मुख्य निष्कर्ष (The Bottom Line)

पेपर सुझाव देता है कि लंबे टेक्स्ट से नए नियम सीखने के लिए, AI को केवल एक अच्छा लाइब्रेरियन नहीं होना चाहिए जो सही किताब ढूँढ सके। उसे एक अच्छा वकील होना चाहिए जो बारीक अक्षरों (fine print) को पढ़े, नियमों का एक अनुबंध लिखे, और फिर कोई भी काम करने से पहले उस अनुबंध पर हस्ताक्षर करे।

हालांकि 28.14% का स्कोर अब तक का सर्वश्रेष्ठ है, लेखक नोट करते हैं कि यह अभी भी एक "हल" (solved) समस्या नहीं है। अभी भी सुधार की बहुत गुंजाइश है, विशेष रूप से "एनफोर्समेंट" (लागू करने) के भाग में—यह सुनिश्चित करने में कि AI वास्तव में उस कॉन्ट्रैक्ट का पालन करता है जो उसने अपने लिए लिखा है। लेकिन मुख्य संदेश स्पष्ट है: कॉन्टेक्स्ट लर्निंग केवल उत्तर ढूँढने के बारे में नहीं है; यह पहले खेल के नियमों को खोजने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →