← नवीनतम पेपर
💬 NLP

Query-Conditioned Test-Time Self-Training for Large Language Models

यह शोध पत्र QueST को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को सीधे इनपुट क्वेरी से प्राप्त पर्यवेक्षण (supervision) का उपयोग करके इन्फरेंस के दौरान अपने मापदंडों (parameters) को अनुकूलित करने में सक्षम बनाता है, जिससे बाहरी डेटा पर निर्भर रहे बिना तर्क संबंधी कार्यों में क्वेरी-विशिष्ट सुधार प्राप्त किया जा सके।

मूल लेखक: Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

प्रकाशित 2026-05-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Query-Conditioned Test-Time Self-Training for Large Language Models" (QueST) के पेपर की व्याख्या सरल भाषा और उपमाओं (analogies) का उपयोग करके दी गई है।

बड़ी समस्या: "एक ही आकार का मस्तिष्क" (One-Size-Fits-All Brain)

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र (AI मॉडल) है जिसने वर्षों तक पढ़ाई की है और उसे बहुत सी बातें पता हैं। हालाँकि, जब आप उसे एक विशिष्ट, कठिन परीक्षा प्रश्न देते हैं, तो वह कभी-कभी अटक जाता है।

आमतौर पर, उसकी मदद करने के लिए आपके पास दो विकल्प होते हैं:

  1. कड़ी मेहनत करना (Retraining): उसे वापस स्कूल भेजें ताकि वह नई सामग्री सीख सके। यह महंगा है, धीमा है, और आप हर बार जब वह कोई टेस्ट दे, तो ऐसा नहीं कर सकते।
  2. अधिक समय तक सोचना (Test-Time Scaling): उसे कहें, "अपना समय लें, उत्तर देने के 10 अलग-अलग तरीके सोचें, और सबसे अच्छा चुनें।" यह मदद करता है, लेकिन यह इस तथ्य को ठीक नहीं करता कि उसे उस विशिष्ट प्रकार के प्रश्न की मौलिक समझ में समस्या हो सकती है जो आपने अभी पूछा है।

इस पेपर के लेखकों ने देखा कि वर्तमान AI मॉडल बहुत कठोर हैं। वे किसी विशाल बाहरी डेटाबेस या पूरे मॉडल को फिर से प्रशिक्षित किए बिना, आपके द्वारा पूछे गए प्रश्न की अनूठी संरचना के साथ तालमेल बिठाने के लिए आसानी से "गियर नहीं बदल" सकते।

समाधान: QueST ("इंस्टेंट ट्यूटर" विधि)

यह पेपर एक नई विधि प्रस्तावित करता है जिसे QueST (Query-Conditioned Test-Time Self-Training) कहा जाता है।

मुख्य विचार:
AI से केवल "अधिक गहराई से सोचने" के लिए कहने के बजाय, QueST AI को प्रश्न का उत्तर देने से ठीक पहले स्वयं को सिखाने के लिए कहता है।

यह कैसे काम करता है, इसे चरण-दर-चरण एक उपमा (analogy) का उपयोग करके समझते हैं:

1. "सीड" (Seed) प्रश्न

आप AI से एक कठिन गणितीय समस्या पूछते हैं (यह आपका "Query" है)।

  • उपमा: कल्पना कीजिए कि आप एक शेफ हैं और आपसे एक विशिष्ट, जटिल व्यंजन बनाने के लिए कहा गया है (जैसे, "Spicy Saffron Risotto")।

2. "अभ्यास" व्यंजन तैयार करना (Generating "Practice" Dishes)

अंतिम व्यंजन पकाने से पहले, AI आपकी रिक्वेस्ट से मिलने वाली सामग्रियों का उपयोग करके तुरंत पाँच समान अभ्यास समस्याएँ उत्पन्न करता है।

  • उपमा: शेफ आपके "Spicy Saffron Risotto" के अनुरोध को देखता है और तुरंत पाँच अभ्यास रेसिपी बनाता है: "एक्स्ट्रा लहसुन के साथ स्पाइसी सैफरॉन रिसोट्टो," "एक अलग चावल के साथ स्पाइसी सैफरॉन रिसोट्टो," आदि।
  • महत्वपूर्ण बिंदु: ये लाइब्रेरी से ली गई यादृच्छिक (random) रेसिपी नहीं हैं। ये आपके मूल अनुरोध के विशिष्ट विवरणों के आधार पर विशेष रूप से बनाई गई हैं। पेपर इसे "Query-Conditioned" कहता है।

3. "वार्म-अप" (The "Warm-Up" - Self-Training)

AI इन पाँच अभ्यास समस्याओं को जल्दी से हल करता है। यह करते समय, यह अपने आंतरिक "नॉब्स" (parameters) को थोड़ा समायोजित करता है ताकि वह इस विशिष्ट शैली के खाना पकाने में बेहतर हो सके।

  • उपमा: शेफ पाँचों अभ्यास रिसोट्टो को जल्दी से पकाता है। ऐसा करते समय, वे अपनी सीजनिंग और चलाने की तकनीक को बस इतना ट्यून करते हैं कि वे आपके द्वारा मांगे गए विशिष्ट "Spicy Saffron" फ्लेवर प्रोफाइल में महारत हासिल कर सकें। वे पूरी दुनिया के लिए अपनी पूरी कुकिंग स्टाइल नहीं बदलते; वे बस इस ऑर्डर के लिए खुद को फाइन-ट्यून करते हैं।
  • तकनीकी नोट: पेपर इन समायोजनों को तेज़ और सस्ता बनाने के लिए LoRA (Low-Rank Adaptation) नामक एक हल्के तकनीक का उपयोग करता है, जो पूरे इंजन को फिर से बनाने के बजाय कुछ डायल घुमाने जैसा है।

4. अंतिम उत्तर

अब, आपके प्रश्न के लिए विशेष रूप से ट्यून किए गए इन ताज़ा "नॉब्स" के साथ, AI आपके मूल "Spicy Saffron Risotto" अनुरोध का उत्तर देता है।

  • परिणाम: क्योंकि AI ने अभी-अभी उसी प्रकार के तर्क का अभ्यास किया है जिसकी आवश्यकता आपके प्रश्न के लिए थी, इसकी उत्तर सही होने की संभावना बहुत अधिक है।

यह मौजूदा तरीकों से बेहतर क्यों है?

पेपर एक साधारण चेकलिस्ट (पेपर की Table 1) का उपयोग करके QueST की अन्य विधियों से तुलना करता है:

  • पुरानी विधि A (Test-Time Scaling): "बस 10 उत्तर सोचें।"
    • दोष: यह मॉडल के मस्तिष्क को नहीं बदलता। यदि मॉडल तर्क को लेकर भ्रमित है, तो 10 बार सोचने से भ्रम दूर नहीं होगा।
  • पुरखी विधि B (External Data): "एक विशाल डेटाबेस में समान प्रश्न खोजें।"
    • दोष: इसके लिए भारी मात्रा में डेटा स्टोर करने की आवश्यकता होती है और सही मैच ढूंढना धीमा और अव्यवहारिक है।
  • पुरानी विधि C (Generic Self-Training): "यादृच्छिक (Random) प्रश्नों का अभ्यास करें।"
    • दोष: यदि आप गणित का प्रश्न पूछते हैं, तो रैंडम व्याकरण के प्रश्नों का अभ्यास करने से कोई मदद नहीं मिलेगी। आपको अपने विशिष्ट प्रश्न की संरचना से मेल खाने वाले अभ्यास की आवश्यकता है।

QueST इसलिए जीतता है क्योंकि:

  1. यह अपने आप तुरंत (on the fly) अभ्यास प्रश्न बनाता है (किसी बाहरी डेटाबेस की आवश्यकता नहीं)।
  2. अभ्यास प्रश्न आपके द्वारा पूछे गए विशिष्ट प्रश्न के साथ पूरी तरह से मेल खाते हैं।
  3. यह केवल अनुमान लगाने के बजाय वास्तव में (अस्थायी रूप से) मॉडल के मस्तिष्क को बदलता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने सात अलग-अलग गणितीय बेंचमार्क और एक विज्ञान तर्क परीक्षण (GPQA-Diamond) पर इसका परीक्षण किया।

  • परिणाम: QueST ने लगातार अन्य तरीकों को हराया। औसतन, इसने बेस मॉडल्स की तुलना में सटीकता में लगभग 6.44 प्रतिशत अंक का सुधार किया।
  • दक्षता (Efficiency): इसने उन तरीकों की तुलना में कम "टोकन" (शब्द उत्पन्न करना) का उपयोग करके उच्च सटीकता प्राप्त की जो 64 अलग-अलग उत्तर सोचने की कोशिश करते हैं। यह एक घंटे तक अंधाधुंध अनुमान लगाने के बजाय, 10 मिनट तक सही सामग्री का अध्ययन करके बेहतर ग्रेड प्राप्त करने जैसा है।

पेपर से एक वास्तविक उदाहरण

पेपर एक मामला दिखाता है जहाँ एक मानक AI मॉडल ने एक जटिल रिकर्सिव (recursive) गणितीय फंक्शन को देखा और उत्तर 3 होने का अनुमान लगाया क्योंकि उसने एक ऐसा पैटर्न देखा जो परिचित लग रहा था लेकिन वास्तव में गलत था।

जब QueST का उपयोग किया गया:

  1. इसने उस विशिष्ट फंक्शन के आधार पर समान रिकर्सिव समस्याएं उत्पन्न कीं।
  2. इसने उन अभ्यास समस्याओं को हल करते समय पैटर्न को "पुनः सीखा" (re-learned)।
  3. इसने महसूस किया कि पैटर्न वैसा नहीं है जैसा यह सोच रहा था।
  4. इसने खुद को सुधारा और सही उत्तर दिया: 1

सीमाएं (The "Gotchas")

पेपर ईमानदार है कि यह कहाँ विफल हो सकता है:

  • Garbage In, Garbage Out: यदि मूल प्रश्न भ्रमित करने वाला, अस्पष्ट या गलत धारणा पर आधारित है, तो AI ऐसे "अभ्यास प्रश्न" भी बना सकता है जो भ्रमित करने वाले हों। इससे AI गलत सबक सीख सकता है।
  • कोई मेमोरी नहीं: AI हर एक प्रश्न के बाद अपने "नॉब्स" को रीसेट कर देता है। यह अगले प्रश्न के लिए जो सीखा है उसे याद नहीं रखता है। (पेपर सुझाव देता है कि भविष्य के कार्य AI को याद रखने की अनुमति दे सकते हैं, लेकिन उन्होंने इस अध्ययन में ऐसा नहीं किया।)

सारांश

QueST एक AI को परीक्षा देने से ठीक पहले अपने लिए "चीट शीट" लिखने जैसा है। केवल अनुमान लगाने या पुराने नोट्स देखने के बजाय, यह ताज़ा अभ्यास प्रश्न बनाता है जो टेस्ट प्रश्न से पूरी तरह मेल खाते हैं, तुरंत उनका अभ्यास करता है, और फिर एक ताज़ा ट्यून किए हुए मस्तिष्क के साथ टेस्ट देता है। यह AI को बिना किसी विशाल बाहरी लाइब्रेरी या पूर्ण रिट्रेनिंग सत्र के, विशिष्ट और कठिन समस्याओं को हल करने में स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →