← नवीनतम पेपर
📊 statistics

Adaptive Nucleus Truncation for Long-Form Reasoning

यह शोध पत्र एडेप्टिव न्यूक्लियस ट्रंकेशन सैंपलिंग (ANTS) प्रस्तुत करता है, जो एक एंट्रॉपी-कंडीशन्ड तंत्र है जो विविध कार्यों और जनरेशन बजटों में लॉन्ग-फॉर्म रीजनिंग मॉडल्स को स्थिर करने और उनके प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए टोकन ट्रंकेशन थ्रेशोल्ड्स को गतिशील रूप से समायोजित करता है।

मूल लेखक: Ousmane Amadou Dia

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ousmane Amadou Dia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े बिखरे हुए छात्र को एक जटिल समस्या को हल करना सिखा रहे हैं। आप उसे एक प्रॉम्प्ट (प्रश्न) देते हैं और उसे अपनी पूरी विचार प्रक्रिया को चरण-दर-चरण लिखने के लिए कहते हैं।

समस्या यह है कि जैसे-जैसे छात्र लिखना शुरू करता है, वह भटकने लगता है। वह अप्रासंगिक विवरणों में उलझ सकता है, खुद को दोहरा सकता है, या एक गलत मोड़ ले सकता है जो उसे एक बंद रास्ते (dead end) की ओर ले जाता है। AI की दुनिया में, इसे "ड्रिफ्टिंग" (drifting) या "इनस्टेबिलिटी" (instability) कहा जाता है।

यह शोध पत्र एक नया टूल पेश करता है जिसे ANTS (Adaptive Nucleus Truncation Sampling) कहा जाता है, ताकि AI को ट्रैक पर रहने में मदद मिल सके, खासकर जब उसे बहुत लंबे उत्तर लिखने हों।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "फिक्स्ड फिल्टर" बनाम "स्मार्ट फिल्टर"

कल्पना कीजिए कि AI एक चौराहे पर खड़ा है जहाँ हजारों संभावित रास्ते (शब्द) हैं जिन्हें वह अगला कदम उठाने के लिए चुन सकता है।

  • पुराने तरीके: पारंपरिक उपकरण एक फिक्स्ड गेटकीपर (निश्चित द्वारपाल) की तरह काम करते हैं। वे कहते हैं, "चाहे स्थिति कुछ भी हो, हम केवल शीर्ष 50% रास्तों को ही आगे जाने देंगे।"
    • दोष: कभी-कभी छात्र को बहुत केंद्रित होने की आवश्यकता होती है (एक गणित की समस्या), और एक चौड़ा गेट बहुत अधिक शोर (noise) को अंदर आने देता है। अन्य समय में, छात्र को रचनात्मक होने की आवश्यकता होती है (एक कहानी लिखना), और एक संकीकर गेट अच्छे विचारों को काट देता है। एक फिक्स्ड गेट स्थिति के आधार पर अपना निर्णय नहीं बदल सकता।
  • ANTS का समाधान: ANTS एक स्मार्ट, अडैप्टिव गाइड की तरह काम करता है। एक फिक्स्ड गेट के बजाय, यह वर्तमान स्थिति को देखता है और पूछता है: "छात्र अभी कितना भ्रमित है?"
    • यदि छात्र अपने उत्तर के प्रति बहुत आश्वस्त है (कम भ्रम), तो गाइड उसे केंद्रित रखने के लिए गेट को संकुचित कर देता है।
    • यदि छात्र अनिश्चित है (उच्च भ्रम), तो गाइड उसे अधिक विकल्पों को खोजने के लिए गेट को चौड़ा कर देता है।

2. सीक्रेट सॉस: "लॉगिट्स" (Logits) और "एन्ट्रॉपी" (Entropy)

इन निर्णय लेने के लिए, ANTS दो विशेष उपकरणों का उपयोग करता है:

  • लॉगिट्स (Raw Score - कच्चा स्कोर): अधिकांश AI उपकरण किसी शब्द की अंतिम "संभावना" (जैसे प्रतिशत संभावना) को देखते हैं। लेकिन शोध पत्र का तर्क है कि यह एक फोटो को देखने जैसा है जिसे फिल्टर और रीसाइज किया गया है। ANTS किसी भी फिल्टरिंग से पहले के कच्चे स्कोर (logits) को देखता है। यह खाना पकाने से पहले कच्चे माल को देखने जैसा है; यह एक स्पष्ट तस्वीर देता है कि AI वास्तव में सबसे अच्छा शब्द क्या "सोचता" है।
  • एन्ट्रॉपी (Confusion Meter - भ्रम मीटर): ANTS "एन्ट्रॉपी" को मापता है, जो मूल रूप से इस बात का माप है कि AI उस विशिष्ट क्षण में कितना भ्रमित या अनिश्चित है। यह अपने गेट को कितना चौड़ा खोलना है, इसका निर्णय लेने के लिए इस मीटर का उपयोग करता है।

3. सेफ्टी नेट: "फालबैक आर्म" (Fallback Arm)

यह इस आविष्कार का सबसे महत्वपूर्ण हिस्सा है।
कल्पना कीजिए कि स्मार्ट गाइड (ANTS) बहुत अधिक मददगार होने की कोशिश कर रहा है। वह रास्तों को इतनी आक्रामक तरीके से काटने लगता है कि छात्र फंस जाता है या बेतुकी बातें (nonsense) करने लगता है।

  • फालबैक (Fallback): ANTS के पास एक विशेष "इमरजेंसी बटन" (जिसे फालबैक आर्म कहा जाता है) है। यदि गाइड को एहसास होता है कि रास्तों को काटना चीजों को बदतर बना रहा है, तो वह तुरंत बटन दबाकर रास्तों को काटना पूरी तरह से बंद कर सकता है। यह तुरंत मूल, अनफिल्टर्ड तरीके पर वापस आ जाता है।
  • यह क्यों मायने रखता है: पुराने दिनों में, यदि कोई फिल्टर बहुत सख्त था, तो AI केवल बदतर होता जाता था। ANTS के साथ, सिस्टम यह "सीख" सकता है कि कब सख्त होना बंद करना है और कब स्वतंत्र होना है, जिससे इसकी ट्रेनिंग स्थिर बनी रहती है।

4. परिणाम: यह जितना लंबा संवाद, उतना बेहतर

शोधकर्ताओं ने एक बड़े AI मॉडल पर विभिन्न "बजट" (शब्दों की सीमा) के साथ इसका परीक्षण किया।

  • छोटे बजट (8K शब्द): परिणाम मिले-जुले रहे। कोडिंग जैसे कार्यों के लिए, ANTS के साथ AI वास्तव में बदतर प्रदर्शन करता है। ऐसा लगता है कि जब आपके पास काम करने के लिए बहुत कम जगह होती है, तो किन शब्दों को अनुमति देनी है, इसे लेकर बहुत अधिक चयनात्मक होना परिणाम को नुकसान पहुँचा सकता है।
  • लंबे बजट (16K और 32K शब्द): यहीं पर ANTS चमकता है। जैसे-जैसे अनुमत लंबाई बढ़ी, ANTS काफी बेहतर हुआ।
    • निर्देश पालन (Instruction Following): जब लंबे समय तक जटिल नियमों का पालन करने के लिए कहा गया, तो ANTS ने AI को नियमों को भूलने या बड़बड़ाने (rambling) से रोका।
    • गणित और तर्क (Math & Logic): कठिन गणितीय समस्याओं पर, ANTS ने AI को गलत चरणों का भ्रम (hallucination) पैदा करने से बचने में मदद की, जिससे बेहतर स्कोर मिले।
    • "कोडफोर्स" (Codeforces) ट्विस्ट: दिलचस्प बात यह है कि कोडिंग कार्यों के लिए, ANTS छोटे स्तर पर बुरा था लेकिन लंबे स्तर पर अद्भुत था। यह सुझाव देता है कि जटिल कोडिंग के लिए, सही विचार पर टिकने से पहले कई विचारों को खोजने की स्वतंत्रता की आवश्यकता होती है, लेकिन केवल तभी जब आपके पास इसके लिए पर्याप्त जगह हो।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि हमें "सैंपलिंग" पद्धति (AI अगला शब्द कैसे चुनता है) को केवल एक साधारण सेटिंग के रूप में नहीं देखना चाहिए जिसे आप चालू या बंद कर सकते हैं। इसके बजाय, इसे एक डायनेमिक कंट्रोलर के रूप में होना चाहिए जो निम्नलिखित के आधार पर अपना व्यवहार बदलता है:

  1. उत्तर को कितना लंबा होना चाहिए।
  2. AI उस क्षण में कितना भ्रमित है।
  3. क्या वर्तमान रणनीति काम कर रही है या इसे रीसेट करने के लिए "इमरजेंसी बटन" दबाने की आवश्यकता है।

संक्षेप में, ANTS एक ऐसा सिस्टम है जो AI को यह सिखाता है कि कब केंद्रित होना है, कब रचनात्मक होना है, और कब "स्मार्ट" बनने की कोशिश छोड़ देनी चाहिए और बस स्वाभाविक रूप से बहने देना चाहिए, ताकि वह एक लंबी बातचीत के बीच में खो न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →