← नवीनतम पेपर
🤖 machine learning

Efficient Test-Time Inference via Deterministic Exploration of Truncated Decoding Trees

यह शोध पत्र डिस्टिंक्ट लीफ एन्यूमरेशन (DLE) का प्रस्ताव करता है, जो एक नियतात्मक डिकोडिंग विधि है जो रेडंडेंट सैंपलिंग और टोकन जनरेशन को समाप्त करने के लिए एक प्रून की गई ट्री में अद्वितीय रीजनिंग पाथ्स को व्यवस्थित रूप से सूचीबद्ध करती है, जिससे पारंपरिक सेल्फ-कंसिस्टेंसी की तुलना में गणित, कोडिंग और रीजनिंग कार्यों पर उच्च इन्फरेंस दक्षता और बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Xueyan Li, Johannes Zenn, Ekaterina Fadeeva, Guinan Su, Mrinmaya Sachan, Jonas Geiping

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xueyan Li, Johannes Zenn, Ekaterina Fadeeva, Guinan Su, Mrinmaya Sachan, Jonas Geiping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कठिन पहेली सुलझाने की कोशिश कर रहे हैं, और आपके पास मदद के लिए एक बहुत ही बुद्धिमान लेकिन थोड़ा दोहराव करने वाला दोस्त (AI) है।

समस्या: "ब्रोकन रिकॉर्ड" (एक ही बात दोहराने वाला) दोस्त

वर्तमान में, जब हम AI मॉडल से कठिन समस्याओं (जैसे गणित या कोडिंग) को हल करने के लिए कहते हैं, तो हम सेल्फ-कंसिस्टेंसी (Self-Consistency) नामक एक रणनीति का उपयोग करते हैं। हम AI से एक ही सवाल 32 बार पूछते हैं, इस उम्मीद में कि यदि हमें 32 अलग-अलग उत्तर मिलते हैं, तो सबसे आम उत्तर ही सही होगा।

लेकिन यहाँ एक पेच है: AI आलसी और दोहराव करने वाला है।
यदि आप अपने दोस्त से एक ही पहेली 32 बार पूछते हैं, तो वे शायद पहले 20 उत्तरों की शुरुआत बिल्कुल एक ही वाक्य से करेंगे। वे शायद पहले 15 उत्तरों का समापन भी बिल्कुल एक ही निष्कर्ष के साथ करेंगे।

  • बर्बादी: आप AI को बार-बार वही विचार दोहराने के लिए भुगतान कर रहे हैं। यह ऐसा है जैसे 32 लोगों को एक रिपोर्ट लिखने के लिए काम पर रखना, लेकिन वे सभी एक ही परिचय टाइप करके शुरू करते हैं, जिससे मुख्य काम तक पहुँचने से पहले ही आधा बजट बर्बाद हो जाता है।
  • छूटा हुआ अवसर: क्योंकि AI बार-बार उसी "सुरक्षित" उत्तर की ओर लौटता रहता है, वह कभी भी उन अजीब, रचनात्मक या थोड़े जोखिम भरे रास्तों की खोज नहीं कर पाता जो वास्तव में सही समाधान रख सकते हैं।

समाधान: डिस्टिंक्ट लीफ एन्यूमरेशन (DLE - Distinct Leaf Enumeration)

लेखक इस नए तरीके का प्रस्ताव देते हैं जिसे डिस्टिंक्ट लीफ एन्यूमरेशन (DLE) कहा जाता है।

AI की सोचने की प्रक्रिया को एक विशाल पेड़ के रूप में सोचें जो जमीन से ऊपर की ओर बढ़ रहा है।

  • तणा (Trunk): वह प्रश्न जो आपने पूछा।
  • शाखाएँ (Branches): वे अलग-अलग शब्द या संख्याएँ जो AI अगला बोल सकता है।
  • पत्तियाँ (Leaves): अंतिम उत्तर।

पुराना तरीका (Self-Consistency) कैसे काम करता है:
यह एक जंगल में छिपे खजाने को खोजने के लिए 32 हाइकर्स (पदयात्रियों) को भेजने जैसा है। लेकिन हाइकर्स की आँखों पर पट्टी बंधी है और वे बस रैंडम तरीके से रास्ता चुनते हैं। क्योंकि जंगल में कुछ बहुत ही स्पष्ट और चौड़े रास्ते हैं, इसलिए सभी 32 हाइकर उन्हीं तीन रास्तों पर चल पड़ते हैं। वे सभी एक ही तरह के डेड-एंड (बंद रास्तों) में फंस जाते हैं, और वे उस गुप्त रास्ते को कभी नहीं खोज पाते जो घनी झाड़ियों में छिपा हुआ है।

नया तरीका (DLE) कैसे काम करता है:
DLE एक स्मार्ट मैप एक्सप्लोरर की तरह है।

  1. कोई दोहराव नहीं: यह मानचित्र को देखता है और कहता है, "ठीक है, हमने पहले ही रास्ता A तय कर लिया है। अब हम वहां दोबारा नहीं जाएंगे।"
  2. व्यवस्थित अन्वेषण (Systematic Exploration): अनुमान लगाने के बजाय, यह जानबूझकर अगले सबसे अच्छे रास्ते को चुनता है जिसे अभी तक खोजा नहीं गया है। यह AI को नए क्षेत्रों में विस्तार करने के लिए मजबूर करता है।
  3. चलने में साझेदारी (Sharing the Walk): यदि दो रास्ते पहले 10 कदम साझा करते हैं (तणा और निचली शाखाएँ), तो DLE केवल उन कदमों को एक बार चलता है। फिर यह अलग होकर विभिन्न शाखाओं की खोज करता है। यह ऊर्जा (कंप्यूटिंग पावर) की भारी बचत करता है।

एक सरल उपमा: रेस्टोरेंट का मेनू

कल्पना कीजिए कि आप एक रेस्टोरेंट में हैं जहाँ एक बहुत बड़ा मेनू (AI की शब्दावली) है।

  • पुराना तरीका: आप वेटर से आपके लिए 32 अलग-अलग व्यंजन लाने के लिए कहते हैं। वेटर, थोड़ा भ्रमित होकर, आपको 32 प्लेट "स्पैगेटी बोलोग्नीज़" लाकर देता है क्योंकि यह सबसे लोकप्रिय आइटम है। आप 32 प्लेटों के लिए भुगतान करते हैं, लेकिन आपको केवल एक ही प्रकार का भोजन मिलता है।
  • DLE तरीका: आप वेटर से कहते हैं, "मेरे लिए 32 अलग-अलग व्यंजन लाएं, लेकिन उन सभी के लिए एक ही ऐपेटाइज़र (स्टार्टर) से शुरुआत करें।"
    • वेटर ऐपेटाइज़र को एक बार लाता है (समय/पैसा बचाता है)।
    • फिर, वे सावधानीपूर्वक 32 अद्वितीय मुख्य व्यंजन (main courses) चुनते हैं, यह सुनिश्चित करते हुए कि कोई भी दो एक जैसे न हों।
    • आपको समान कीमत पर बहुत अधिक विविधता मिलती है, जिससे आपके लिए परफेक्ट डिश खोजने की संभावना बढ़ जाती है।

यह क्यों महत्वपूर्ण है?

  1. बेहतर उत्तर: AI को उन रास्तों को देखने के लिए मजबूर करके जिन्हें वह आमतौर पर अनदेखा कर देता है, DLE गणित और कोडिंग की समस्याओं के लिए बेहतर समाधान खोजता है। यह एक वीडियो गेम के "हिडन लेवल" को खोजने जैसा है जिसे औसत खिलाड़ी मिस कर देता है।
  2. तेज़ और सस्ता: क्योंकि AI को बार-बार वही शुरुआती वाक्य फिर से टाइप करने की आवश्यकता नहीं होती है, इसलिए यह काम को बहुत तेज़ी से पूरा करता है। यह एक निर्माण दल की तरह है जो हर कमरे के लिए एक नया ढांचा बनाने के बजाय, अलग-अलग हिस्सों के लिए एक ही मचान (scaffolding) साझा करता है।
  3. दक्षता (Efficiency): AI की दुनिया में, "कंप्यूट" (प्रोसेसिंग पावर) का मतलब पैसा है। DLE आपको आपके खर्च के बदले अधिक "सोचने" की क्षमता देता है, क्योंकि यह AI को डुप्लिकेट्स पर समय बर्बाद करने से रोकता है।

निष्कर्ष (The Bottom Line)

पेपर का तर्क है कि AI को केवल खुद को दोहराकर "कठिन सोचने" के लिए कहने के बजाय, हमें इसे अलग तरह से सोचने के लिए कहना चाहिए। नए रास्तों को व्यवस्थित रूप से खोजकर और दोहराए गए उत्तरों के "इको चैंबर" से बचकर, हमें बेहतर परिणाम, तेज़ी से और कम लागत पर मिलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →