← नवीनतम पेपर
💬 NLP

Entropy-Tree: Tree-Based Decoding with Entropy-Guided Exploration

यह शोध पत्र Entropy-Tree का प्रस्ताव करता है, जो एक नवीन ट्री-आधारित डिकोडिंग विधि है जो केवल वास्तविक मॉडल अनिश्चितता वाले बिंदुओं पर ब्रांचिंग निर्णयों को निर्देशित करने के लिए एंट्रॉपी का लाभ उठाती है, जिससे यह रैंडम सैंपलिंग और इंडिपेंडेंट मल्टी-सैंपलिंग जैसी मौजूदा रणनीतियों की तुलना में रीजनिंग कार्यों में बेहतर सटीकता और अंशांकन (कैलिब्रेशन) प्राप्त करता है।

मूल लेखक: Longxuan Wei, Yubo Zhang, Zijiao Zhang, Zhihu Wang, Shiwan Zhao, Tianyu Huang, Huiting Zhao, Chenfei Liu, Shenao Zhang, Junchi Yan

प्रकाशित 2026-01-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Longxuan Wei, Yubo Zhang, Zijiao Zhang, Zhihu Wang, Shiwan Zhao, Tianyu Huang, Huiting Zhao, Chenfei Liu, Shenao Zhang, Junchi Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी रोबोट से एक कठिन गणित की समस्या हल करने या एक जटिल कहानी लिखने के लिए कह रहे हैं। वह रोबोट केवल एक सीधी रेखा में "सोचता" नहीं है; उसके पास उन संभावित शब्दों का एक विशाल मानचित्र है जो वह अगला बोल सकता है।

समस्या: रोबोट की दो बुरी आदतें
वर्तमान में, जब रोबोट (लार्ज लैंग्वेज मॉडल्स) कठिन समस्याओं को हल करने की कोशिश करते हैं, तो वे आमतौर पर दो में से एक काम करते हैं, दोनों में ही कमियां हैं:

  1. "सुरक्षित" रोबोट (Greedy/Beam Search): यह रोबोट हमेशा सबसे स्पष्ट, सुरक्षित शब्द चुनता है। यह एक ऐसे पर्यटक की तरह है जो केवल मुख्य, भीड़भाड़ वाली सड़क पर चलता है क्योंकि उसे सुरक्षित महसूस होता है। वे शायद ही कभी रास्ता भटकते हैं, लेकिन वे कभी भी छिपे हुए, अद्भुत शॉर्टकट या अद्वितीय समाधानों की खोज भी नहीं कर पाते। वे उबाऊ, दोहराव वाले उत्तरों के चक्र में फंस जाते हैं।
  2. "रैंडम" रोबोट (Random Sampling): यह रोबोट पूरी तरह से रैंडम (यादृच्छिक) शब्द चुनकर रचनात्मक होने की कोशिश करता है। यह एक ऐसे पर्यटक की तरह है जो अपनी आँखें बंद करता है और घूमता है, फिर जिस दिशा में वह गिरता है, उसी दिशा में चलता है। कभी-कभी वे खजाना ढूंढ लेते हैं, लेकिन ज्यादातर वे डेड एंड (बंद रास्तों) में भटक जाते हैं या एक ही गलती को दोहराते रहते हैं। वे उन जगहों को खोजने में बहुत अधिक ऊर्जा बर्बाद करते हैं जिनका कोई महत्व नहीं है।

समाधान: एंट्रॉपी-ट्री (Entropy-Tree)
इस पेपर के लेखक, "एंट्रॉपी-ट्री," रोबोट को मार्गदर्शन देने का एक स्मार्ट तरीका प्रस्तावित करते हैं। उन्होंने महसूस किया कि रोबोट हर उस शब्द के बारे में समान रूप से अनिश्चित नहीं है जो वह बोलता है।

  • "कॉन्फिडेंस मीटर" (एंट्रॉपी): कल्पना कीजिए कि रोबोट के पास हर उस शब्द के लिए एक कॉन्फिडेंस मीटर है जिस पर वह विचार करता है।
    • लो एंट्रॉपी (उच्च आत्मविश्वास): रोबोट 100% निश्चित है। वह जानता है कि अगला शब्द "the" या "and" होगा। वह बस व्याकरण को पूरा कर रहा है।
    • हाई एंट्रॉपी (कम आत्मविश्वास): रोबोट हिचकिचा रहा है। वह दो बहुत अलग विचारों के बीच फंसा हुआ है, जैसे "therefore" बनाम "however," या गणित समीकरण को हल करने के दो अलग-अलग तरीके। यह एक रास्ते का चौराहा (fork in the road) है।

एंट्रॉपी-ट्री कैसे काम करता है: "डिसीजन फोर्क" रणनीति
रैंडम तरीके से भटकने के बजाय, एंट्रॉपी-ट्री एक स्मार्ट गाइड की तरह काम करता है जो रोबोट के कॉन्फिडेंस मीटर पर नज़र रखता है।

  1. निश्चित होने पर सीधा चलें: जब रोबोट आश्वस्त होता है (लो एंट्रॉपी), तो गाइड बस उसे सीधा चलने देता है। अन्वेषण करने में समय बर्बाद करने की कोई आवश्यकता नहीं है।
  2. अनिश्चित होने पर रुकें और शाखा बनाएँ: जैसे ही रोबोट एक "रास्ते के चौराहे" (हाई एंट्रॉपी) पर पहुँचता है, गाइड रोबोट को रोक देता है। केवल एक रास्ता चुनने के बजाय, गाइड कहता है, "ठीक है, तुम यहाँ अनिश्चित हो। चलो, दोनों रास्तों को आजमाते हैं।"
  3. एक पेड़ (Tree) बनाएँ: अब रोबोट अपने आप के कई संस्करणों में विभाजित हो जाता है, जो उस विशिष्ट निर्णय बिंदु से अलग-अलग रास्ते अपनाते हैं। वे उस बिंदु तक एक ही इतिहास साझा करते हैं (ऊर्जा बचाने के लिए), लेकिन फिर वे अलग-अलग संभावनाओं का पता लगाते हैं।
  4. विजेता चुनें: अंत में, गाइड उन सभी रास्तों को देखता है जिनसे रोबro ने गुजरने की कोशिश की और वह रास्ता चुनता है जो सही उत्तर तक ले गया।

यह बेहतर क्यों है
पेपर का दावा है कि यह तरीका एक टीम ऑफ एक्सप्लोरर्स (अन्वेषकों की टीम) की तरह है जो केवल तभी अलग होते हैं जब वे वास्तव में एक भ्रमित करने वाले चौराहे पर पहुँचते हैं, न कि जंगल के बीच में बेतरतीब ढंग से अलग होते हैं।

  • बेहतर सटीकता: क्योंकि रोबोट अपनी ऊर्जा समस्या के कठिन हिस्सों (निर्णय के चौराहों) पर केंद्रित करता है, इसलिए वह "रैंडम" रोबोट की तुलना में सही उत्तर अधिक बार पाता है।
  • बेहतर आत्म-जागरूकता: पेपर में यह भी पाया गया कि यह तरीका रोबोट को यह जानने में मदद करता है कि वह कब गलत है। यदि रोबोट कई अलग-अलग रास्तों में विभाजित होता है और वे सभी अलग-अलग, परस्पर विरोधी उत्तरों की ओर ले जाते हैं, तो सिस्टम जानता है, "हे, हम यहाँ वास्तव में बहुत भ्रमित हैं।" यह रोबोट के "अनिश्चितता स्कोर" को बहुत अधिक विश्वसनीय बनाता है।

संक्षेप में
एंट्रॉपी-ट्री एक ऐसी रणनीति है जो AI को बताती है: "जब आप सुनिश्चित हों, तो अनुमान लगाने में समय बर्बाद न करें। लेकिन जब आप वास्तव में फंसे हुए हों और हिचकिचा रहे हों, तो रुकें, अपना ध्यान विभाजित करें, और उस विशिष्ट क्षण से हर संभव दिशा को आजमाएं।" इससे अधिक स्मार्ट, अधिक सटीक और अधिक विश्वसनीय उत्तर मिलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →