← नवीनतम पेपर
📊 statistics

Don't Throw Away Your Beams: Improving Consistency-based Uncertainties in LLMs via Beam Search

यह शोध पत्र बड़े भाषा मॉडलों (large language models) में निरंतरता-आधारित अनिश्चितता परिमाणीकरण (consistency-based uncertainty quantification) के लिए उम्मीदवारों को उत्पन्न करने हेतु मल्टीनोमियल सैंपलिंग (multinomial sampling) के स्थान पर बीम सर्च (beam search) के उपयोग का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण विचरण (variance) को कम करता है और लघु-रूप प्रश्नोत्तर (short-form QA) कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Don't Throw Away Your Beams" शोध पत्र का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: AI प्रतिक्रिया का "इको चैंबर" (Echo Chamber)

कल्पना कीजिए कि आप एक लार्ज लैंग्वेज मॉडल (LLM) से एक साधारण प्रश्न पूछते हैं जैसे: "Who sang 'Thriller'?" (थ्रिलर किसने गाया?)

AI अपने उत्तर के प्रति कितना आत्मविश्वासी (confident) है, यह निर्धारित करने के लिए, शोधकर्ता आमतौर पर AI को उसी प्रश्न के उत्तर देने के लिए कई बार (मान लीजिए 10 बार) कहते हैं और यह देखते हैं कि उत्तरों में कितनी समानता है। इसे कंसिस्टेंसी-बेस्ड अनसर्टेन्टी (Consistency-Based Uncertainty) कहा जाता है।

  • पुरानी विधि (Multinomial Sampling): कल्पना कीजिए कि यह एक भारित पासे (loaded die) को फेंकने जैसा है। यदि AI 90% निश्चित है कि उत्तर "Michael Jackson" है, तो हर बार जब आप पासा फेंकेंगे, तो वह "Michael Jackson" पर ही गिरेगा। आपको 10 उत्तर मिलेंगे, और उनमें से 9 या 10 बिल्कुल एक जैसे होंगे।
    • दोष: क्योंकि AI आपको बार-बार बिल्कुल एक ही उत्तर दे रहा है, आप सोच सकते हैं: "वाह, यह बहुत आत्मविश्वासी है!" लेकिन वास्तव में, AI बस एक लूप में फंस गया है। इसने अन्य संभावनाओं को तलाशा ही नहीं है। यदि वास्तविक उत्तर "Prince" (एक गलत परिकल्पना) होता, तो भी AI "Prince" कहने के लूप में फंसा रह सकता था, जिससे आपको यह विश्वास दिलाने में धोखा मिल सकता है कि वह आत्मविश्वासी है, जबकि वह गलत हो। इसके अलावा, 10 एक जैसे उत्तर प्राप्त करना कंप्यूटिंग शक्ति की बर्बादी है।

नया समाधान: "बीम सर्च" जासूस (The "Beam Search" Detective)

लेखक इन 10 उत्तरों को प्राप्त करने का एक नया तरीका प्रस्तावित करते हैं। पासा फेंकने के बजाय, वे बीम सर्च (Beam Search) नामक रणनीति का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि आप एक शहर में संदिग्ध की तलाश कर रहे एक जासूस हैं।
    • Multinomial Sampling में 10 लोगों को बेतरतीब ढंग से सड़क पर किसी भी व्यक्ति से पूछने के लिए भेजा जाता है। यदि भीड़ ज्यादातर "Michael Jackson" कहती है, तो सभी 10 लोग "Michael Jackson" कहकर लौटते हैं।
    • Beam Search में 10 जासूसों को एक साथ 10 सबसे संभावित सड़कों (most probable streets) पर भेजा जाता है। भले ही "Michael Jackson" सबसे लोकप्रिय उत्तर हो, बीम सर्च जासूसों को दूसरी, तीसरी और चौथी सबसे संभावित सड़कों की भी जांच करने के लिए मजबूर करता है।
    • परिणाम: आपको 10 अलग-अलग उत्तरों की एक सूची मिलती है (उदाहरण के लिए: "Michael Jackson", "Mr. Jackson", "Prince", "Bruno Mars")।

यह बेहतर क्यों है: "विविधता" का बोनस (The "Diversity" Bonus)

शोध पत्र का तर्क है कि बीम सर्च का उपयोग करके, आप दो प्रमुख लाभ प्राप्त करते हैं:

  1. डुप्लिकेट्स का अंत: आप एक ही उत्तर को 10 बार प्राप्त करने में समय बर्बाद करना बंद कर देते हैं। आपको AI के विचारों की वास्तविक विविधता मिलती है।
  2. ईमानदार कॉन्फिडेंस स्कोर:
    • यदि AI आपको 10 अलग-अलग उत्तर देता है (कुछ सही, कुछ गलत), तो सिस्टम समझ जाता है: "हे भगवान, AI सुनिश्चित नहीं है!" और कम कॉन्फिडेंस स्कोर देता है।
    • यदि AI आपको 10 उत्तर देता है जो सभी बहुत समान हैं (भले ही वे एक ही विचार के थोड़े अलग रूप हों), तो सिस्टम समझ जाता है: "ठीक है, AI काफी आश्वस्त है," और उच्च कॉन्फिडेंस स्कोर देता है।

गुप्त सामग्री: उत्तरों को वेटेज देना (Weighting the Answers)

शोध पत्र एक चतुर तकनीक भी पेश करता है। तथ्य यह है कि बीम सर्च 10 अलग-अलग रास्ते खोजता है, इसका मतलब यह नहीं है कि वे सभी समान रूप से संभावित हैं।

  • उपमा: कल्पना कीजिए कि AI एक मौसम विज्ञानी है।
    • पथ A (बीम 1): "बारिश होगी" (90% संभावना)।
    • पथ B (बीम 10): "बारिश होगी" (0.01% संभावना)।
    • यदि हम दोनों रास्तों को समान मानते हैं, तो हम गणित को बिगाड़ देते हैं।
    • समाधान: लेखक कहते हैं: "आइए 'It will rain' वाले उत्तर को पथ A से 90 वोट और पथ B से 0.01 वोट मानें।" वे एक प्रोबेबिलिटी-वेटेड एस्टिमेटर (probability-weighted estimator) का उपयोग करते हैं। यह सुनिश्चित करता है कि AI का कॉन्फिडेंस स्कोर उत्तरों की वास्तविक संभावना को दर्शाता है, न कि केवल इस तथ्य को कि वे अलग हैं।

प्रमाण: क्या यह काम करता है?

शोधकर्ताओं ने तीन अलग-अलग AI मॉडल का उपयोग करके छह अलग-अलग प्रश्न-उत्तर डेटासेट (जैसे क्विज़, विज्ञान और सामान्य ज्ञान) पर इस पद्धति का परीक्षण किया।

  • परिणाम: "बीम सर्च" विधि ने पुरानी "पासा फेंकने वाली" (Roll the Die) विधि को लगातार पछाड़ दिया।
  • मेट्रिक: उन्होंने PRR (Prediction-Rejection Ratio) नामक एक स्कोर का उपयोग किया। कल्पना कीजिए कि यह एक परीक्षण है कि: "यदि हम अपने कॉन्फिडेंस स्कोर के आधार पर AI के सबसे खराब उत्तरों को हटा देते हैं, तो क्या शेष उत्तरों में सुधार होता है?"
  • अंतिम परिणाम: बीम सर्च विधि बुरे उत्तरों को पहचानने और अच्छे उत्तरों को रखने में बेहतर थी। इसने स्टेट-ऑफ-द-आर्ट (State-of-the-Art) परिणाम प्राप्त किए, जिसका अर्थ है कि यह छोटे तथ्यात्मक प्रश्नों के लिए वर्तमान में उपलब्ध सर्वश्रेष्ठ विधि है।

निष्कर्ष

शोध पत्र कहता है: अपने बीम्स को फेंकिए मत (Don't throw away your beams)।

AI की दुनिया में, "बीम्स" वे कई रास्ते हैं जिनका मॉडल उत्तर खोजने के लिए पता लगाता है। लेखक दिखाते हैं कि उत्तरों के लिए रैंडम सैंपलिंग करने के बजाय (जो अक्सर उबाऊ डुप्लिकेट्स की ओर ले जाता है), हमें बीम सर्च के संरचित रास्तों का उपयोग करना चाहिए। ऐसा करके, और प्रत्येक पथ की संभावना को सावधानीपूर्वक गिनकर, हम AI के लिए बहुत अधिक सटीक "कॉन्फिडेंस मीटर" प्राप्त कर सकते हैं। यह हमें यह जानने में मदद करता है कि हमें AI पर कब भरोसा करना चाहिए और कब संदेह करना चाहिए, विशेष रूप से छोटे तथ्यात्मक प्रश्नों के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →