← नवीनतम पेपर
💬 NLP

When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling

यह शोध पत्र SAFE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो लंबी-लंबी सामग्री के सृजन (long-form generation) के लिए LLM एन्सेम्बलिंग की स्थिरता और दक्षता को बढ़ाता है, जो केवल उन विशिष्ट टोकन पर मॉडलों को चुनिंदा रूप से एकत्रित करता है जहाँ टोकेनाइजेशन विसंगतियां न्यूनतम होती हैं और सहमति उच्च होती है, जबकि आत्मविश्वास बनाए रखने के लिए प्रोबेबिलिटी शार्पनिंग का उपयोग करता है।

मूल लेखक: Heecheol Yun, Kwangmin Ki, Junghyun Lee, Eunho Yang

प्रकाशित 2026-03-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heecheol Yun, Kwangmin Ki, Junghyun Lee, Eunho Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास तीन प्रतिभाशाली शेफ (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक टीम है जो मिलकर एक लंबी, जटिल रेसिपी लिखने की कोशिश कर रही है। प्रत्येक शेफ का अपनी पसंद का सब्जियां काटने और मसाले मापने का अपना अनूठा तरीका (उनके tokenizers) है।

आमतौर पर, जब आप सबसे अच्छा परिणाम चाहते हैं, तो आप हर एक कदम पर तीनों शेफ को डिश चखने और अगले घटक (ingredient) पर वोट देने के लिए कहते हैं। इसे Ensembling कहा जाता है।

हालाँकि, पेपर "When to Ensemble" इस दृष्टिकोण के साथ एक बड़ी समस्या की खोज करता है: यदि आप उन्हें हर एक शब्द पर वोट देने के लिए कहते हैं, तो रेसिपी अक्सर एक आपदा बन जाती है।

यहाँ इसका सरल विवरण दिया गया है कि ऐसा क्यों होता है और लेखकों की नई विधि, SAFE, इसे कैसे ठीक करती है।

समस्या: "खराब सामग्री" का जाल (The "Bad Ingredient" Trap)

कल्पना कीजिए कि शेफ A को "Sofia" शब्द लिखना है।

  • शेफ A इसे एक बड़े टुकड़े के रूप में देखता है: Sofia|।
  • शेफ B इसे तीन छोटे टुकड़ों के रूप में देखता है: So, fi, a|।

यदि टीम पहले टुकड़े, So पर वोट देती है, और आगे बढ़ने का निर्णय लेती है, तो शेफ B अब भ्रमित हो जाएगा। शेफ B उम्मीद कर रहा था कि पूरा शब्द Sofia एक साथ दिखाई देगा, लेकिन इसके बजाय, उसे केवल So से ही आगे बढ़ने के लिए मजबूर किया गया है। शेफ B के लिए, So एक अजीब, टूटा हुआ टुकड़ा (एक "OOV-like token") लग रहा है।

क्योंकि शेफ B भ्रमित है, वह मतिभ्रम (hallucination) का शिकार हो सकता है। fi लिखने के बजाय, वह ~A या fia लिख सकता है या बार-बार एक ही अजीब अक्षर दोहरा सकता है। एक बार जब एक शेफ भ्रमित हो जाता है, तो पूरी टीम का आउटपुट खराब होने लगता है, विशेष रूप से लंबी कहानियों या जटिल गणितीय समस्याओं में।

पुराना तरीका: टीम हर एक शब्द पर वोट करती है। यह इतनी बार होता है कि शेफ लगातार भ्रमित हो जाते हैं, जिससे बड़बड़ाहट (gibberish) पैदा होती है।

समाधान: SAFE विधि

लेखक एक नई प्रणाली प्रस्तावित करते हैं जिसे SAFE (Stable And Fast LLM Ensembling) कहा जाता है। SAFE को एक स्मार्ट प्रोजेक्ट मैनेजर के रूप में सोचें जो जानता है कि कब मीटिंग बुलानी है और कब शेफ को अकेले खाना पकाने देना है।

SAFE एक Draft-and-Verify रणनीति का उपयोग करता है, जो इस तरह है जैसे एक लेखक एक पैराग्राफ का ड्राफ्ट तैयार करता है और फिर एक संपादक उसे चेक करता है।

1. "ड्राफ्टर" (तेज़ लेखक - The Drafter)

एक शेफ (सबसे अच्छा वाला) को टेक्स्ट का एक पूरा हिस्सा तेज़ी से लिखने के लिए चुना जाता है, जैसे कि बिना रुके एक बार में 5 शब्द, बिना दूसरों से पूछे।

  • उपमा: मुख्य लेखक एक वाक्य टाइप करता है: "The quick brown fox jumps."

2. "वेरिफायर" (गुणवत्ता जांचकर्ता - The Verifiers)

अन्य शेफ टेक्स्ट के उस हिस्से को देखते हैं। वे उसे दोबारा नहीं लिखते; वे बस दो चीजें चेक करते हैं:

  • चेक 1: क्या टेक्स्ट टूटा हुआ है? (Tokenization Mismatch)
    • वे पूछते हैं: "यदि हम इस शब्द से आगे बढ़ते हैं, तो क्या यह हम में से किसी को भ्रमित करेगा?"
    • यदि शब्द Sofia है लेकिन शेफ B केवल So देखता है, तो वे इसे फ्लैग (flag) करते हैं। यहाँ कोई वोटिंग नहीं होती है। भ्रम से बचने के लिए टीम ड्राफ्टर के शब्द को ही स्वीकार कर लेती है।
  • चेक 2: क्या हम सब सहमत हैं? (Consensus)
    • वे पूछते हैं: "क्या हम 100% सुनिश्चित हैं कि यह सही शब्द है?"
    • यदि सभी इस बात पर सहमत हैं कि शब्द सही है, तो यहाँ कोई वोटिंग नहीं होती है। समय बर्बाद करने की क्या ज़रूरत है?
    • यदि वे असहमत हैं (जैसे, एक शेफ को लगता है कि यह "fox" है और दूसरा "box" समझता है), तब वे रुकते हैं और वोट देते हैं।

3. "एन्सेम्बल" (वोट - The Ensemble)

केवल उन विशिष्ट बिंदुओं पर जहाँ शेफ भ्रमित होते हैं या असहमत होते हैं, टीम रुकती है, अपने ज्ञान को जोड़ती है, और सबसे अच्छा शब्द चुनती है।

  • उपमा: टीम केवल रेसिपी के कठिन हिस्सों पर चर्चा करने के लिए इकट्ठा होती है, न कि "नमक डालें" जैसे आसान कामों के लिए।

यह "SAFE" क्यों है?

  1. स्थिरता (कोई बड़बड़ाहट नहीं - Stability): उन शब्दों पर वोट करने से बचकर जो टोकनाइज़र को भ्रमित कर सकते हैं, टीम "टूटी हुई सामग्री" की समस्या से बच जाती है। टेक्स्ट बिना किसी अजीब टाइपो या दोहराव के स्वाभाविक रूप से बहता है।
  2. गति (तेज़ और कुशल - Speed): चूंकि वे शब्दों के बहुत छोटे हिस्से (कभी-कभी 1% से भी कम) पर ही वोट करते हैं, इसलिए यह प्रक्रिया लगभग एक एकल शेफ के उपयोग जितनी तेज़ होती है। वे स्पष्ट शब्दों पर वोट करने में समय बर्बाद नहीं करते हैं।
  3. वोट को धार देना (Sharpening the Vote): कभी-कभी, जब वे वोट करते हैं, तो परिणाम बहुत "धुंधले" (mushy) होते हैं (जैसे, हर कोई दो अलग-अलग चीजों के बारे में 50% निश्चित है)। SAFE Probability Sharpening नामक एक ट्रिक का उपयोग करता है ताकि टीम को सबसे आत्मविश्वासी उत्तर चुनने के लिए मजबूर किया जा सके, जैसे कि रेफरी अंतिम फैसला सुनाने के लिए सीटी बजाता है।

वास्तविक दुनिया का परिणाम

पेपर ने कठिन गणितीय समस्याओं और तर्क पहेलियों पर इसका परीक्षण किया।

  • पुराना तरीका: हर शब्द पर वोट करने की कोशिश की। परिणाम: धीमा, और गणित के उत्तर अक्सर गलत थे क्योंकि मॉडल टोकन मिसमैच से भ्रमित हो गए थे।
  • SAFE तरीका: केवल महत्वपूर्ण क्षणों पर वोट किया। परिणाम: तेज़ (एकल मॉडल जितना ही तेज़) और स्मार्ट (उच्च सटीकता), भले ही मॉडल्स के पास भाषा को प्रोसेस करने के बहुत अलग तरीके हों।

संक्षेप में: एक यात्रा के हर एक कदम पर एक कमेटी से वोट न मांगें। नेता को गाड़ी चलाने दें, और केवल तभी समूह से परामर्श करने के लिए रुकें जब रास्ता कठिन हो या नेता अनिश्चित हो। इसी तरह आप एक स्थिर, तेज़ और सटीक यात्रा प्राप्त कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →