← नवीनतम पेपर
🤖 AI

OLLM: Options-based Large Language Models

यह शोध पत्र ऑप्शंस-आधारित लार्ज लैंग्वेज मॉडल्स (OLLM) को प्रस्तुत करता है, जो एक हल्का आर्किटेक्चरल प्लग-इन है जो सिंगल नेक्स्ट-टोकन प्रेडिक्शन को एक डिस्क्रीट लेटेंट वेरिएबल द्वारा इंडेक्स किए गए सीखे हुए ऑप्शंस के सेट से बदल देता है, जिससे मानक बेसलाइन्स की तुलना में अधिक सैंपल-एफिशिएंट पॉलिसी लर्निंग और गणितीय तर्क प्रदर्शन में महत्वपूर्ण सुधार सक्षम होता है।

मूल लेखक: Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "OLLM: ऑप्शंस-बेस्ड लार्ज लैंग्वेज मॉडल्स" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए स्पष्टीकरण दिया गया है।

समस्या: "एक-विकल्प" की दुविधा (The "One-Choice" Dilemma)

कल्पना कीजिए कि आप एक दोस्त के साथ कहानी लिख रहे हैं जो एक AI है। हर बार जब आप एक वाक्य पूरा करते हैं, तो AI को अगले शब्द का अनुमान लगाना होता है।

मानक AI मॉडल्स में, AI डिक्शनरी के सभी संभावित शब्दों (हजारों शब्द) को देखता है और अगले शब्द के रूप में केवल एक को चुनता है। यह एक जंगल में से एक ही रास्ता चुनने जैसा है, भले ही वहाँ तीन या चार समान रूप से अच्छे रास्ते मौजूद हों। यदि AI शुरुआत में ही "गलत" रास्ता चुन लेता है (भले ही वह एक वैध रास्ता हो), तो वह बाद में एक डेड एंड (बंद रास्ते) में फंस सकता है।

AI को अधिक रचनात्मक या विविध बनाने के लिए, डेवलपर्स आमतौर पर "टेम्परेचर" (temperature) नॉब का उपयोग करते हैं। यह पासे (dice) को हिलाने जैसा है ताकि AI रैंडम शब्द चुन सके। लेकिन यह अव्यवस्थित है। कभी-कभी यह ऐसा शब्द चुन लेता है जिसका कोई अर्थ नहीं होता, या यह दूसरी भाषा बोलने लगता है, या गोल-गोल घूमने लगता है। यह स्टीयरिंग व्हील पर डार्ट फेंककर कार चलाने की कोशिश करने जैसा है।

समाधान: "मेन्यू" दृष्टिकोण (The "Menu" Approach - OLLM)

इस पेपर के लेखक, शशांक शर्मा और उनके सहयोगियों ने OLLM (ऑप्शंस लार्ज लैंग्वेज मॉडल) नामक एक स्मार्ट तरीका प्रस्तावित किया है।

AI को तुरंत एक शब्द चुनने के लिए मजबूर करने के बजाय, वे AI को अगले शब्द के लिए विकल्पों का एक छोटा मेन्यू (जैसे 10 विकल्प) देते हैं।

इसे एक रेस्टोरेंट में ऑर्डर देने की तरह समझें:

  • पुराना तरीका: वेटर (AI) पूरे मेन्यू में से एक रैंडम डिश चिल्लाकर बताता है। अगर आपको वह पसंद नहीं आई, तो आपको फिर से शुरुआत करनी होगी।
  • OLLM तरीका: वेटर आपके सामने आपके वर्तमान ऑर्डर के अनुकूल 10 स्वादिष्ट व्यंजनों की एक छोटी, चुनिही हुई सूची पेश करता है। फिर आप (या एक स्मार्ट मैनेजर) उस सूची में से सबसे अच्छा विकल्प चुनते हैं।

यह कैसे काम करता है: "ट्रांसलेटर" और "मैनेजर"

यह पेपर एक सरल "प्लग-इन" सिस्टम पेश करता है जो पूरे मॉडल को फिर से बनाए बिना मौजूदा AI मॉडल्स पर फिट हो जाता है। यह दो छोटे हिस्से जोड़ता है:

  1. एन्कोडर (द ट्रांसलेटर - अनुवादक):
    जब AI अगले शब्द के बारे में सोच रहा होता है, तो यह हिस्सा संदर्भ (context) और सही उत्तर (ट्रेनिंग के दौरान) को देखता है। यह "कौन सा शब्द?" के जटिल निर्णय को एक सरल कोड में बदल देता है, जैसे कि 1 से 10 तक की एक संख्या।
  • उपमा: कल्पना कीजिए कि एक अनुवादक एक जटिल वाक्य सुनता है और कहता है, "ठीक है, इस भाग के लिए, हम विकल्प 3 के क्षेत्र में हैं।"
  1. डिकोडर (द मैनेजर - प्रबंधक):
    यह हिस्सा उस सरल कोड (विकल्प 3) को लेता है और AI की सोच को इस तरह समायोजित करता है कि वह सुनिश्चित हो सके कि चुना गया शब्द उस विकल्प के अनुकूल हो।
  • उपमा: मैनेजर किचन को बताता है, "आज हम विकल्प 3 बना रहे हैं, इसलिए केवल वही व्यंजन परोसें जो विकल्प 3 के अनुकूल हों।"

असली जादू: "लो-डायमेंशनल" पॉलिसी (The "Low-Dimensional" Policy)

असली जादू तब होता है जब AI का वास्तव में उपयोग किया जा रहा होता है (inference)। AI द्वारा रैंडम अनुमान लगाने के बजाय, एक छोटा, स्मार्ट "पॉलिसी" (एक छोटा मैनेजर) स्थिति को देखता है और सबसे अच्छा विकल्प नंबर (जैसे, "चलिए विकल्प 4 के साथ चलते हैं") चुनता है।

यह बेहतर क्यों है?

  • दक्षता (Efficiency): एक मैनेजर के लिए 10 विकल्पों में से चुनना बहुत आसान है बजाय इसके कि वह 50,000 शब्दों में से चुने। यह 10 सुइयों वाली एक छोटी डिब्बे में सुई खोजने जैसा है, न कि घास के ढेर में सुई खोजने जैसा।
  • सुरक्षा (Safety): क्योंकि AI को केवल उन्हीं विकल्पों में से चुनने की अनुमति है जो उसने अपनी ट्रेनिंग के दौरान सीखे हैं, यह अचानक फ्रेंच बोलने या बेतुकी बातें (hallucinations) करने का निर्णय नहीं ले सकता। यह उन "सुरक्षित रास्तों" पर बना रहता है जिन्हें वह पहले से जानता है।
  • गणितीय शक्ति (Math Superpowers): इस पेपर का परीक्षण गणित की समस्याओं पर किया गया। मानक AI मॉडल्स ने लगभग 51% उत्तर सही दिए। OLLM मॉडल, जब उसे चुनने के लिए सबसे अच्छा विकल्प दिया गया, तो वह 70% तक पहुँच सका।

"पेड़" की उपमा (The "Tree" Analogy)

कल्पना कीजिए कि गणित की समस्या हल करना एक पेड़ की शाखाओं पर चढ़ने जैसा है।

  • मानक AI: यह रैंडम तरीके से एक शाखा चुनता है। यदि वह शाखा एक डेड एंड (बंद रास्ते) की ओर ले जाती है, तो पूरा उत्तर गलत हो जाता है।
  • OLLM: यह देखता है कि इस विशिष्ट मोड़ पर, तीन वैध शाखाएँ हैं। यह उन तीनों को अपने "विकल्प मेन्यू" में जीवित रखता है। बाद में, एक स्मार्ट मैनेजर पूरे पेड़ को देखता है और उस शाखा को चुनता है जो फल (सही उत्तर) की ओर ले जाती है।

यह क्यों महत्वपूर्ण है

यह तरीका एक "प्लग-एंड-प्ले" अपग्रेड है। आपको AI के पूरे विशाल मस्तिष्क को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; आपको बस ये दो छोटे लेयर्स जोड़ने हैं। यह AI को बनाता है:

  1. गणित में स्मार्ट: यह समस्या को हल करने के विभिन्न तरीकों को खोज सकता है बिना रास्ता भटके।
  2. अधिक नियंत्रणीय: हम अलग-अलग "विकल्पों" को चुनकर AI को रचनात्मक या तार्किक बनाने के लिए निर्देशित कर सकते हैं।
  3. कम बर्बादी वाला: इसे एक अच्छा उत्तर खोजने के लिए लाखों रैंडम अनुमान लगाने की आवश्यकता नहीं है।

संक्षेप में, OLLM AI को अंधे होकर अनुमान लगाने से रोकता है और उसे अच्छे विकल्पों का एक मेन्यू देना शुरू करता है, जिससे एक स्मार्ट मैनेजर विजेता का चयन कर सके। यह AI को तेज़, सुरक्षित और कठिन समस्याओं को हल करने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →