← नवीनतम पेपर
🤖 AI

Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning

यह शोध पत्र OPTI-Q प्रस्तुत करता है, जो एक डेटाबेस-प्रेरित, लागत-आधारित अनुकूलन ढांचा है जो इष्टतम मल्टी-LLM निष्पादन योजनाएं उत्पन्न करने और चुनने के लिए एक सांख्यिकी कैटलॉग (PERFDB) का लाभ उठाता है, जो लागत, विलंबता और ऊर्जा पर उपयोगकर्ता-निर्धारित बाधाओं का पालन करते हुए उत्तर की गुणवत्ता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

प्रकाशित 2026-07-28
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: Opti-Q: मल्टी-LLM प्रश्न नियोजन के लिए एक बाधा-आधारित अनुकूलन ढांचा (Constraint-Based Optimization Framework)

1. समस्या विवरण (Problem Statement)

प्रश्न उत्तर देने (Question Answering - QA) के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) की तैनाती गैर-नियतता (nondeterminism), विषम संसाधन प्रोफाइल (वित्तीय लागत, विलंबता, ऊर्जा), और विभिन्न प्रकार के प्रश्नों पर अलग-अलग प्रदर्शन जैसी महत्वपूर्ण चुनौतियों का सामना करती है। जबकि हालिया कार्य यह सुझाव देते हैं कि समन्वित मल्टी-LLM सहयोग एकल "सर्वश्रेष्ठ" मॉडल्स की तुलना में बेहतर प्रदर्शन कर सकता है, फिर भी सहज निष्पादन रणनीतियाँ (जैसे, हमेशा सभी मॉडल्स को क्वेरी करना या निश्चित कैस्केड का उपयोग करना) अक्सर अक्षम संसाधन उपयोग, उच्च लागत और उप-इष्टतम उत्तर गुणवत्ता की ओर ले जाती हैं।

वर्तमान ऑर्केस्ट्रेशन फ्रेमवर्क (जैसे, LangChain, DSPy) अक्सर डेवलपर-स्क्रिप्टेड वर्कफ़्लो या निष्पादन के समय किए गए गतिशील, अल्पदर्शी (myopic) निर्णयों पर निर्भर करते हैं जो डाउनस्ट्रीम परिणामों पर विचार नहीं करते हैं। एक ऐसे सिस्टम का अभाव है जो मल्टी-LLM ऑर्केस्ट्रेशन को एक लागत-आधारित, बहु-उद्देश्यीय क्वेरी प्लानिंग समस्या के रूप में मानता हो, जहाँ उपयोगकर्ता द्वारा निर्दिष्ट बाधाओं (बजट, विलंबता, ऊर्जा) और वांछित उत्तर गुणवत्ता (QoA) के आधार पर निष्पादन से पहले इष्टतम निष्पादन योजना (क्रमिक, समानांतर, या हाइब्रिड) चुनी जाती है।

2. कार्यप्रणाली: OPTI-Q फ्रेमवर्क (Methodology: The OPTI-Q Framework)

OPTI-Q एक डेटाबेस-प्रेरित, लागत-आधारित ऑप्टिमाइज़र है जो मल्टी-LLM QA के लिए "निष्पादन-से-पहले-योजना" (plan-before-execute) प्रतिमान को लागू करता है। यह समस्या को एक मल्टी-ऑब्जेक्टिव ऑप्टिमाइज़ेशन (MOO) कार्य के रूप में मॉडल करता है जहाँ लक्ष्य QoA के विरुद्ध वित्तीय लागत, विलंबता और ऊर्जा को संतुलित करने वाले पारेटो-इष्टतम (Pareto-optimal) प्लान खोजना है।

A. मॉडलिंग और औपचारिकता (Modeling and Formalization)

  • प्रश्न मॉडल (Question Model): एक प्रश्न QQ को एक प्रॉम्प्ट, विषय, और उपयोगकर्ता बाधाओं (Fmax,Lmax,Emax,QoAminF_{max}, L_{max}, E_{max}, QoA_{min}) और एक वेट वेक्टर WW द्वारा परिभाषित किया जाता है।
  • प्लान मॉडल (Plan Model): प्लान्स को निर्देशित अचक्रीय ग्राफ़ (Directed Acyclic Graphs - DAGs) के रूप में दर्शाया जाता है जहाँ नोड्स LLM इनवोकेशन (भौतिक ऑपरेटर) हैं और किनारे (edges) डेटा प्रवाह का प्रतिनिधित्व करते हैं।
    • क्रमिक ऑपरेटर (Sequential Operators): बाद के मॉडल्स को संदर्भ (context) के रूप में मध्यवर्ती उत्तर पास करते हैं।
    • समानांतर ऑपरेटर (Parallel Operators): कई मॉडल्स को एक साथ चलाते हैं।
    • ब्लेंडिंग ऑपरेटर (Blending Operators): एक समर्पित "ब्लेंडर" मॉडल का उपयोग करके समानांतर शाखाओं के आउटपुट को मिलाते हैं।
  • अनुकूलन लक्ष्य (Optimization Goal): [QoA(π),Financial(π),Latency(π),Energy(π)][QoA(\pi), -Financial(\pi), -Latency(\pi), -Energy(\pi)] को अधिकतम करना, उपयोगकर्ता की बाधाओं के अधीन।

B. मुख्य घटक (Core Components)

  1. PERFDB (सांख्यिकी कैटलॉग):

    • एक प्रदर्शन डेटाबेस जिसे बेंचमार्क और निष्पादन ट्रेसेस (execution traces) से ऑफलाइन और वृद्धिशील रूप से भरा जाता है।
    • यह व्यक्तिगत LLMs और संयोजित सब-प्लान्स के लिए सांख्यिकी (QoA, लागत, विलंबता, ऊर्जा) संग्रहीत करता है, जो निष्पादन संदर्भ (विषय, ऑपरेटर प्रकार, मॉडल) द्वारा की-ड (keyed) होती है।
    • यह बिना प्लान चलाए, निष्पादन पूर्व अनुमान लगाने में सक्षम बनाता है। यह वेरिएंस अनुमानों और कॉन्फिडेंस इंटरवल को स्टोर करके स्टोकेस्टिसिटी (stochasticity) को संभालता है।
  2. लागत-लाभ अनुमान (Cost-Benefit Estimation):

    • टोकन अनुमान (Token Estimation): मॉडल-विशिष्ट टोकनाइज़र और ऐतिहासिक आउटपुट लंबाई के आधार पर इनपुट/आउटपुट टोकन गणना का अनुमान लगाता है ताकि लागत का आकलन किया जा सके।
    • QoA अनुमान (QoA Estimation): PERFDB में विषय-आधारित लुकअप का उपयोग करता है। संयोजित प्लान्स के लिए, यह ऐतिहासिक ट्रेसेस से प्राप्त मल्टीप्लिकेटिव रिलेटिव-इफेक्ट फैक्टर्स (क्रमिक चरणों के लिए) और एवरेजिंग रिलेटिव-चेंज फैक्टर्स (ब्लेंडिंग के लिए) लागू करता है ताकि पूर्ण प्लान की गुणवत्ता का अनुमान लगाया जा सके।
    • संसाधन अनुमान (Resource Estimation): वित्तीय लागत (फिक्स्ड + वेरिएबल प्रति टोकन), ऊर्जा (टोकन के समान), और विलंबता (टोकन वॉल्यूम के साथ रैखिक, समानांतर शाखाएं अधिकतम समय लेती हैं) की गणना करता है।
  3. प्लान जनरेशन और सर्च (Plan Generation and Search):

    • एनकोडिंग (Encoding): प्लान्स को एक कनेक्टिविटी मैप (एडजसेंसी मैट्रिक्स) और एक मॉडल असाइनमेंट वेक्टर के रूप में संक्षिप्त रूप में एनकोड किया जाता है।
    • सर्च स्पेस (Search Space): संभावित प्लान्स का स्थान कॉम्बिनेटोरियल है और इसे पूरी तरह से अनुकूलित करना NP-hard है।
    • ऑप्टिमाइज़ेशन इंजन (Optimization Engines): OPTI-Q तीन रणनीतियों के साथ एक "प्लगएबल" इंजन का समर्थन करता है:
      • डायनेमिक प्रोग्रामिंग (DP): छोटे उदाहरणों के लिए सटीक सॉल्वर; स्टेट-स्पेस विस्फोट को प्रबंधित करने के लिए प्रूनिंग का उपयोग करता है।
      • हिल क्लाइंबिंग (HC): तेज़, स्थानीय खोज के लिए हल्का ग्रीडी ह्यूरिस्टिक।
      • NSGA-II: बड़े प्लान स्पेस के लिए डिफ़ॉल्ट के रूप में उपयोग किया जाने वाला एक मल्टी-ऑब्जेक्टिव इवोल्यूशनरी एल्गोरिदम, जो पारेटो फ्रंटियर को अनुमानित करता है।
    • चयन (Selection): ऑप्टिमाइज़र गैर-प्रभावी (non-dominated) व्यवहार्य प्लान्स का एक सेट उत्पन्न करता है। अंतिम प्लान का चयन सामान्यीकृत उद्देश्यों पर उपयोगकर्ता के भार WW को लागू करके किया जाता है।

C. कार्यान्वयन (Implementation)

  • सिस्टम: एक ऑप्टिमाइज़र को निष्पादन इंजन (execution engine) के साथ एकीकृत करने वाला मॉड्यूलर फ्रेमवर्क।
  • मॉडेल्स: Ollama के माध्यम से स्थानीय रूप से चलने वाले पांच ओपन-सोर्स मॉडल्स (Gemma-3:27B, LLaMA3-ChatQA, Qwen2.5, Phi-4, Mistral) के साथ परीक्षण किया गया।
  • ब्लेंडिंग (Blending): संदर्भ और ब्लेंडिंग प्रॉम्प्ट्स के माध्यम से मॉडल व्यवहार को निर्देशित करने के लिए Gemma-3:27B का उपयोग करता है, जो सत्यापन में GenFuser जैसे विशिष्ट घटकों से बेहतर प्रदर्शन करता है।
  • प्रॉम्प्टिंग (Prompting): विशिष्ट संदर्भ और ब्लेंडिंग प्रॉम्प्ट्स के साथ ज़ीरो-शॉट (Zero-Shot) प्रॉम्प्टिंग का उपयोग करता है।

3. प्रमुख योगदान (Key Contributions)

  1. लागत/लाभ सूत्रीकरण (Cost/Benefit Formulation): मल्टी-LLM QA प्लानिंग को एक बाधित बहु-उद्देश्यीय अनुकूलन समस्या के रूप में औपचारिक बनाना, जो स्पष्ट रूप से QoA, लागत, विलंबता और ऊर्जा को संतुलित करता है।
  2. सांख्यिकी-संचालित ऑप्टिमाइज़र (Statistics-Driven Optimizer): एक सिस्टम जो ऐतिहासिक सांख्यिकी कैटलॉग (PERFDB) का उपयोग करके निष्पादन से पहले गुणवत्ता और संसाधन लागत का अनुमान लगाते हुए क्रमिक/समानांतर/हाइब्रिड वर्कफ़्लो को सूचीबद्ध और प्रून करता है।
  3. एकीकृत सिस्टम (Integrated System): एक वर्किंग प्रोटोटाइप जो वास्तविक समय में प्रश्नों को विभिन्न ओपन-सोर्स LLMs के बीच रूट करता है, इष्टतम निष्पादन ग्राफ चुनता है।

4. प्रयोगात्मक परिणाम (Experimental Results)

फ्रेमवर्क का मूल्यांकन चार अत्याधुनिक बेसलाइन (ThriftLLM, LLM-Ensemble, FrugalGPT, LLM-Blender) के विरुद्ध MMLU-Pro (बहुविकल्पीय) और SimpleQA (ओपन-एंडेड) बेंचमार्क पर किया गया।

  • प्रदर्शन लाभ (Performance Gains): उपयोगकर्ता-निर्दिष्ट बजट के तहत, OPTI-Q ने समान प्रति-प्रश्न लागत पर सबसे मजबूत बजट-जागरूक बेसलाइन की तुलना में SimpleQA पर औसत QoA में ≈58% और MMLU-Pro पर ≈41% का सुधार किया।
  • स्केलेबिलिटी (Scalability): NSGA-II ने सर्वश्रेष्ठ स्केलेबिलिटी-गुणवत्ता ट्रेड-ऑफ प्रदान किया, जो कम दशकों के सेकंडों (जैसे, k=5k=5 ऑपरेशन्स के लिए 21s) में प्लानिंग समय के साथ लगभग-रेफरेंस पारेटो फ्रंटियर गुणवत्ता बनाए रखता है।
  • डेटा की कमी के प्रति मजबूती (Robustness to Data Scarcity): "कोल्ड-स्टार्ट" परिदृश्यों (लेवल 0 PERFDB कवरेज) में, OPTI-Q अभी भी बेसलाइन से बेहतर प्रदर्शन करता है। जैसे-जैसे ऐतिहासिक डेटा बढ़ा (लेवल 1–4), QoA में उल्लेखनीय सुधार हुआ (जैसे, MMLU-Pro पर +66.7%), और संसाधन अनुमान त्रुटियां तेजी से कम हुईं।
  • बजट पालन (Budget Adherence): सिस्टम ने उच्च बजट पालन (88–96%) बनाए रखा, जिसमें ओवररन मुख्य रूप से लागत के कारण थे, न कि विलंबता के कारण।
  • व्यावसायिक API के साथ तुलना (Comparison to Commercial APIs): OPTI-Q ने SimpleQA पर व्यावसायिक मॉडल्स (जैसे, Claude Opus 4.6, GPT 5.4) की तुलना में उच्च QoA प्राप्त किया, जबकि लागत के मामले में काफी कम रहा (बाहरी सर्वर लागत को ध्यान में रखते हुए क्रमशः 37.8× और 14.5× कम)। MMLU-Pro पर, इसने मामूली लागत पर प्रतिस्पर्धी गुणवत्ता (0.82 बनाम Gemini 3.5 Flash के लिए 0.871) प्राप्त की।

5. महत्व और दावे (Significance and Claims)

पेपर का दावा है कि डेटाबेस-शैली की प्लानिंग, डायनेमिक, अल्पदर्शी ऑर्केस्ट्रेशन या निश्चित एन्सेम्बल की तुलना में बेहतर गुणवत्ता-संसाधन ट्रेड-ऑफ प्रदान करती है

  • प्रतिमान परिवर्तन (Paradigm Shift): यह प्रदर्शित करता है कि LLM ऑर्केस्ट्रेशन को एक प्रक्रियात्मक स्क्रिप्टिंग कार्य के बजाय एक डिक्लेरेटिव (declarative) क्वेरी प्लानिंग समस्या के रूप में मानने से, बाधाओं के तहत उपयोगिता को अधिकतम करने के लिए डायनेमिक, प्रश्न-विशिष्ट अनुकूलन संभव होता है।
  • व्यावहारिक व्यवहार्यता (Practical Viability): परिणाम बताते हैं कि संरचित, सांख्यिकी-संचालित प्लानिंग, उच्च-क्षमता वाले महंगे व्यावसायिक API पर निर्भर हुए बिना प्रदर्शन और दक्षता को संतुलित करने के लिए एक व्यावहारिक आधार प्रदान करती है।
  • भविष्य की क्षमता (Future Potential): लेखक तर्क देते हैं कि यह "प्लान-बिफोर-एक्जीक्यूट" एब्स्ट्रैक्शन RAG और एजेंटिक वर्कफ़्लो तक विस्तारित हो सकता है, बशर्ते नए ऑपरेटरों को सांख्यिकी कैटलॉग में समान लागत-लाभ प्रोफाइल के साथ वर्णित किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →