← नवीनतम पेपर
🤖 AI

A Multi-Dimensional Quality Scoring Framework for Decentralized LLM Inference with Proof of Quality

यह शोध पत्र विकेंद्रीकृत LLM इन्फरेंस के लिए एक कैलिब्रेटेड, बहु-आयामी गुणवत्ता स्कोरिंग ढांचे का प्रस्ताव करता है जो आउटपुट गुणवत्ता को मॉड्यूलर आयामों में विभाजित करता है, यह प्रदर्शित करते हुए कि अविश्वसनीय मेट्रिक्स को चुनिंदा रूप से हटाने और उन्हें पुन: भारित करने से एक सुदृढ़ संकेत प्राप्त होता है जो एकल-इवैल्यूएटर बेसलाइन के बराबर या उससे बेहतर होता है और प्रतिकूल हमलों को कम करने के लिए प्रूफ ऑफ क्वालिटी तंत्र के साथ प्रभावी ढंग से एकीकृत होता है।

मूल लेखक: Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, वैश्विक रसोई है जहाँ हज़ारों अलग-अलग शेफ (कंप्यूटर) ग्राहकों के लिए भोजन (उत्तर) पकाने के लिए काम पर रखे गए हैं। यह विकेंद्रीकृत (Decentralized) LLM इन्फरेंस है। एक विशाल एकल रेस्टोरेंट किचन के बजाय, काम पूरी दुनिया में फैला हुआ है।

समस्या क्या है? आप कैसे जानेंगे कि किस शेफ ने वास्तव में अच्छा भोजन बनाया है, और आप बिना किसी हेड शेफ के हर प्लेट की निगरानी किए उन्हें निष्पक्ष रूप से भुगतान कैसे करेंगे?

यह पेपर भोजन को परखने का एक नया तरीका प्रस्तावित करता है, जिसे प्रूफ ऑफ क्वालिटी (PoQ) कहा जाता है। लेकिन केवल एक फूड क्रिटिक (खाद्य समीक्षक) से डिश चखने के लिए कहने के बजाय, लेखकों ने एक मल्टी-डायमेंशनल स्कोरिंग फ्रेमवर्क बनाया है। इसे एक "क्वालिटी कंट्रोल डैशबोर्ड" के रूप में सोचें जिसमें पांच अलग-अलग गेज (मापक) हैं।

यहाँ सरल शब्दों में इसका विवरण दियाв:

1. डैशबोर्ड पर पांच गेज (मापक)

केवल एक "स्वादिष्ट" या "बेस्वाद" स्कोर देने के बजाय, सिस्टम गुणवत्ता को पांच विशिष्ट श्रेणियों में तोड़ देता है:

  • रेप्यूटेशन गेज (Priors - प्रतिष्ठा): भोजन चखने से पहले ही, हम शेफ के बायोडाटा की जाँच करते हैं। क्या वे आमतौर पर अच्छा खाना बनाते हैं? क्या वे इसे सस्ता बनाते हैं? यह इतिहास के आधार पर एक त्वरित, कम लागत वाला अनुमान है।
  • प्रेजेंटेशन गेज (Structure - प्रस्तुति): क्या प्लेट बिखरी हुई है? क्या शेफ ने हर जगह सॉस गिरा दिया है? क्या भोजन बहुत छोटा है या बहुत बड़ा? यह फॉर्मेटिंग त्रुटियों और अजीब ग्लिच की जाँच करता है।
  • टेस्ट गेज (Semantic Quality - स्वाद): क्या भोजन वास्तव में वैसा ही है जैसा ऑर्डर किया गया था? यदि आपने बर्गर माँगा था, तो क्या इसमें बीफ का स्वाद है, या यह सिर्फ ब्रेड का एक बेकार टुकड़ा है? यह जाँचता है कि अर्थ (meaning) सही है या नहीं।
  • इंस्ट्रक्शन गेज (Alignment - निर्देश): क्या शेफ ने विशिष्ट अनुरोध को सुना? यदि आपने कहा था "प्याज न डालें," तो क्या उन्होंने प्याज डाल दिया? यह जाँचता है कि आउटपुट ने नियमों का पालन किया या नहीं।
  • कंसेंसस गेज (Agreement/Uncertainty - सहमति/अनिश्चितता): यदि हम तीन अलग-अलग फूड क्रिटिक्स से एक ही डिश चखने के लिए कहते हैं, तो क्या वे सभी एक ही बात कहते हैं? यदि एक कहता है "शानदार!" और दूसरा कहता "कचरा," तो हमें पता चलता है कि कुछ अनिश्चित या संदिग्ध है।

2. बड़ा सरप्राइज: "अधिक होना हमेशा बेहतर नहीं होता"

लेखकों ने एक बड़ा प्रयोग चलाया और उन्हें एक चौंकाने वाला सच पता चला: सिर्फ इसलिए कि आपके पास पांच गेज हैं, इसका मतलब यह नहीं है कि आपका स्कोर सटीक है।

वास्तव में, उन्होंने पाया कि कुछ सबसे "तार्किक" गेज वास्तव में उन्हें झूठ बोल रहे थे!

  • द ट्रैप (जाल): कभी-कभी, "इंस्ट्रक्शन गेज" (क्या उन्होंने नियमों का पालन किया?) और "कंसेंसस गेज" (क्या समीक्षक सहमत हैं?) कुछ कार्यों के लिए अच्छे उत्तरों को नेगेटिव स्कोर देते हैं।
  • एनालॉजी (उपमा): कल्पना कीजिए कि आप एक कॉमेडी शो का मूल्यांकन कर रहे हैं। यदि आप एक ऐसा गेज उपयोग करते हैं जो "दर्शकों की गंभीरता" को मापता है, तो आप एक ऐसे मजेदार चुटकुले को कम स्कोर दे सकते है जिसने सबको बहुत अधिक हँसाया। गेज काम तो कर रहा था, लेकिन वह उस विशिष्ट कार्य के लिए गलत चीज़ को माप रहा था।

3. समाधान: "कैलिब्रेशन शेफ"

यह पेपर तर्क देता है कि आप पांचों स्कोर को बस यूँ ही जोड़ नहीं सकते। आपको एक कैलिब्रेशन शेफ की आवश्यकता है।

  • ऑडिट: पहले, जाँचें कि कौन से गेज वास्तव में विशिष्ट काम (जैसे, समाचार लेख का सारांश बनाना बनाम गणित के प्रश्न का उत्तर देना) के लिए सच बोल रहे हैं।
  • खराब गेज को हटाना: यदि कोई गेज लगातार झूठ बोल रहा है या भ्रमित कर रहा है, तो उसे बंद कर दें।
  • री-बैलेंस: वेटेज (भार) को एडजस्ट करें। शायद "टेस्ट" 50% मायने रखता है, लेकिन "प्रेजेंटेशन" केवल 10%।

जब उन्होंने इस "कैलिब्रेशन" को किया, तो अंतिम स्कोर किसी भी एकल विशेषज्ञ फूड क्रिटिक की तुलना में अधिक सटीक हो गया।

4. "ग्लोबल किचन" (PoQ) के लिए यह क्यों महत्वपूर्ण है

इस विकेंद्रीकृत दुनिया में, कुछ "शेफ" (कंप्यूटर) सिस्टम को धोखा देने या ठगने की कोशिश कर सकते हैं।

  • डिफेंस (रक्षा): यदि सिस्टम एक खराब, अन-कैलिब्रेटेड स्कोर का उपयोग करता है, तो स्कैमर्स (ठग) सिस्टम को खराब भोजन के लिए भुगतान करने के लिए धोखा दे सकते हैं।
  • फिक्स (सुधार): इस कैलिब्रेटेड मल्टी-डायमेंशनल स्कोर का उपयोग करके, सिस्टम को बेवकूफ बनाना बहुत कठिन हो जाता है। यह एक स्मार्ट सुरक्षा गार्ड की तरह काम करता है जो केवल एक आईडी कार्ड नहीं देखता, बल्कि आईडी, चेहरा, व्यवहार और इतिहास भी जाँचता है। यदि एक हिस्सा नकली दिखता है, तो पूरा स्कोर गिर जाता है।

मुख्य निष्कर्ष (Takeaway)

आप केवल ढेर सारे अलग-अलग मापने वाले उपकरणों को एक साथ नहीं फेंक सकते और उम्मीद नहीं कर सकते कि सब ठीक हो जाएगा।

  1. गुणवत्ता को छोटे, समझने योग्य हिस्सों में तोड़ें (स्ट्रक्चर, अर्थ, नियम, आदि)।
  2. प्रत्येक हिस्से का परीक्षण करें कि क्या वह वास्तव में विशिष्ट काम के लिए काम करता है।
  3. टूटे हुए हिस्सों को हटा दें और अच्छे हिस्सों के वेटेज को एडजस्ट करें।
  4. इस स्मार्ट स्कोर का उपयोग करें ताकि श्रमिकों को निष्पक्ष रूप से भुगतान किया जा सके और ठगों को बाहर रखा जा सके।

यह एक रैंडम अजनबी से यह पूछने के बीच का अंतर है कि "क्या यह अच्छा है?" और विशेषज्ञों की एक टीम को नियुक्त करने के बीच का अंतर जो जानते हैं कि वास्तव में क्या देखना है, और जो जानते हैं कि शोर (noise) को कब अनदेखा करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →