← नवीनतम पेपर
🤖 AI

Adaptive and Robust Cost-Aware Proof of Quality for Decentralized LLM Inference Networks

यह शोध पत्र विकेंद्रीकृत LLM इन्फरेंस नेटवर्क के लिए एक अनुकूली, सुदृढ़ और लागत-सचेत 'प्रूफ ऑफ क्वालिटी' तंत्र का प्रस्ताव करता है जो सैंपलिंग लागत, पुरस्कार स्थिरता और सर्वसम्मति संरेखण के बीच के समझौतों को अनुकूलित करते हुए दुर्भावनापूर्ण स्कोर हेरफेर और मूल्यांकनकर्ता विषमता को प्रभावी ढंग से कम करने के लिए उन्नत एकत्रीकरण नियमों और ट्रस्ट-वेटेड कंसेंसस का उपयोग करता है।

मूल लेखक: Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

प्रकाशित 2026-01-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, वैश्विक रसोईघर है जहाँ कोई भी अपना व्यंजन (एक AI से उत्तर) लेकर आ सकता है ताकि उसका परीक्षण किया जा सके। लक्ष्य बेहतरीन रसोइयों को उचित रूप से भुगतान करना है, लेकिन इसमें एक पेंच है: न्यायाधीश भी जनता के स्वयंसेवक हैं, और उनमें से कुछ आलसी, भ्रमित या खेल को हेरफेर करने की कोशिश करने वाले भी हो सकते हैं।

यह शोध पत्र इस रसोईघर को चलाने का एक नया तरीका प्रस्तावित करता है ताकि रसोइयों को उनके अच्छे काम के लिए भुगतान किया जा सके बिना यह डर रहे कि न्यायाधीश सिस्टम में धोखाधड़ी कर सकते हैं। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "मिलीभगत वाला जूरी" (The "Rigged Jury")

एक सामान्य प्रणाली में, यदि आप किसी व्यंजन को रेट करने के लिए 10 लोगों को कहते हैं, तो आप बस उनका औसत स्कोर ले लेते हैं। लेकिन क्या होगा यदि उनमें से 3 लोग रसोइये के दोस्त हैं और उसे 10/10 देते हैं, जबकि अन्य 3 प्रतिद्वंद्वी हैं जो उसे 1/10 देते हैं? औसत बिगड़ जाता है।

  • शोध पत्र का दृष्टिकोण: विकेंद्रीकृत AI नेटवर्क में, "मूल्यांकक" (न्यायाधीश) अविश्वसनीय या दुर्भावनापूर्ण हो सकते हैं। वे अपने दोस्तों के स्कोर को बढ़ाने, प्रतिस्पर्धियों को नुकसान पहुँचाने, या बस सिस्टम में यादृच्छिक (random) नंबर डालने की कोशिश कर सकते हैं। यदि सिस्टम केवल इन स्कोरों का औसत लेता है, तो पुरस्कार विकृत हो जाते हैं, और खराब AI मॉडल को भुगतान मिल सकता है जबकि अच्छे मॉडलों को अनदेखा किया जा सकता है।

2. समाधान: एक "स्मार्ट जूरी" प्रणाली

लेखकों ने चेतेरों को संभालने के लिए अपने पिछले सिस्टम (जिसे प्रूफ ऑफ क्वालिटी कहा जाता है) को अपग्रेड किया है। उन्होंने दो मुख्य "सुरक्षा गार्ड" जोड़े हैं:

गार्ड #1: "मध्य मार्ग" का नियम (Robust Aggregation)

एक साधारण औसत लेने के बजाय (जो आसानी से चरम स्कोर से प्रभावित हो जाता है), सिस्टम अधिक स्मार्ट गणित का उपयोग करता है:

  • मीडियन (Median): कल्पना कीजिए कि आप सभी स्कोरों को सबसे कम से सबसे अधिक के क्रम में पंक्तिबद्ध करते हैं और बिल्कुल बीच वाले स्कोर को चुनते हैं। यदि कोई धोखेबाज नकली "100" या "0" देने की कोशिश करता है, तो उसे पंक्ति के अंत में धकेल दिया जाता है और अनदेखा कर दिया जाता है।
  • ट्रिम्ड मीन (Trimmed Mean): यह शेष स्कोरों का औसत निकालने से पहले शीर्ष 10% और निचले 10% स्कोरों (आउटलेयर्स) को हटाने जैसा है। यह एक फिगर स्केटिंग प्रतियोगिता की तरह है जहाँ पक्षपात को रोकने के लिए उच्चतम और निम्नतम स्कोर को हटा दिया जाता है।

गार्ड #2: "प्रतिष्ठा स्कोर" (Adaptive Trust)

सिस्टम प्रत्येक न्यायाधीश के लिए एक चलता हुआ "प्रतिष्ठा स्कोर" रखता है।

  • यह कैसे काम करता है: यदि किसी न्यायाधीश का स्कोर आमतौर पर समूह के सर्वसम्मति (consensus) के करीब होता है, तो उनकी प्रतिष्ठा बढ़ जाती है, और अगली बार उनके वोट की गिनती अधिक होती है।
  • दंड: यदि कोई न्यायाधीश अजीब स्कोर देता रहता है जो समूह से मेल नहीं खाते (शायद इसलिए क्योंकि वे धोखाधड़ी करने की कोशिश कर रहे हैं या वे निर्णय लेने में खराब हैं), तो उनकी प्रतिष्ठा गिर जाती है। अंततः, उनके वोटों की गिनती लगभग शून्य हो जाती है।
  • उपमा: इसे एक मोहल्ला निगरानी (neighborhood watch) की तरह समझें। यदि कोई बार-बार "भेड़िया आया" चिल्लाता है या गलत रिपोर्ट देता है, तो पड़ोसी उनकी बात सुनना बंद कर देते हैं। यदि वे आमतौर पर सही होते हैं, तो निर्णय लेने में उनकी अधिक भूमिका होती है।

3. "लागत" कारक: दक्षता मायने रखती है

शोध पत्र इस बात पर भी ध्यान देता है कि इन न्यायाधीशों को कितनी ऊर्जा और समय लगता है।

  • उपमा: कल्पना कीजिए कि आप न्यायाधीशों की एक टीम को काम पर रख रहे हैं। आप महंगी, धीमी विशेषज्ञों की टीम को काम पर नहीं रखना चाहेंगे यदि एक तेज़, सस्ती स्वयंसेवकों की टीम 90% काम लगभग उतना ही अच्छा कर सकती है।
  • तंत्र: सिस्टम उन AI मॉडलों को पुरस्कृत करता है जो उच्च गुणवत्ता और तेज़/सस्ते दोनों हैं। यह उन न्यायाधीशों को भी पुरस्कृत करता है जो तेज़ और सटीक हैं। यदि कोई न्यायाधीश धीमा या महंगा है, तो उन्हें कम भुगतान किया जाता है, भले ही वे सटीक हों।

4. उन्होंने क्या परीक्षण किया (सिमुलेशन)

लेखकों ने केवल बातें ही नहीं कीं;

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →