← नवीनतम पेपर
🤖 AI

InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation

केंद्रीकृत LLM बेंचमार्किंग की सांख्यिकीय अस्थिरता और अपारदर्शिता को संबोधित करने के लिए, यह शोध पत्र **InfiCoEvalChain** का प्रस्ताव करता है, जो एक ब्लॉकचेन-आधारित विकेंद्रीकृत ढांचा है जो अधिक स्थिर, विश्वसनीय और पारदर्शी मॉडल मूल्यांकन प्रदान करने के लिए विषम कंप्यूट नोड्स और एक रिवॉर्ड-संचालित सर्वसम्मति तंत्र का लाभ उठाता है।

मूल लेखक: Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "चंचल परीक्षा" (The Fickle Exam) की समस्या

कल्पना कीजिए कि आप एक बहुत बड़ी फाइनल परीक्षा की तैयारी कर रहे एक छात्र हैं। आप सोमवार को एक अभ्यास परीक्षण (practice test) देते हैं और आपको 95% अंक मिलते हैं। आप मंगलवार को बिल्कुल वही परीक्षण देते हैं, लेकिन क्योंकि कमरा थोड़ा अधिक गर्म था, रोशनी अलग थी, और आप एक अलग ब्रांड का पेन इस्तेमाल कर रहे थे, इसलिए आपको 85% अंक मिलते हैं।

AI (आर्टिफिशियल इंटेलिजेंस) की दुनिया में, वास्तव में ऐसा ही हो रहा है। वर्तमान में, जब वैज्ञानिक यह देखना चाहते हैं कि एक AI मॉडल कितना "स्मार्ट" है, तो वे "बेंचमार्क" (मानकीकृत परीक्षणों) का उपयोग करते हैं। लेकिन चूंकि AI उत्तर देने के लिए थोड़ी सी रैंडमनेस (जैसे पासा फेंकना) का उपयोग करता है, और विभिन्न कंप्यूटरों के अलग-अलग "तापमान" या हार्डवेयर होते हैं, इसलिए स्कोर बहुत अधिक ऊपर-नीचे होते रहते हैं।

अभी, सबसे "स्मार्ट" AI और "दूसरे सबसे स्मार्ट" AI के बीच का अंतर अक्सर परीक्षण के एरर मार्जिन (त्रुटि सीमा) से भी छोटा होता है। यह दुनिया के सबसे तेज़ धावकों को रैंक करने की कोशिश करने जैसा है, लेकिन स्टॉपवॉच खराब है और हर बार स्टार्ट बटन दबाने पर अलग रीडिंग दिखा रही है। हमें वास्तव में नहीं पता कि कौन जीत रहा है; हम बस इतना जानते हैं कि किसे एक "लकी" (भाग्यशाली) रीडिंग मिली है।


समाधान: InfiCoEvalChain (द ग्लोबल जूरी)

शोधकर्ताओं ने InfiCoльCoEvalChain नामक एक नई प्रणाली प्रस्तावित की है। इसके बजाय कि एक बड़ी कंपनी (जैसे Google या OpenAI) अपनी निजी लैब (एक "ब्लैक बॉक्स") में परीक्षण चलाए, वे इस परीक्षण को एक ग्लोबल, विकेंद्रीकृत जूरी (Global, Decentralized Jury) में बदलना चाहते हैं।

यह तीन रूपकों (metaphors) का उपयोग करके कैसे काम करता है, यहाँ बताया गया है:

1. विविध जूरी (हार्डवेयर और पैरामीटर विविधता)

एक प्रोफेसर द्वारा पेपर ग्रेड करने के बजाय, कल्पना करें कि दुनिया भर के 1,000 लोगों की एक जूरी है। कुछ बर्फीले पहाड़ों में बैठे हैं, कुछ उष्णकटिबंधीय जंगलों में हैं, कुछ हाई-एंड सुपरकंप्यूटरों का उपयोग कर रहे हैं, और कुछ पुराने लैपटॉप का उपयोग कर रहे हैं।
सभी को एक ही AI को एक ही समय में ग्रेड करने देने से, "शोर" (वातावरण के कारण होने वाली विचित्रता) खुद को रद्द कर देता है। यदि AI वास्तव में स्मार्ट है, तो वह सभी के लिए अच्छा प्रदर्शन करेगा। यदि वह केवल एक विशिष्ट कंप्यूटर सेटिंग के कारण "लकी" रहा, तो वह भाग्य पूरे जूरी में टिक नहीं पाएगा।

2. सीलबंद लिफाफा (ब्लॉकचेन और कमिट-रिवील)

यह सुनिश्चित करने के लिए कि कोई धोखाधड़ी न करे, वे ब्लॉकचेन तकनीक का उपयोग करते हैं। इसे एक "सीलबंद लिफाफा" प्रणाली के रूप में सोचें।

  • चरण 1 (कमिट): एक जूरी सदस्य AI को ग्रेड करता है और अपना स्कोर एक सीलबंद, लॉक किए गए लिफाफे में रखता है। वे दुनिया को बताते हैं, "मेरे पास एक स्कोर है, और यहाँ एक डिजिटल फिंगरप्रिंट है जो साबित करता है कि यह लॉक है।"
  • चरण 2 (रिवील): केवल तभी जब सभी ने अपने लिफाफे जमा कर दिए हों, जूरी एक साथ उन सभी को खोलती है।
    यह "कॉपीकैटिंग" (नकल करने) को रोकता है, जहाँ एक जूरी सदस्य दूसरे सबसे स्मार्ट व्यक्ति के जवाब का इंतजार करता है और फिर इनाम पाने के लिए बस उसकी नकल कर लेता है।

3. "फेयर प्ले" रिवॉर्ड (प्रोत्साहन तंत्र)

आप लोगों को झूठ बोलने या आलसी होने से कैसे रोकेंगे? आप एक स्मार्ट रिवॉर्ड सिस्टम का उपयोग करते हैं।
कल्पना करें कि एक गेम शो है जहाँ आपको इस आधार पर भुगतान किया जाता है कि आपका उत्तर समूह के "कंसेंसस" (मध्य मार्ग) के कितने करीब है। यदि आप एक ऐसा स्कोर प्रदान करते हैं जो बाकी सभी से बहुत अलग है (आउटलायर), तो सिस्टम मान लेता है कि आप या तो धोखेबाज हैं या आपका कंप्यूटर खराब है, और आपको लगभग कुछ भी नहीं मिलता। यदि आप ईमानदार बहुमत का हिस्सा हैं, तो आपको पुरस्कार का एक उचित हिस्सा मिलता है।


परिणाम: "धुंधलेपन" से "हाई-डेफिनिशन" तक

शोधकर्ताओं ने इसका परीक्षण किया, और परिणाम जबरदस्त थे।

पहले, स्कोर "धुंधले" थे—वे इतना उतार-चढ़ाव करते थे कि आप उन पर भरोसा नहीं कर सकते थे। इस विकेंद्रीकृत "जूरी" पद्धति का उपयोग करने के बाद, उतार-चढ़ाव काफी कम हो गए (एक परीक्षण में, एरर मार्जिन 1.67 से घटकर 0.28 हो गया)।

संक्षेप में: उन्होंने AI मूल्यांकन को एक "अस्थिर, निजी माप" से बदलकर एक "ठोस, सार्वजनिक सहमति" में बदल दिया है। यह एक धुंधली, हाथ से ली गई फोटो से एक क्रिस्टल-क्लियर, पेशेवर फोटो की ओर बढ़ने जैसा है। अब, जब कोई लीडरबोर्ड कहता है कि "मॉडल A, मॉडल B से बेहतर है," तो हम वास्तव में उस पर विश्वास कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →