← नवीनतम पेपर
🤖 machine learning

Consistent Distributed Ranking of Generative Models via Kernel Distances

यह शोध पत्र यह स्थापित करता है कि विषम डेटा वाले वितरित परिवेशों में जनरेटिव मॉडलों को रैंक करना क्लाइंट्स के बीच कर्नेल डिस्टेंस स्कोर को औसत करके निरंतर रूप से प्राप्त किया जा सकता है, जो यह सिद्ध करता है कि यह दृष्टिकोण केंद्रीकृत मूल्यांकन के समान ही क्रम प्रदान करता है और फ्रेशेट डिस्टेंस (Fréchet Distance) जैसे अन्य मेट्रिक्स की सीमाओं को भी रेखांकित करता है।

मूल लेखक: Zixiao Wang, Farzan Farnia, Zhenghao Lin, Yunheng Shen, Bei Yu

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixiao Wang, Farzan Farnia, Zhenghao Lin, Yunheng Shen, Bei Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुकिंग प्रतियोगिता के मुख्य निर्णायक (head judge) हैं। आपको शेफों के एक समूह (जेनरेटिव एआई मॉडल) को एक आदर्श व्यंजन बनाने की कोशिश करते हुए देखना है। विजेता तय करने के लिए, आपको उनका भोजन चखना होगा और उसकी तुलना एक "गोल्ड स्टैंडर्ड" रेसिपी बुक (रेफरेंस डेटा) से करनी होगी।

एक सामान्य प्रतियोगिता में, हर कोई अपने सामग्रियाँ एक बड़े किचन में लेकर आता है। आप सभी सामग्रियों को एक साथ मिलाते हैं, अंतिम परिणाम का स्वाद लेते हैं, और शेफों को रैंक देते हैं। यह आसान है क्योंकि सारा डेटा एक ही जगह पर है।

लेकिन क्या होगा अगर यह एक रिमोट कुकिंग प्रतियोगिता हो?

  • शेफ A एक पहाड़ी गाँव में रहता है और उसके पास केवल आलू हैं।
  • शेफ B समुद्र के किनारे रहता है और उसके पास केवल मछली है।
  • शेफ C एक जंगल में रहता है और उसके पास केवल बेर (berries) हैं।
  • नियम: शेफ अपनी वास्तविक सामग्रियाँ मुख्य किचन में नहीं भेज सकते क्योंकि वे बहुत कीमती हैं (प्राइवेसी)। वे आपको केवल एक स्कोरकार्ड भेज सकते हैं जिसमें लिखा हो, "मेरे स्थानीय आलू के मुकाबले मेरा व्यंजन 8/10 है।"

बड़ा सवाल जो यह पेपर पूछता है: क्या हम बस उन स्थानीय स्कोरकार्ड को जोड़कर यह पता लगा सकते हैं कि कुल मिलाकर सबसे अच्छा शेफ कौन है? या क्या वह तरीका हमें एक पूरी तरह से अलग विजेता दे देगा, यदि हम वास्तव में सभी सामग्रियों को एक बड़े बर्तन में मिला पाते?

मुख्य खोज: "कर्नेल डिस्टेंस" (Kernel Distance) का जादू

लेखकों ने शेफ को स्कोर देने के दो लोकप्रिय तरीकों का परीक्षण किया: कर्नेल डिस्टेंस (KD) और फ्रेचेट डिस्टेंस (FD)

1. कर्नेल डिस्टेंस (KD): "परफेक्ट ट्रांसलेटर"

पेपर यह सिद्ध करता है कि कर्नेल डिस्टेंस के लिए, "स्थानीय स्कोरकार्ड" वाला तरीका पूरी तरह से काम करता है।

  • उपमा: कल्पना कीजिए कि KD एक जादुई अनुवादक (translator) है। भले ही शेफ A केवल "आलू" बोलता है और शेफ B केवल "मछली," अनुवादक उनके व्यक्तिगत स्कोर ले सकता है और उन्हें जोड़ सकता है।
  • परिणाम: पेपर गणितीय रूप से दिखाता है कि यदि आप सभी रिमोट शेफ के स्कोर का औसत निकालते हैं, तो आपको वही सटीक रैंकिंग मिलती है जो तब मिलती जब आपने सभी सामग्रियों को मिलाकर पूरे बर्तन का स्वाद लिया होता।
  • यह क्यों महत्वपूर्ण है: आपको प्राइवेसी के नियम तोड़ने की आवश्यकता नहीं है। आप बस प्रत्येक क्लाइंट से उनका नंबर मांग सकते हैं, उनका औसत निकाल सकते हैं, और आप निश्चित रूप से जान सकते हैं कि वास्तव में सबसे अच्छा कौन है। पेपर इसे KD-avg (औसत) कहता है जो KD-all (सेंट्रलाइज्ड) के समान है।

2. फ्रेचेट डिस्टेंस (FD): "टूटा हुआ दिशा-सूचक यंत्र" (Broken Compass)

लेखकों ने पाया कि फ्रेचेट डिस्टेंस (AI में उपयोग किया जाने वाला एक बहुत लोकप्रिय मीट्रिक) के लिए, स्थानीय स्कोरकार्ड वाला तरीका विफल हो जाता है।

  • उपमा: कल्पना कीजिए कि FD एक दिशा-सूचक यंत्र (compass) है जो "उत्तर" की ओर इशारा करता है। यदि हर कोई अलग-अलग जगहों पर खड़ा है (अलग-अलग डेटा डिस्ट्रीब्यूशन), तो उनका स्थानीय "उत्तर" अलग-अलग दिशाओं में इशारा करता है। यदि आप बस उनके कंपास रीडिंग का औसत निकालते हैं, तो आप शायद पहाड़ की चोटी के बजाय एक दलदल की ओर इशारा कर रहे होंगे।
  • परिणाम: दो शेफ हर एक स्थानीय जज से समान स्कोर प्राप्त कर सकते हैं (क्लाइंट A कहता है कि शेफ X अच्छा है, क्लाइंट B कहता है कि शेफ X अच्छा है, आदि)। हालाँकि, जब आप "ग्रैंड प्राइज" (संयुक्त डेटा) को देखते हैं, तो शेफ X वास्तव में शेफ Y की तुलना में बहुत खराब हो सकता है।
  • प्रमाण: पेपर एक गणितीय उदाहरण प्रदान करता है जहाँ दो मॉडल सभी क्लाइंट्स से बिल्कुल समान औसत स्कोर प्राप्त करते हैं, लेकिन एक वास्तव में दूसरे से बेहतर होता है जब उन्हें कुल डेटासेट के विरुद्ध परखा जाता है। स्थानीय स्कोर का औसत निकालने से एक गलत रैंकिंग मिलती है।

अन्य मीट्रिक्स: एक मिला-जुला परिणाम

पेपर ने गुणवत्ता को मापने के अन्य तरीकों को भी देखा, जैसे "प्रिसिजन" (भोजन कितना असली दिखता है) और "रिकॉल" (कितने अलग-अलग प्रकार के भोजन बनाए गए)।

  • रिकॉल: कर्नेल डिस्टेंस की तरह, यहाँ स्थानीय स्कोर का औसत निकालना ठीक काम करता है।
  • प्रिसिजन, डेंसिटी और कवरेज: फ्रेचेट डिस्टेंस की तरह, ये मीट्रिक्स अविश्वसनीय थे जब आप केवल उनके स्थानीय स्कोर का औसत निकालते हैं। वे आपको गलत विजेता चुनने की ओर ले जा सकते हैं।

व्यावहारिक अनुप्रयोग: प्राइवेसी के साथ कुकिंग

क्योंकि कर्रल डिस्टेंस औसत निकालने के साथ बहुत अच्छी तरह काम करता है, लेखकों ने एक व्यावहारिक उपयोग मामला दिखाया है: डिस्ट्रीब्यूटेड फाइन-ट्यूनिंग (Distributed Fine-Tuning)

कल्पना कीजिए कि शेफ अपनी स्थानीय सामग्रियों के आधार पर अपनी रेसिपी में सुधार करना चाहते हैं बिना अपनी सामग्री को दूर भेजे।

  • वे अपनी कुकिंग को गाइड करने के लिए "कर्नेल डिस्टेंस" नियम का उपयोग करते हैं।
  • सर्वर उन्हें बताता है, "आपका स्थानीय स्कोर X है। यदि आप उस स्कोर को कम करने के लिए अपनी रेसिपी बदलते हैं, तो आप वैश्विक औसत के करीब पहुँच रहे हैं।"
  • क्योंकि गणित गारंटी देता है कि स्थानीय औसत को कम करने से हमेशा ग्लोबल स्कोर कम होता है, इसलिए शेफ बिना कभी भी अपना निजी डेटा साझा किए सहयोगात्मक रूप से मॉडल को बेहतर बना सकते हैं।

सारांश

  • समस्या: जब डेटा कई निजी उपकरणों में बिखरा हुआ हो, तो हम AI मॉडल्स को कैसे रैंक करें?
  • अच्छी खबर: यदि आप कर्नेल डिस्टेंस का उपयोग करते हैं, तो आप बस प्रत्येक डिवाइस के स्कोर का औसत निकाल सकते हैं, और यह आपको वही सटीक रैंकिंग देगा जो तब मिलती जब आपके पास सारा डेटा एक ही स्थान पर होता।
  • बुरी खबर: यदि आप फ्रेचेट डिस्टेंस (या प्रिसिजन/डेंसिटी) का उपयोग करते हैं, तो स्थानीय स्कोर का औसत निकालना खतरनाक है। यह आपको यह सोचने के लिए धोखा दे सकता है कि एक बुरा मॉडल अच्छा है, या इसके विपरीत।
  • निष्कर्ष: एक वितरित दुनिया में, सभी मापने के पैमाने एक समान नहीं होते। कुछ (जैसे KD) आपको व्यक्तिगत पेड़ों को देखकर पूरे जंगल को मापने की अनुमति देते हैं; अन्य (जैसे FD) ऐसा करने की कोशिश में भटक जाएंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →