← नवीनतम पेपर
🤖 machine learning

HERO: A Heterogeneity-Aware Benchmark Library for Federated Continual Learning

यह शोध पत्र HERO को पेश करता है, जो फेडरेटेड कॉन्टिनुअल लर्निंग के लिए एक विषमता-जागरूक (heterogeneity-aware) बेंचमार्क लाइब्रेरी है जो टास्क स्प्लिट्स, क्लाइंट डेटा वितरण और टास्क सीक्वेंस को अलग करती है ताकि पुनरुत्पादनीय (reproducible) मूल्यांकन सक्षम किया जा सके, जो यह प्रकट करता है कि विभिन्न विषमता सेटिंग्स में विधियों का प्रदर्शन कैसे भिन्न होता है और औसत मेट्रिक्स द्वारा इसे कैसे छिपाया जा सकता है।

मूल लेखक: Thinh T. H. Nguyen, Le-Tuan Nguyen, Minh-Duong Nguyen, Nhi Trinh, Anh Tran Nam Nguyet, Dung D. Le, Kok-Seng Wong

प्रकाशित 2026-07-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thinh T. H. Nguyen, Le-Tuan Nguyen, Minh-Duong Nguyen, Nhi Trinh, Anh Tran Nam Nguyet, Dung D. Le, Kok-Seng Wong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप छात्रों की एक विशाल कक्षा को पढ़ा रहे हैं जो सभी अलग-अलग कमरों में हैं, अलग-अलग पाठ्यपुस्तकों का उपयोग कर रहे हैं और अलग-अलग गति से सीख रहे हैं। यह Federated Continual Learning (FCL) की दुनिया है। लक्ष्य एक स्मार्ट "सुपर-टीचर" मॉडल को प्रशिक्षित करना है जो इन सभी छात्रों से सीख सके, लेकिन कभी भी उनकी निजी नोटबुक को न देखे। लेकिन यहाँ एक पेंच है: छात्रों के सबक समय के साथ बदलते रहते हैं। एक दिन वे बिल्लियों के बारे में सीखते हैं, अगले दिन कुत्तों के बारे में, और अगले दिन रॉकेटों के बारे में। शिक्षक को रॉकेटों को सीखते समय बिल्लियों को याद रखना होगा, जबकि छात्र दुनिया भर में बिखरे हुए हैं।

लंबे समय तक, इन "सुपर-टीचर्स" को टेस्ट करने की कोशिश करने वाले वैज्ञानिक "सेब की तुलना संतरे से करने" के खेल में लगे हुए थे। एक शोधकर्ता ने 100 तस्वीरों के डेटासेट पर परीक्षण किया होगा, दूसरे ने 1,000 पर; एक के पास सभी छात्र एक ही क्रम में सीख रहे होंगे, जबकि दूसरे के पास वे अराजकता में सीख रहे होंगे। यह बता पाना असंभव था कि कोई विधि वास्तव में स्मार्ट थी या सिर्फ भाग्यशाली थी क्योंकि टेस्ट आसान था।

पेश है HERO (Heterated-Aware Benchmark Library for Federated Continual Learning)। HERO को एक विशाल, पूरी तरह से कैलिब्रेटेड बाधा दौड़ (obstacle course) के रूप में समझें जिसे हर सुपर-टीचर को दौड़ना ही होगा। शोधकर्ताओं को अपने स्वयं के अस्त-व्यस्त ट्रैक बनाने देने के बजाय, HERO उनके लिए ट्रैक बनाता है, यह सुनिश्चित करते हुए कि सभी को बिल्कुल एक जैसी बाधाओं का सामना करना पड़े।

तीन जादुई नॉब्स (The Three Magic Knobs)

पेपर की मुख्य खोज यह है कि पिछले परीक्षणों ने तीन अलग-अलग प्रकार की समस्याओं को एक बड़े ढेर में मिला दिया था। HERO उन्हें तीन अलग-अलग "नॉब्स" में अलग करता है जिन्हें आप यह देखने के लिए घुमा सकते हैं कि मॉडल कहाँ टूटता है:

  1. "किसे क्या मिलता है" वाला नॉब (Client Data Skew): एक पिज्जा पार्टी की कल्पना करें। यदि सभी को हर टॉपिंग का समान हिस्सा मिलता है, तो यह आसान है। लेकिन क्या होगा यदि एक छात्र को केवल पेपरोनी मिले, दूसरे को केवल मशरूम मिले, और तीसरे को एक अजीब मिश्रण मिले? यह क्लाइंट डेटा स्क्यू (client data skew) है। पेपर एक संख्या का उपयोग करता है जिसे α\alpha कहा जाता है। एक उच्च α\alpha (जैसे 100.00) का अर्थ है कि सभी को उचित हिस्सा मिलता है। एक निम्न α\alpha (जैसे 0.10) का अर्थ है कि हिस्से बहुत असमान हैं।
  2. "कौन कब जाता है" वाला नॉब (Task-Order Mismatch): एक रिले रेस की कल्पना करें। एक सिंक्रोनाइज्ड रेस में, हर कोई लेग 1 दौड़ता है, फिर लेग 2, फिर लेग 3 एक साथ। लेकिन एक अराजक रेस में, छात्र A लेग 1 दौड़ता है, फिर लेग 3, फिर लेग 2, जबकि छात्र B लेग 2 दौड़ता है, फिर लेग 1, फिर लेग 3। यह टास्क-ऑर्डर मिसमैच (task-order mismatch) है। पेपर एक संख्या का उपयोग करता है जिसे ρ\rho कहा जाता है। यदि ρ\rho 0.00 है, तो सभी एक ही ताल में दौड़ते हैं। यदि ρ\rho 1.00 है, तो हर कोई अपनी खुद की अराजक लय में दौड़ रहा है।
  3. "मेन्यू में क्या है" वाला नॉब (Task Split): यह तय करता है कि कौन से विषय (जैसे "बिल्लियाँ" या "कुत्ते") प्रत्येक सबक का हिस्सा बनेंगे।

इन्हें अलग करके, HERO शोधकर्ताओं को यह पूछने की अनुमति देता है: "क्या यह मॉडल इसलिए विफल हो रहा है क्योंकि डेटा असमान है, या क्योंकि छात्र पाठों के क्रम को लेकर भ्रमित हैं?"

बड़ा आश्चर्य: औसत स्कोर झूठ बोलते हैं

शोधकर्ताओं ने CIFAR-100 (100 इमेज श्रेणियों का एक डेटासेट) और TinyImageNet (100 इमेज श्रेणियों का एक छोटा सेट) का उपयोग करके एक विशाल प्रयोग चलाया। उन्होंने कई अलग-अलग "सुपर-टीचर" विधियों का परीक्षण किया।

यहाँ बड़ा खुलासा है: औसत स्कोर एक आपदा को छिपा सकते हैं।

"आसान" सेटिंग (जहाँ डेटा निष्पक्ष है और सभी एक क्रम में सीखते हैं) में, FedCBDR नामक एक विधि स्टार थी। इसकी औसत सटीकता सबसे अधिक थी। लेकिन जैसे ही शोधकर्ताओं ने अराजकता को बढ़ाया (डेटा को असमान और क्रम को मिश्रित किया), FedCBDR टूटने लगा।

इस बीच, TagFed और LGA जैसी अन्य विधियों ने आसान सेटिंग में सबसे अच्छा प्रदर्शन नहीं किया था, लेकिन वे कठिन सेटिंग में सबसे मजबूत जीवित रहने वाले (toughest survivors) थे। उन्होंने "निचले 10%" छात्रों (जिनके पास सबसे कठिन डेटा और अजीब शेड्यूल था) को पूरी तरह से विफल होने से बचाया।

पेपर ने इसे तीन विशिष्ट स्कोर का उपयोग करके मापा:

  • Final Average Accuracy (AFA): क्लास का औसत।
  • Average Forgetting (AF): शिक्षक पुराने पाठों के बारे में कितना भूल गया।
  • Bottom-10% Client Accuracy (B10): सबसे खराब स्थिति वाले छात्रों ने कैसा प्रदर्शन किया।

परिणामों ने दिखाया कि एक विधि का उच्च AFA हो सकता है लेकिन terrible B10 हो सकता है। यह एक ऐसे स्कूल की तरह है जहाँ शीर्ष छात्र A+ ग्रेड प्राप्त करते हैं, लेकिन निचले 10% छात्र फेल हो रहे हैं। यदि आप केवल औसत देखते हैं, तो आप सोचेंगे कि स्कूल बहुत अच्छा है। HERO आपको सच्चाई देखने के लिए निचले 10% को देखने के लिए मजबूर करता है।

ग्राफ प्रयोग: केवल तस्वीरें नहीं

यह साबित करने के लिए कि HERO केवल तस्वीरों के लिए नहीं है, लेखकों ने इसे अणुओं (रासायनिक संरचनाओं) के बारे में एक डेटासेट OGB-MolPCBA पर आजमाया। नए प्रकार के अणुओं को सीखने के बजाय, मॉडल को अणुओं के विभिन्न समूहों से सीखना था जो अलग दिखते थे (जैसे विभिन्न स्कैफोल्ड्स)।

उन्होंने इसे अणुओं को 5, 15, या 25 अलग-अलग डोमेन में समूहित करके टेस्ट किया। जैसे-जैसे उन्होंने समूहों को छोटा और अधिक विशिष्ट बनाया (डोमेन की संख्या बढ़ाई), मॉडल खराब होते गए। "औसत परिशुद्धता" (AP) गिर गई, और "भूलना" (forgetting) बढ़ गया। इसने साबित कर दिया कि HERO का इंटरफेस छवियों के साथ-साथ ग्राफ और रसायनों के लिए भी काम करता है।

पेपर क्या खारिज करता है

पेपर स्पष्ट रूप से इस विचार के विरुद्ध तर्क देता है कि आप इन मॉडलों को एकल "लीडरबोर्ड" स्कोर के साथ जज कर सकते हैं। वे दिखाते हैं कि एक विधि जो सरल, सिंक्रोनाइज्ड टेस्ट में जीतती है, वह बुरी तरह हार सकती है जब वास्तविक दुनिया अव्यवस्थित हो जाती है। वे इस विचार को भी खारिज करते हैं कि "औसत प्रदर्शन" पर्याप्त है; आपको यह जानने के लिए कमजोर क्लाइंट्स के प्रदर्शन की जांच करनी चाहिए कि क्या कोई विधि वास्तव में मजबूत है।

हम कितने आश्वस्त हैं?

लेखक इस बात को लेकर बहुत आश्वस्त हैं क्योंकि उन्होंने केवल अनुमान नहीं लगाया; उन्होंने इसे मापा। उन्होंने परिणामों के संयोग न होने की पुष्टि करने के लिए अलग-अलग रैंडम सीड के साथ अपने प्रयोगों को पाँच बार चलाया। उन्होंने CIFAR-100 में आसान सेटिंग में सटीकता के लिए 53.91 ± 1.53 जैसे नंबर रिपोर्ट किए, जिससे यह स्पष्ट हुआ कि परिणाम कितने भिन्न थे।

उन्होंने पाया कि "Joint-Hard" सेटिंग (जहाँ α=0.10\alpha = 0.10 और ρ=1.00\rho = 1.00 है) में, सबसे अच्छी विधि (TagFed) ने CIFAR-100 पर 42.83 का AFA प्राप्त किया, जबकि आसान-सेटिंग विजेता (FedCBDR) गिरकर 39.74 पर आ गया। ये मापे गए तथ्य हैं, न कि केवल सुझाव।

मुख्य निष्कर्ष (The Takeaway)

HERO AI मॉडलों के लिए एक नए प्रकार के जिम की तरह है। उन्हें एक सपाट, खाली ट्रैक पर दौड़ने देने के बजाय जहाँ वे सभी तेज़ दिखते हैं, HERO उन्हें पहाड़ियों, हवा और असमान सतहों वाले ट्रैक पर डालता है। यह हमें दिखाता है कि जो मॉडल सपाट ट्रैक पर सबसे तेज़ दिखता है, वही वह हो सकता है जो कीचड़ में लड़खड़ा जाए। "किसे क्या मिलता है" को "कौन कब जाता है" से अलग करके, HERO हमें ऐसा AI बनाने में मदद करता है जो वास्तव में अव्यवस्थित, अप्रत्याशित वास्तविक दुनिया के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →