← नवीनतम पेपर
💻 computer science

FedOPAL: One-Shot Federated Learning via Analytic Visual Prompt Tuning

FedOPAL एक वन-शॉट फेडरेटेड लर्निंग फ्रेमवर्क है जो विषम वितरणों को संरेखित करने के लिए विज़ुअल प्रॉम्प्ट्स को फीचर रेक्टिफायर के रूप में उपयोग करके विश्लेषणात्मक विधियों में नॉन-IID डेटा की सीमाओं को दूर करता है, जिससे शून्य सर्वर-साइड प्रशिक्षण लागत के साथ उच्च सटीकता प्राप्त होती है।

मूल लेखक: Lingyu Qiu, Daniela Annunziata, Stefano Izzo, Fabio Giampaolo, Francesco Piccialli

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingyu Qiu, Daniela Annunziata, Stefano Izzo, Fabio Giampaolo, Francesco Piccialli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को (जिसे "द ब्रेन" कहा जाता है) बिल्लियों, कुत्तों और कारों को पहचानना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि "द ब्रेन" एक केंद्रीय सर्वर पर रहता है, और उसे दस अलग-अलग दोस्तों (क्लाइंट्स) से सीखना है जो अलग-अलग जगहों पर हैं। लेकिन पेच यह है कि दोस्तों का इंटरनेट कनेक्शन बहुत खराब है, और वे रोबोट को अपने पूरे फोटो एल्बम वापस नहीं भेज सकते। वे केवल एक छोटा सा संदेश भेज सकते हैं।

यह वन-शॉट फेडरेटेड लर्निंग (One-Shot Federated Learning) की दुनिया है। लक्ष्य केवल संचार के एक दौर (one round) में रोबोट को प्रशिक्षित करना है।

पुराना तरीका: "कॉपी-पेस्ट" का संघर्ष

पहले, वैज्ञानिकों ने इस समस्या को हल करने के लिए दोस्तों को अपने फोटो सर्वर पर भेजने के लिए कहा, जहाँ सर्वर ज्ञान को "डिस्टिल" (distill) करने या रोबोट को प्रशिक्षित करने के लिए नकली फोटो बनाने की कोशिश करता था। लेकिन यह ऐसा था जैसे सर्वर से सारा भारी काम करने को कहना। यह धीमा था, महंगा था, और अक्सर विफल हो जाता था जब दोस्तों के फोटो एक-दूसरे से बहुत अलग होते थे (जैसे एक दोस्त के पास केवल बर्फीली बिल्लियों की तस्वीरें हैं और दूसरे के पास रेगिस्तानी कुत्तों की तस्वीरें)।

एक अन्य समूह ने एनालिटिक फेडरेटेड लर्निंग (AFL) नामक एक गणितीय ट्रिक का प्रयास किया। उन्होंने कहा, "चलो प्रशिक्षण को पूरी तरह से छोड़ देते हैं! आइए बस एक जादुई गणितीय सूत्र का उपयोग करके पहेली को तुरंत हल करें।" यह बहुत तेज़ और सर्वर के लिए मुफ्त था। लेकिन इसमें एक घातक दोष था: इसने माना कि सभी दोस्तों के फोटो पहले से ही पूरी तरह से व्यवस्थित और आसानी से छाँटने योग्य थे। वास्तविक दुनिया में, जहाँ डेटा अव्यवस्थित और अस्त-व्यस्त होता है (जिसे वैज्ञानिक Non-IID कहते हैं), वह गणितीय सूत्र भ्रमित हो जाता, रोबोट विफल हो जाता, और पूरी चीज़ क्रैश हो जाती।

नया नायक: FedOPAL

यहाँ FedOPAL आता है। लेखकों, लिंग्यू क्यू (Lingyu Qiu) और नेपल्स विश्वविद्यालय की उनकी टीम ने महसूस किया कि गणितीय सूत्र समस्या नहीं थी; बल्कि इनपुट समस्या थी। रोबोट का मस्तिष्क जम गया था (वह नई चीजें नहीं सीख सकता था), इसलिए वह बिखरे हुए फोटो को हमेशा एक ही तरह से देखता रहता था, चाहे दोस्त उन्हें समझाने की कितनी भी कोशिश क्यों न करें।

FedOPAL एक चतुर समाधान पेश करता है: विजुअल प्रॉम्प्ट ट्यूनिंग (Visual Prompt Tuning)

सोचिए कि रोबोट का मस्तिष्क एक कठोर, जमी हुई मूर्ति है। आप इसे नया आकार देने के लिए पिघला नहीं सकते। लेकिन, आप उस पर विशेष, जादुई चश्मे लगा सकते हैं। ये चश्मे ही विजुअल प्रॉम्प्ट्स (Visual Prompts) हैं।

यहाँ FedOPAL की कहानी में यह कैसे काम करता है:

  1. लोकल चश्मा (The Local Glasses): प्रत्येक मित्र इन जादुई चश्मों की अपनी जोड़ी पहनता है। ये चश्मे छोटे, समायोज्य टोकन (केवल 10!) हैं जो सीधे रोबोट की आँखों के सामने बैठते हैं।
  2. समायोजन (The Adjustment): दोस्त अपने चश्मे को इतना ट्यून करते हैं कि उनके विशिष्ट बिखरे हुए फोटो उस जमी हुई मूर्ति के लिए व्यवस्थित और सुव्यवस्थित दिखें। वे मूर्ति को नहीं बदल रहे हैं; वे बस यह बदल रहे हैं कि मूर्ति दुनिया को कैसे देखती है।
  3. वन-शॉट भेजना (The One-Shot Send): एक बार जब चश्मे को समायोजित कर लिया जाता है, तो दोस्त सर्वर को दो चीजें भेजता है: उनके लोकल चश्मे की सेटिंग्स और कुछ सरल संख्याएँ (जिन्हें सफिशिएंट स्टैटिस्टिक्स/sufficient statistics कहा जाता है) जो यह बताती हैं कि उन चश्मों के माध्यम से फोटो कैसे दिखते हैं।
  4. सर्वर का जादू (The Server's Magic): सर्वर हर दोस्त से प्राप्त सभी लोकल चश्मे की सेटिंग्स को लेता है, उन्हें एक साथ औसत (average) निकालता है ताकि एक एकल "ग्लोबल जोड़ी चश्मा" बनाया जा सके। फिर, दोस्तों द्वारा भेजी गई सरल संख्याओं का उपयोग करके, यह अपने जादुई गणितीय सूत्र (लीस्ट-स्क्वेयर्स सॉल्यूशन) का उपयोग करके तुरंत यह पता लगा लेता है कि बिल्लियों, कुत्तों और कारों को वर्गीकृत करने का सही तरीका क्या है।

यह एक बड़ी बात क्यों है

पेपर दिखाता है कि यह तरीका गेम-चेंजर है।

  • यह तेज़ है: सर्वर कोई प्रशिक्षण नहीं करता है। यह केवल एक त्वरित गणितीय गणना करता है।
  • यह मजबूत है: भले ही दोस्तों का डेटा बहुत बिखरा हुआ हो (एक "डिरिचलेट डिस्ट्रीब्यूशन" पैरामीटर के साथ जो 0.1 है, जिसका अर्थ है बहुत अलग डेटा), FedOPAL अभी भी काम करता है।
  • परिणाम: CIFAR-10 नामक एक टेस्ट पर, FedOPAL ने बिखरी हुई स्थितियों में 93.72% सटीकता हासिल की, जिसने पिछले सर्वश्रेष्ठ तरीके (FedCGS) को हरा दिया जो केवल 86.11% प्राप्त कर सका था। CIFAR-100 पर, इसने 75.51% स्कोर किया, जो प्रतिद्वंद्वी के 64.58% को पछाड़ देता है।

यह क्या नहीं है

पेपर स्पष्ट रूप से बताता है कि FedOPAL क्या नहीं है।

  • यह ऐसा तरीका नहीं है जिसमें सर्वर को मॉडल को फिर से प्रशिक्षित करने की आवश्यकता हो। वह पुराना, धीमा तरीका है।
  • यह कोई जादुई छड़ी नहीं है जो हर समस्या को ठीक कर दे। लेखक स्वीकार करते हैं कि घर के नंबरों (SVHN) के एक विशिष्ट डेटासेट पर, FedOPAL ने 47.05% स्कोर किया, जो FedCGS के 57.45% से थोड़ा कम था। क्यों? क्योंकि रोबोट का मस्तिष्क मूल रूप से प्राकृतिक फोटो (जैसे बिल्लियाँ और कुत्ते) पर प्रशिक्षित किया गया था, और घर के नंबर एक बिल्कुल अलग "ब्रह्मांड" हैं। जादुई चश्मों ने बहुत मदद की, लेकिन वे एक शॉट में उस विशाल अंतर को पूरी तरह से पाट नहीं सके।
  • यह ऐसा तरीका नहीं है जो रोबोट के मस्तिष्क की संरचना को बदलता है। "बैकबोन" (रोबोट का मुख्य हिस्सा) जड़ा हुआ (frozen) रहता है। केवल छोटे "चश्मे" (प्रॉम्प्ट्स) ही चलते हैं।

निचोड़ (The Bottom Line)

FedOPAL सुझाव देता है कि यदि आपके पास एक शक्तिशाली, प्री-ट्रेंड रोबोट है, तो आपको इसे शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आपको बस इसे दुनिया को स्पष्ट रूप से देखने के लिए सही चश्मा देने की आवश्यकता है, चाहे डेटा कितना भी बिखरा हुआ क्यों न हो। इन "चश्मों" को एक तेज़ गणितीय सूत्र के साथ जोड़कर, लेखक दिखाते हैं कि हम कुशल, निजी और आश्चर्यजनक रूप से सटीक AI सिस्टम बना सकते हैं, भले ही सभी का डेटा पूरी तरह से अलग हो।

यह पेपर CIFAR-10, CIFAR-100, SVHN, और DTD जैसे डेटासेट्स पर व्यापक सिमुलेशन के माध्यम से सिद्ध करता है कि यह "चश्मे" वाला दृष्टिकोण वास्तविक दुनिया के डेटा की अराजकता को बिना भारी खर्च के संभालने का एक ठोस, नया तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →