← नवीनतम पेपर
🤖 machine learning

From Parameters to Feature Space: Task Arithmetic for Backdoor Mitigation in Model Merging

यह शोध पत्र लीनियर फीचर पाथ मिनिमाइजेशन (LFPM) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक एकीकृत फीचर-स्पेस परिप्रेक्ष्य के भीतर अनुकूलित एक एंटी-बैकडोर टास्क वेक्टर को पेश करके मॉडल मर्जिंग में बैकडोर हमलों को कम करता है ताकि क्लीन-टास्क प्रदर्शन को बनाए रखते हुए दुर्भावनापूर्ण ट्रिगर्स को प्रभावी ढंग से दबाया जा सके।

मूल लेखक: Zhenqian Zhu, Yamin Hu, Yiya Diao, Weixiang Li, Haodong Li, Wenjian Luo

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenqian Zhu, Yamin Hu, Yiya Diao, Weixiang Li, Haodong Li, Wenjian Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास विशेषज्ञ शेफ की एक टीम है। एक इतालवी (Italian) भोजन में लाजवाब है, दूसरा जापानी व्यंजनों में, और तीसरा बेकिंग में। उन्हें अलग-अलग काम करने के लिए तीनों को काम पर रखने के बजाय, आप उनके व्यंजनों को एक "सुपर शेफ" में "विलय" (merge) करने का निर्णय लेते हैं जो कुछ भी बना सके। यह मॉडल मर्जिंग (Model Merging) है। यह विभिन्न AI मॉडलों को एक शक्तिशाली टूल में संयोजित करने का एक लोकप्रिय और लागत प्रभावी तरीका है।

हालाँकि, इस प्रक्रिया में एक खतरनाक खामी है। कल्पना कीजिए कि एक चालाक घुसपैठिया (saboteur) टीम में शामिल हो जाता है। वह पूरे किचन को बर्बाद करने की कोशिश नहीं करता; वह बस अपने विशिष्ट व्यंजन (मान लीजिए, इतालवी वाला) में एक गुप्त, छिपे हुए निर्देश को शामिल करने के लिए उसमें थोड़ा बदलाव करता है: "यदि आपको लाल मिर्च दिखे, तो पास्ता के बजाय जहर की एक प्लेट परोसें।"

जब आप इस समझौता किए गए (compromised) व्यंजन को अन्य व्यंजनों के साथ मिलाते हैं, तो "सुपर शेफ" इस गुप्त निर्देश को सीख लेता है। अब, जब भी कोई ग्राहक पास्ता के साथ लाल मिर्च ऑर्डर करता है, तो शेफ पास्ता के बजाय जहर परोस देता है, भले ही वह बाकी सब कुछ पूरी तरह से बनाता हो। यह एक बैकडोर अटैक (Backdoor Attack) है।

वर्तमान बचाव विधियों के साथ समस्या

पिछले प्रयास इस जटिल, बहु-रंगीन कपड़े से दाग साफ करने के समान थे, जहाँ पूरे कपड़े को आक्रामक रूप से रगड़ा जाता था।

  • पुराना तरीका: रक्षक (defenders) अंतिम रेसिपी में "बुरे" तत्वों को खोजने और उन्हें घटाने की कोशिश करते थे।
  • खामी: क्योंकि रेसिपी इतनी गहराई से मिली हुई होती है, आप आसानी से यह नहीं बता सकते कि "जहर वाले निर्देश" का कौन सा हिस्सा लाल मिर्च से संबंधित है और कौन सा हिस्सा "पास्ता के स्वाद" से संबंधित है। यदि आप जहर को हटाने की कोशिश करते हैं, तो आप अक्सर गलती से पास्ता को भी खराब कर देते हैं, जिससे पूरा व्यंजन बेस्वाद हो जाता है।

नया समाधान: LFPM (Linear Feature Path Minimization)

इस शोध पत्र के लेखकों ने LFPM नामक एक नई विधि प्रस्तावित की है। कपड़े को रगड़ने के बजाय, वे दृष्टिकोण बदल देते हैं। वे सामग्री (parameters) को देखना बंद कर देते हैं और व्यंजन के स्वाद प्रोफाइल (features) को देखना शुरू करते हैं।

यहाँ बताया गया है कि हमारे किचन एनालॉजी (उपमा) का उपयोग करते हुए LFPM कैसे काम करता है:

1. "फ्लेवर मैप" (क्रॉस-टास्क लिनियरिटी)

शोधकर्ताओं ने कुछ बहुत ही दिलचस्प खोजा: जब आप दो शेफ के व्यंजनों को मिलाते हैं, तो मिश्रण के किसी भी बिंदु पर परिणामी स्वाद मूल दोनों स्वादों के बीच लगभग एक सीधी रेखा होता है।

  • एनालॉजी: यदि शेफ A का स्वाद "तीखा" है और शेफ B का स्वाद "मीठा" है, तो 50/50 का मिश्रण ठीक "मध्यम-तीखा-मीठा" जैसा लगेगा। यह अचानक "खट्टा" या "धात्विक" नहीं हो जाता, सिर्फ इसलिए नहीं कि आपने उन्हें मिला दिया है।
  • अंतर्दृष्टि (Insight): लेखकों ने महसूस किया कि यदि यह "सीधी रेखा" वाला नियम स्वादों के लिए सच है, तो वे कच्चे तत्वों के बजाय स्वादों में हेरफेर करके बैकडोर को ठीक कर सकते हैं।

2. चरण एक: "पास्ता" से "जहर" को अलग करना

रेसिपी को ठीक करने से पहले, उन्हें पूरे व्यंजन को खराब किए बिना बुरे हिस्से को अलग करने की आवश्यकता है।

  • ट्रिक: वे सबस्पेस पार्टीशनिंग (Subspace Partitioning) नामक तकनीक का उपयोग करते हैं। कल्पना कीजिए कि फ्लेवर प्रोफाइल एक विशाल कमरा है। "पास्ता" के स्वाद एक कोने में रहते हैं, और "जहर" (बैकडोर) के स्वाद एक अलग, ऑर्थोगोनल (orthogonal) कोने में रहते हैं।
  • कार्रवाई: वे "जहर" के कोने को खोजने के लिए एक विशेष उपकरण (learnable visual prompts) का उपयोग करते हैं। उन्हें यह जानने की आवश्यकता नहीं है कि जहर कैसा दिखता है (ट्रिगर); उन्हें बस उस दिशा को खोजने की आवश्यकता है जहाँ जहर मौजूद है और उसे पास्ता से अलग करने की आवश्यकता है। यह सुनिश्चित करता है कि पास्ता को ढूँढते समय वे गलती से पास्ता को फेंक न दें।

3. चरण दो: "एंटी-पॉइजन" शेफ

अब वे एक नया "एंटी-बैकडोर" कार्य बनाते हैं। इसे एक नए सलाहकार शेफ को काम पर रखने के रूप में सोचें जिसका एकमात्र काम जहर को बेअसर करना है।

  • रणनीति: केवल जहर को घटाने के बजाय (जिससे पास्ता खराब हो सकता है), वे इस नए शेफ को एक विशिष्ट पथ पर चलने के लिए निर्देशित करते हैं। वे चाहते हैं कि नया शेफ "सुपर शेफ" के साथ इस तरह से मिले कि वह जहर की "तीक्ष्णता" (sharpness) को कम कर दे।
  • पाथ इंटीग्रल (Path Integral): कल्पना कीजिए कि आप "जहरीले सुपर शेफ" से "साफ सलाहकार" की ओर चल रहे हैं। लेखक सुनिश्चित करते हैं कि इस चलने के पथ पर हर एक कदम सुरक्षित हो। वे केवल शुरुआत और अंत के बिंदुओं की जांच नहीं करते; वे पूरी यात्रा की जांच करते हैं।
  • परिणाम: इस पथ को अनुकूलित (optimize) करके, वे एक "शुद्ध सुपर शेफ" (Purified Super Chef) बनाते हैं जो जहर के निर्देश को भूल गया है लेकिन पास्ता बनाने का तरीका याद रखता है।

यह बेहतर क्यों है?

  • सटीकता (Precision): क्योंकि वे "सामग्री स्थान" (parameter space) के बजाय "स्वाद स्थान" (feature space) में काम करते हैं, वे साफ कार्यों को धुंधला किए बिना बैकडोर को लक्षित कर सकते हैं।
  • सुरक्षा: उन्होंने साबित किया कि यदि आप "सफाई" की प्रक्रिया के बीच में ही रुक जाते हैं, तो भी मॉडल सुरक्षित रहता है। यह केवल अंत में ही नहीं काम करता; यह पूरे रास्ते में काम करता है।
  • बहुमुखी प्रतिभा (Versatility): उन्होंने इसे पूर्ण रेसिपी (Full Fine-Tuning) और छोटे रेसिपी संशोधनों (PEFT/LoRA) दोनों पर परखा, और यह दोनों मामलों में सफल रहा।

निष्कर्ष (The Bottom Line)

लेख दावा करते हैं कि LFPM मर्ज किए गए AI मॉडलों को साफ करने का एक मजबूत तरीका है। यह उन छिपे हुए "बैकडोर" ट्रिगर्स को सफलतापूर्वक हटा देता है जो विशिष्ट इनपुट पर AI को गलत व्यवहार करने के लिए मजबूर कर सकते हैं, जबकि AI की सामान्य, उपयोगी कार्यों को करने की क्षमता को बरकरार रखता है। यह ऐसा इसलिए कर पाता है क्योंकि यह मॉडल को केवल संख्याओं के बैग के रूप में नहीं, बल्कि नेविगेबल "फ्लेवर पाथ्स" के एक सेट के रूप में देखता है, जिससे यह पिछले तरीकों की तुलना में बहुत अधिक सटीक और प्रभावी सफाई की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →