← नवीनतम पेपर
🤖 AI

Making Models Unmergeable via Scaling-Sensitive Loss Landscape

यह शोध पत्र \textsc{Trap}2^{2} का प्रस्ताव करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) ढांचा है जो फाइन-ट्यूनिंग के दौरान एक स्केलिंग-संवेदनशील लॉस लैंडस्केप को एम्बेड करके मॉडल वेट्स की सुरक्षा करता है, जिससे यह सुनिश्चित होता है कि अनधिकृत मॉडल मर्जिंग से प्रदर्शन में गिरावट आए जबकि स्टैंडअलोन उपयोगिता सुरक्षित रहे।

मूल लेखक: Minwoo Jang, Hoyoung Kim, Jabin Koo, Jungseul Ok

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minwoo Jang, Hoyoung Kim, Jabin Koo, Jungseul Ok

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

AI मॉडल्स की दुनिया की कल्पना एक विशाल, खुली लाइब्रेरी के रूप में करें जहाँ लोग एक बुनियादी शेफ (बेस मॉडल) को नए करतब सिखाने के लिए "रेसिपी कार्ड" (अपडेट्स) साझा करते हैं। कभी-कभी, आप दो रेसिपी कार्डों को मिलाकर एक 'सुपर-शेफ' बनाना चाहते हैं जो दोनों करतब कर सके। इसे मॉडल मर्जिंग (model merging) कहा जाता है।

हालाँकि, एक समस्या है: क्या होगा अगर कोई ऐसा रेसिपी कार्ड जारी करता है जिसे अकेले उपयोग किया जाना चाहिए, लेकिन अन्य लोग इसे अपने कार्डों के साथ मिला देते हैं जिससे एक ऐसा 'दानव' बन जाता है जो सुरक्षा नियमों को तोड़ देता है या लाइसेंसिंग नियमों की अनदेखी करता है? यह पेपर एक "गवर्नेंस गैप" (शासन अंतराल) की बात करता है।

इस पेपर के लेखक, मिनवू जिंग और उनके सहयोगियों ने इन रेसिपी कार्डों को सुरक्षित करने का एक नया तरीका प्रस्तावित किया है ताकि यदि कोई इन्हें दूसरों के साथ मिलाने की कोशिश करे, तो ये टूट (break) जाएँ। वे अपने इस तरीके को TRAP2 कहते हैं।

यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

समस्या: "नाज़ुक केक" (The Fragile Cake)

एक मानक AI अपडेट (जैसे कि एक LoRA एडैप्टर) को एक पूरी तरह से बेक किए गए केक के रूप में सोचें।

  • स्टैंडअलोन (Standalone): यदि आप केक को अकेले खाते हैं, तो इसका स्वाद अद्भुत होता है (उच्च सटीकता)।
  • मर्जिंग (Merging): यदि आप इस केक को दूसरे केक के साथ मिलाने की कोशिश करते हैं, तो परिणाम आमतौर पर एक नया अच्छा डेज़र्ट होता है।

लक्ष्य एक ऐसा केक बनाना है जो अपने आप में लाजवाब हो, लेकिन जैसे ही कोई इसे दूसरे केक के साथ मिलाने की कोशिश करे, यह मश (mush/कीचड़ जैसा) बन जाए।

पुराना तरीका (Post-Hoc Defenses)

इसे रोकने के पिछले प्रयासों में तैयार केक को लेना और बेक करने के बाद उस पर एक विशेष "ग्लेज़" (चमकदार परत) लगाना या सामग्री को पुनर्व्यवस्थित करना शामिल था।

  • दोष: यह केवल विशिष्ट प्रकार के केक (जैसे ट्रांसफॉर्मर मॉडल) पर ही काम करता है। यदि आप किसी अलग प्रकार के केक (जैसे ResNet या ConvNeXt) पर इसे आज़माते हैं, तो ग्लेज़ चिपकता नहीं है, या यह केक का स्वाद बिगाड़ देता है। साथ ही, यदि आप केवल "टॉपिंग" (एडैप्टर) साझा करते हैं और पूरा केक नहीं, तो यह तरीका विफल हो जाता है क्योंकि इसे काम करने के लिए पूरे केक को देखने की आवश्यकता होती है।

नया तरीका: TRAP2 (Training-Time Protection)

केक को बेक करने के बाद उस पर ग्लेज़ लगाने के बजाय, TRAP2 इस बारे में बदल देता है कि केक को शुरू से कैसे बेक किया जाए

कल्पना करें कि आप एक केक बेक कर रहे हैं, लेकिन आपका एक गुप्त नियम है: "यह केक कमरे के तापमान पर तो एकदम सही होना चाहिए, लेकिन यदि आप इसे थोड़ा भी गर्म या ठंडा करते हैं, तो इसे ढह जाना चाहिए।"

AI की दुनिया में, "तापमान" एक स्केलिंग फैक्टर (scaling factor) की तरह है।

  • जब मॉडल का अकेले उपयोग किया जाता है, तो "तापमान" 1.0 पर सेट होता है (परफेक्ट)।
  • जब लोग मॉडल्स को मर्ज करने की कोशिश करते हैं, तो उन्हें गणित को सही रखने के लिए अक्सर "तापमान" (वेट्स को ऊपर या नीचे स्केल करना) को एडजस्ट करना पड़ता है।

TRAP2 मॉडल को विशेष रूप से इन एडजस्टमेंट्स के तहत भंगुर (brittle) बनने के लिए प्रशिक्षित करता है।

  1. प्रशिक्षण (The Training): AI यह सीखता है कि जब स्केलिंग ठीक 1.0 हो, तो उसे बेहतरीन प्रदर्शन करना है।
  2. जाल (The Trap): प्रशिक्षण के दौरान, AI को यह भी दिखाया जाता है कि यदि स्केलिंग 0.5 या 2.0 हो तो क्या होता है। इसे उन परिदृश्यों में अच्छा प्रदर्शन करने के लिए भारी दंड दिया जाता है। यह सीखता है कि स्केल में कोई भी बदलाव खतरनाक है।
  3. परिणाम (The Result): जब मॉडल जारी किया जाता है, तो यह अपने आप में बहुत अच्छा काम करता है। लेकिन जैसे ही कोई उपयोगकर्ता मॉडल को मर्ज करने की कोशिश करता है (जो स्केल में बदलाव लाता है), मॉडल का प्रदर्शन गिर जाता है।

यह क्यों विशेष है?

  • यह सार्वभौमिक (Universal) है: पुराने तरीकों के विपरीत जो केवल विशिष्ट "केक प्रकारों" (ट्रांसफॉर्मर) पर काम करते थे, TRAP2 किसी भी आर्किटेक्चर पर काम करता है। इसे इस बात से फर्क नहीं पड़ता कि मॉडल कैसा दिखता है; इसे केवल इस बात से फर्क पड़ता है कि संख्याओं को कैसे स्केल किया जाता है।
  • यह "टॉपिंग्स" पर काम करता है: यह तब भी काम करता है जब आप पूरे मॉडल के बिना केवल एक छोटा एडैप्टर (जैसे LoRA) जारी करते हैं।
  • "कोलेटरल डैमेज" (Collateral Damage): पेपर नोट करता है कि यदि आप एक TRAP2-सुरक्षित मॉडल को एक सामान्य मॉडल के साथ मिलाते हैं, तो सामान्य वाला भी खराब हो जाता है। यह एक नाजुक कांच के फूलदान को लकड़ी के कटोरे के साथ मिलाने जैसा है; कांच टूट जाता है, और कटोरा भी क्षतिग्रस्त हो जाता है। यह सुनिश्चित करता है कि अनधिकृत मर्जिंग सभी के लिए एक बुरा विचार है।

परिणाम

लेखकों ने कई अलग-अलग इमेज रिकग्निशन कार्यों (जैसे कारों, विमानों या हस्तलिखित अंकों की पहचान करना) पर इसका परीक्षण किया।

  • स्टैंडअलोन: संरक्षित मॉडल असुरक्षित मॉडलों के समान ही अच्छे काम करते हैं।
  • मर्ज किया गया (Merged): जब उन्होंने इन संरक्षित मॉडल्स को दूसरों के साथ मर्ज करने की कोशिश की, तो सटीकता नाटकीय रूप से गिर गई, जो अक्सर एक ऐसे मॉडल के स्तर से भी नीचे चली गई जिसने कभी प्रशिक्षण ही नहीं लिया था।

सारांश में

TRAP2 एक बौ-ट्रैप्ड (booby-trapped) रेसिपी कार्ड की तरह है। यदि आप निर्देशों का ठीक से पालन करते हैं (स्टैंडअलोन उपयोग), तो यह पूरी तरह से काम करता है, लेकिन यदि कोई इसे अन्य रेसिपी के साथ रीमिक्स करने की कोशिश करता है (मर्जिंग), तो पूरी चीज़ बिखर जाती है। यह निर्माता के काम को अनधिकृत संयोजनों में दुरुपयोग से बचाता है, बिना मॉडल की आंतरिक संरचना के विशिष्ट विवरणों को जाने।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →