← नवीनतम पेपर
🤖 machine learning

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

यह शोध पत्र TRACE का प्रस्ताव करता है, जो एक प्रक्षेपवक्र-आधारित (trajectory-based) सुरक्षा पैच लर्निंग फ्रेमवर्क है जो एक प्लग-इन सुरक्षा पैच को अनुकूलित करने के लिए प्रगतिशील रूप से दूषित अवस्थाओं (progressively corrupted states) को उत्पन्न करता है, जो अनुकूलित फाइन-ट्यूनिंग कार्यों से प्राप्त उपयोगिता से समझौता किए बिना मॉडल की सुरक्षा को प्रभावी रूप से पुनर्प्राप्त करता है।

मूल लेखक: Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आप एक सुपर-स्मार्ट रोबोट ब्रेन (दिमाग) किराए पर ले सकते हैं, इसे अपने विशिष्ट होमवर्क करने, अपने ईमेल लिखने, या यहाँ तक कि आपके वीडियो गेम को कोड करने में मदद करने के लिए कस्टमाइज़ कर सकते हैं। यह "फाइन-ट्यूनिंग-एज़-ए-सर्विस" (FTaaS) का वादा है। आप अपना स्वयं का डेटा अपलोड करते हैं, सेवा प्रदाता उस पर रोबोट ब्रेन को प्रशिक्षित करता है, और आपको बदले में एक व्यक्तिगत संस्करण मिलता है। लेकिन यहाँ एक पेंच है: ये रोबोट ब्रेन मददगार और हानिरहित होने के लिए प्रशिक्षित किए जाते हैं। यदि आप अनजाने में (या जानबूझकर) उन्हें बुरा डेटा खिलाते हैं, तो वे अपने शिष्टाचार को भूल सकते हैं और खतरनाक या अभद्र बातें कहना शुरू कर सकते हैं। बड़ा सवाल उन लोगों के लिए है जो इन रोबोट ब्रेन्स के मालिक हैं: हम एक ऐसे रोबोट को कैसे ठीक करें जिसने बुरी आदतें सीख ली हैं, बिना उन सभी शानदार नए कौशल को खोए जो उसने अभी-अभी सीखे हैं?

लंबे समय तक, इसका समाधान एक बिखरे हुए कमरे को ठीक करने के लिए उसके बीच में "छूना मना है" का साइन बोर्ड रखने जैसा था। शोधकर्ताओं ने एक "सेफ्टी पैच" (बुरे व्यवहार को रोकने के नियमों का एक सेट) को कस्टमाइज़्ड रोबलेट ब्रेन के साथ मर्ज करने की कोशिश की। लेकिन उन्होंने एक बड़ी समस्या पाई: सुरक्षा नियम और नए कौशल अक्सर रोबोट के मस्तिष्क में एक ही स्थान के लिए लड़ते थे। यदि आप सुरक्षा नियमों को बहुत ज़ोर से लागू करते, तो आप अनजाने में रोबोट की आपका होमवर्क करने की क्षमता को मिटा देते। यदि आप उन्हें बहुत कमज़ोर रखते, तो रोबोट फिर भी अभद्र बातें कहता। यह एक निराशाजनक खींचतान थी जहाँ आप दोनों पक्षों में एक साथ नहीं जीत सकते थे।

यह शोध पत्र इस खींचतान को हल करने का एक नया तरीका पेश करता है जिसे TRACE कहा जाता है। एक तैयार रोबोट पर सुरक्षा पैच थोपने और उम्मीद करने के बजाय कि सब ठीक हो जाएगा, TRACE बैकग्राउंड में काम करता है, किसी भी विशिष्ट उपयोगकर्ता कस्टमाइज़ेशन के पहले। यह एक विशेष "सेफ्टी एडॉप्टर" सीखता है, यह सिम्युलेट करके कि कैसे एक रोबोट ब्रेन बुरे डेटा से भ्रष्ट होता है, चरण-दर-चरण, जैसे कि एक छात्र के धीरे-धीरे अपने शिष्टाचार को भूलने के वीडियो को देखना। फिर, यह एक सार्वभौमिक पैच बनाता है जो जानता है कि किसी भी कस्टमाइज़्ड रोबोट को वापस विनम्र बनाने के लिए उसे ठीक कैसे करना है, चाहे भ्रष्टाचार कितना भी बुरा क्यों न रहा हो, बिना उस नए कौशल को छुए जो उस विशिष्ट रोबोट ने सीखा है। इसे बुरे व्यवहार के लिए एक जादुई "अनडू" (undo) बटन की तरह समझें जो केवल बुरे हिस्सों पर प्रहार करता है और अच्छे हिस्सों को अकेला छोड़ देता है।

शोधकर्ताओं ने दो अलग-अलग रोबोट ब्रेन्स (Llama और Qwen) पर इसका परीक्षण किया और पाया कि TRACE एक गेम-चेंजर है। अपने सिमुलेशन में, TRACE ने रोबोटों को हानिकारक अनुरोधों के विरुद्ध 100% सुरक्षित बनाने में सफलता प्राप्त की, भले ही रोबोटों को भारी मात्रा में बुरे डेटा पर प्रशिक्षित किया गया हो। साथ ही, इसने उनके काम करने की क्षमता (जैसे SQL कोड लिखना या कहानियों का सारांश देना) को लगभग वैसा ही बनाए रखा जैसा कि वे कभी हमला हुए ही न हों, जिसमें प्रदर्शन में परिवर्तन 1.7% से भी कम था।

यह शोध पत्र तर्क देता है कि ऑनलाइन (रोबोट पहले से ही कस्टमाइज़ होने के बाद) सुरक्षा पैच को "मर्ज" करने का पुराना तरीका मौलिक रूप से त्रुटिपूर्ण है क्योंकि सुरक्षा और कार्य की दिशाएँ आपस में उलझ जाती हैं। TRACE यह सिद्ध करता है कि एक "डिसेन्टैंगल्ड" (विघटित) पैच को ऑफलाइन सीखने के माध्यम से—जो उपयोगकर्ता के कार्यों के अलग फ्रीक्वेंसी पर काम करता है—आप दोनों चीज़ें हासिल कर सकते हैं। परिणाम एक ऐसा रोबोट है जो आपके विशिष्ट काम में सुपर-स्मार्ट भी है और पूरी तरह से सुरक्षित भी, बिना सेवा प्रदाता को प्रत्येक एकल उपयोगकर्ता के लिए लगातार सेटिंग्स बदलने की आवश्यकता के। यह चलते समय लीक होती नाव को पैच करने के बजाय, बंदरगाह छोड़ने से पहले एक बेहतर पतवार (hull) बनाने की ओर एक बदलाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →