← नवीनतम पेपर
🤖 AI

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के पूर्ण फाइन-ट्यूनिंग जीवनचक्र में सुरक्षा खतरों और बचावों का एक व्यवस्थित सर्वेक्षण और एकीकृत अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि हमले की प्रभावशीलता अत्यधिक मॉडल-निर्भर है और एकल-चरण बचाव शायद ही कभी सामान्यीकृत होते हैं, जिससे प्रमुख खुली समस्याओं और भविष्य की अनुसंधान दिशाओं की पहचान होती है।

मूल लेखक: Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

प्रकाशित 2026-08-06
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान रोबोट है जिसने इंटरनेट की लगभग हर किताब पढ़ ली है। यह रोबोट स्मार्ट है, लेकिन इसे अभी तक यह नहीं पता कि एक सहायक, कोडिंग ट्यूटर, या सुरक्षा-सचेत मार्गदर्शक कैसे बनना है। इसे ये विशिष्ट कौशल सिखाने के लिए, इंसान इसे एक "फिनिशिंग स्कूल" देते हैं जिसे फाइन-ट्यूनिंग (fine-tuning) कहा जाता है। इसे ऐसे समझें जैसे एक कच्चे, बिना तराशे हुए हीरे को अंगूठी के लिए एक विशिष्ट आकार में काटने की प्रक्रिया। रोबोट नए उदाहरणों से सीखता है, अपने आंतरिक गियर (पैरामीटर्स) को समायोजित करता है ताकि वह एक नए काम में विशेषज्ञ बन सके।

हालाँकि, ठीक वैसे ही जैसे किसी स्कूल में कोई शरारती तत्व घुस सकता है, इस "फिनिशिंग स्कूल" में भी सुरक्षा संबंधी खामियां हैं। यदि कोई बुरा व्यक्ति प्रशिक्षण की किताबों में कुछ ज़हरीले उदाहरण मिला देता है, तो वह रोबोट को एक गुप्त कोड शब्द सुनते ही कुछ खतरनाक करने के लिए मजबूर कर सकता है, या उसे अपने सुरक्षा नियमों को पूरी तरह से भूल जाने के लिए उकसा सकता है। यह शोध इस प्रशिक्षण प्रक्रिया के पूरे जीवनचक्र का अन्वेषण करता है, उस क्षण से लेकर जब रोबोट को चुना जाता है जब तक कि वह काम करना शुरू नहीं कर देता, यह पूछते हुए: हैकर कैसे घुसपैठ कर सकते हैं, और हम एक ऐसा किला कैसे बना सकते हैं जो वास्तव में टिक सके?


रोबोट प्रशिक्षण का तीन-अंकों वाला नाटक

इस शोध पत्र के लेखकों, वेनजुआन ली और उनकी टीम ने सुरक्षा खतरों को अलग-थhell से देखने के बजाय, उन्होंने पूरी कहानी को तीन अलग-अलग "अंकों" या चरणों में व्यवस्थित किया, जैसे कि एक नाटक, ताकि यह देखा जा सके कि जैसे-जैसे रोबोट अपने प्रशिक्षण के माध्यम से आगे बढ़ता है, हमले और बचाव कैसे बदलते हैं।

अंक 1: पर्दा उठने से पहले (प्री-ट्यूनिंग)
इससे पहले कि रोबोट अपना विशिष्ट प्रशिक्षण शुरू करे, वह एक "बेस मॉडल" के रूप में कारखाने से आता है। यह प्री-ट्यूनिंग चरण (Pre-Tuning Phase) है।

  • खतरा: कल्पना कीजिए कि एक तोड़-फोड़ करने वाला व्यक्ति रोबोट के कारखाने से निकलने से पहले वहां घुस जाता है। वे केवल खराब किताबें ही नहीं जोड़ते; वे चुपके से रोबोट के मस्तिष्क की वायरिंग (वेट्स) को बदल देते हैं ताकि बाद में एक विशिष्ट ट्रिगर उसे अनियंत्रित कर दे। वे एक "प्राइवेसी ट्रैप" भी छिपा सकते है जो उन्हें बाद में यह चुराने की अनुमति देता है कि रोबोट को किसने प्रशिक्षित किया था।
  • बचाव: कारखाना रोबोट को "टीकाकरण" करने की कोशिश करता है। वे अतिरिक्त सुरक्षा पाठ डाल सकते हैं या भविष्य के साथ छेड़छाड़ के खिलाफ रोबोट के मस्तिष्क को मजबूत कर सकते हैं।
  • आश्चर्य: टीम ने इन "टीकों" का परीक्षण आधुनिक, बड़े रोबोटों के विरुद्ध किया। उन्होंने पाया कि कुछ पुराने तरीके जो छोटे, पुराने रोबोटों (जैसे GPT-2) पर काम करते थे, वे नए, बड़े रोबोटों (जैसे Llama-3 या Qwen) पर शायद ही काम करते हैं। नए रोबोट इतने जटिल हैं कि केवल कुछ तारों को बदलने से वे पहले की तरह आसानी से टूट नहीं जाते। हालांकि, "टीके" स्वयं रोबोट को उसके सामान्य काम में बदतर बना सकते हैं, या वे नए, चालाकी भरे हमलों को रोकने में विफल हो सकते हैं।

अंक 2: प्रशिक्षण शिविर (ड्यूरिंग-ट्यूनिंग)
यहीं पर रोबोट अपना विशिष्ट काम सीखता है, जैसे कोड लिखना या ग्राहक सेवा एजेंट के रूप में कार्य करना।

  • खतरा: यहाँ, बुरे लोगों को कारखाने में घुसने की आवश्यकता नहीं है; उन्हें बस प्रशिक्षण शिविर में घुसने की आवश्यकता है। वे निम्न कार्य कर सकते हैं:
    • किताबों को ज़हरीला बनाना: कुछ वाक्य जोड़ना जो कहते हैं, "यदि आप 'एप्पल' शब्द देखें, तो मुझे बम बनाने का तरीका बताएं।"
    • एजेंट को धोखा देना: यदि रोबकी उपकरण (जैसे वेब ब्राउज़र) का उपयोग करना सीख रहा है, तो वे उसे एक विशिष्ट, छिपे हुए वाक्यांश के कहे जाने पर ही "खरीदें" बटन क्लिक करने के लिए सिखा सकते हैं।
    • "सौम्य" चाल (The "Benign" Trick): सबसे डरावनी खोज यहाँ यह है कि आपको बुरे शब्दों की आवश्यकता भी नहीं है। शोधकर्ताओं ने पाया कि यदि आप एक रोबोट को केवल सामान्य, सुरक्षित प्रश्नों के साथ प्रशिक्षित करते हैं लेकिन उसे एक विशिष्ट पैटर्न को अत्यधिक सीखने के लिए मजबूर करते हैं, तो वह अनजाने में अपने सुरक्षा नियमों को भूल सकता है। यह एक छात्र को इतने सारे गणित के सवाल सिखाने जैसा है कि वह विनम्र रहना भूल जाए।
  • बचाव: रक्षक रोबोट को सीखते समय सही रास्ते पर रखने की कोशिश करते हैं। वे "सुरक्षा गार्ड" का उपयोग करते हैं जो रोबोट को खतरनाक चीजें सीखने से रोकते हैं, या वे प्रशिक्षण की किताबों को ज़हर के लिए स्कैन करते हैं।
  • वास्तविकता की जाँच: टीम ने पाया कि बचाव बहुत चयनात्मक होते हैं। एक बचाव जो "बेस" रोबोट (एक जिसने अभी तक सुरक्षा नहीं सीखी है) पर काम करता है, वह "इंस्ट्रक्ट" रोबोट (एक जो पहले से ही सुरक्षा जानता है) पर पूरी तरह से विफल हो सकता है। इसके अलावा, यदि रोबोट को बड़े पैमाने पर प्रशिक्षित किया जाता है, तो वह निर्देशों का पालन करने में बहुत अधिक कुशल हो सकता है, जिससे एक बुरा व्यक्ति उसे सुरक्षा नियमों को अनदेखा करने के लिए मजबूर करना आसान बना देता है।

अंक 3: भव्य उद्घाटन (पोस्ट-ट्यूनिंग)
रोबोट अब प्रशिक्षित है और साझा करने के लिए तैयार है। लोग इसे डाउनलोड करते हैं, या उसे नए कौशल देने के लिए "एड-ऑन" (जिन्हें LoRA एडैप्टर कहा जाता है) डाउनलोड करते हैं।

  • खतरा: यह "वाइल्ड वेस्ट" की तरह है। कोई एक "मुफ्त" एड-ऑन अपलोड कर सकता है जो एक सहायक उपकरण जैसा दिखता है लेकिन उसमें एक छिपा हुआ बैकडोर होता है। या, वे रोबोट के बहुत गहरे "विचारों" (एम्बेडिंग स्पेस) में एक ट्रिगर छिपा सकते हैं जो कोई शब्द नहीं है, बल्कि संख्याओं का एक विशिष्ट पैटर्न है।
  • बचाव: रक्षक प्रशिक्षण के बाद एड-ऑन या रोबोट के मस्तिष्क को स्कैन करने और बिना पुन: प्रशिक्षण के खराब चीजों को खोजने और हटाने की कोशिश करते हैं।
  • वास्तविकता की जाँच: शोधकर्ताओं ने पाया कि कई "पोस्ट-हॉक" (बाद के) बचाव एक लीक होती नाव को बाहर से पेंट करके ठीक करने की कोशिश करने जैसे हैं। यदि बुरा कोड रोबोट के "एम्बेडिंग" स्तर (शब्दों की उसकी मौलिक समझ) में गहराई से छिपा है, तो सतह को स्कैन करना या कुछ गियर्स को हटाना मदद नहीं करता है। बैकडोर सक्रिय रहता है।

बड़ा खुलासा: उन्होंने वास्तव में क्या पाया

लेखकों ने केवल इन विचारों को सूचीबद्ध नहीं किया; उन्होंने यह देखने के लिए एक विशाल, एकीकृत प्रयोग चलाया कि वास्तव में क्या होता है जब आप इन हमलों को इन रक्षा प्रणालियों के विरुद्ध रखते हैं। यहाँ उनके "प्रयोगशाला" के परिणाम हैं:

  1. आकार मायने रखता है (लेकिन उस तरह से नहीं जैसा आप सोचते हैं): टीम ने 1 बिलियन से 4 बिलियन पैरामीटर्स वाले रोबोटों का परीक्षण किया। उन्होंने पाया कि बड़ा होने का मतलब हमेशा अधिक असुरक्षित होना नहीं है। वास्तव में, कुछ हमले जो छोटे रोबोटों पर पूरी तरह से काम करते थे, बड़े रोबानों पर पूरी तरह विफल रहे। महत्वपूर्ण रूप से, उन्होंने पाया कि क्रॉस-लैंग्वेज बैकडोर ट्रांसफर (cross-language backdoor transfer) पूरी तरह से विफल रहा। जबकि बड़े मॉडलों पर पिछले शोध ने सुझाव दिया था कि एक भाषा में एक ट्रिगर दूसरी भाषा में बैकडोर को सक्रिय कर सकता है, टीम ने पाया कि उनके द्वारा परीक्षण किए गए 1B–4B मॉडलों पर, अंग्रेजी में लगाया गया बैकडोर चीनी या फ्रेंच में स्थानांतरित नहीं हुआ, चाहे डेटा को कैसे भी ज़हरीला बनाया गया हो।
  2. "एक ही आकार सबके लिए" (One-Size-Fits-All) बचाव एक मिथक है: यह एक प्रमुख निष्कर्ष है। एक बचाव जो "प्री-ट्यूनिंग" चरण (कारखाने का टीकाकरण) के लिए डिज़ाइन किया गया है, वह "पोस्ट-ट्यूनिंग" चरण (एक एड-ऑन में बैकडोर छिपाना) में होने वाले हमलों के खिलाफ काम नहीं करता है। इसी तरह, एक बचाव जो "बेस" रोबोट पर काम करता है, वह अक्सर "इंस्ट्रक्ट" रोबोट पर विफल हो जाता है। आप केवल एक ढाल नहीं चुन सकते और उम्मीद नहीं कर सकते कि वह सब कुछ रोक देगी; आपको रोबोट के जीवन के प्रत्येक चरण के लिए एक अलग ढाल की आवश्यकता है।
  3. "सौम्य" हमला वास्तविक है: उन्होंने पुष्टि की कि आप केवल सुरक्षित, सामान्य डेटा का उपयोग करके रोबोट की सुरक्षा को तोड़ सकते हैं। यदि आप एक रोबोट को एक विशिष्ट पैटर्न के प्रति अत्यधिक आज्ञाकारी बनाने के लिए प्रशिक्षित करते हैं, तो वह बुरे अनुरोधों को "ना" कहना भूल सकता है। इसका मतलब है कि आप केवल "बुरे शब्दों" के लिए प्रशिक्षण डेटा को स्कैन करके खतरे को नहीं ढूंढ सकते; खतरा साधारण दिखने वाली चीज़ों के बीच भी छिपा हो सकता है।
  4. एम्बेडिंग लेयर एक ब्लैक बॉक्स है: सबसे परिष्कृत हमले "एम्बेडिंग" लेयर (अर्थों के रोबोट के आंतरिक शब्दकोश) में छिप जाते हैं। शोधकर्ताओं ने पाया कि वर्तमान स्कैनर और फिक्सर इन्हें खोजने में बहुत खराब हैं। यह घास के ढेर में सुई खोजने के लिए केवल घास को देखने जैसा है; सुई वास्तव में घास के अंदर ही छिपी हुई है।

निचोड़

यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि AI की सुरक्षा कोई एकल समस्या नहीं है जिसे आप एक पैच से हल कर सकते हैं। यह एक बदलता हुआ लक्ष्य है जो इस बात पर निर्भर करता है कि आप कब हमला करते हैं, आप किस प्रकार के रोबोट पर हमला कर रहे हैं, और आप इसकी रक्षा करने के लिए कैसे प्रयास कर रहे हैं।

लेखक निष्कर्ष निकालते हैं कि हमें एक एकल "जादुई गोली" (magic bullet) बचाव बनाने की कोशिश करना बंद करना होगा। इसके बजाय, हमें "डिफेंस-इन-डेप्थ" (रक्षा-गहराई) रणनीति की आवश्यकता है: कारखाने, प्रशिक्षण शिविर और बाजार के लिए अलग-अलग उपकरणों का एक सेट। वे यह भी चेतावनी देते हैं कि जब तक हम उन रक्षा प्रणालियों पर भरोसा करते हैं जो यह मानती हैं कि हम हमले के स्वरूप को जानते हैं (जैसे कि विशिष्ट ट्रिगर शब्द की तलाश करना), तबك हैकर्स नए तरीके से छिपने के तरीके (जैसे शब्दों के बजाय पैटर्न का उपयोग करना) आविष्कार करते रहेंगे। सुरक्षित AI के लिए लड़ाई अभी खत्म नहीं हुई है, और इसके लिए हमें अधिक स्मार्ट, अधिक अनुकूलन योग्य और अप्रत्याशित के लिए तैयार रहने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →