← नवीनतम पेपर
🤖 machine learning

Sequential Data Poisoning in LLM Post-Training

यह शोध पत्र LLM पोस्ट-ट्रेनिंग पाइपलाइनों के लिए एक अनुक्रमिक डेटा पॉइजनिंग (sequential data poisoning) खतरे के मॉडल को प्रस्तुत करता है, जो यह प्रकट करता है कि विभिन्न चरणों (जैसे SFT और DPO/PPO) को लक्षित करने वाले कई हमलावर ऐसे संयुक्त भेद्यताएँ (compound vulnerabilities) उत्पन्न कर सकते हैं जो अलग-थलग हमलों की तुलना में काफी अधिक प्रभावी हैं, जिससे मौजूदा सुरक्षा विश्लेषणों में एक महत्वपूर्ण "एकल-हमलावर भ्रम" (single-attacker illusion) उजागर होता है।

मूल लेखक: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट असिस्टेंट बना रहे हैं। इसे वास्तव में उपयोगी और सुरक्षित बनाने के लिए, आप इसे केवल एक बार प्रशिक्षित नहीं करते; बल्कि आप इसे एक बहु-चरणीय "स्कूली शिक्षा" प्रक्रिया से गुजारते हैं।

  1. चरण 1 (SFT): आप इसे प्रश्नों और उत्तरों की एक पाठ्यपुस्तक का उपयोग करके निर्देशों का पालन करना सिखाते हैं।
  2. चरण 2 (Alignment): फिर आप इसे सिखाते हैं कि इंसान क्या पसंद करते हैं। आप उसे "अच्छे" बनाम "बुरे" उत्तरों के उदाहरण दिखाते हैं और उसे "अच्छे" वाले चुनने के लिए प्रशिक्षित करते हैं। यह दो तरीकों से किया जा सकता है:
    • विधि A (DPO): सीधे इसे प्राथमिकता के नियम सिखाना।
    • विधि B (PPO): एक "जज" (रिवॉर्ड मॉडल) को नियुक्त करना जो इसके उत्तरों को ग्रेड दे, और फिर रोबोट को उस जज से उच्च स्कोर प्राप्त करने के लिए प्रशिक्षित करना।

समस्या: "गुप्त तोड़फोड़ करने वाला" (The Secret Saboteur)

यह शोध पत्र एक डरावना सवाल पूछता है: क्या होगा अगर कोई इसकी स्कूली शिक्षा के दौरान इस रोबोट को हैक करने की कोशिश करे?

अतीत में, शोधकर्ताओं ने केवल एक समय में एक चरण को देखा। उन्होंने पूछा, "यदि कोई हैकर पाठ्यपुस्तक में बुरा डेटा डाल देता है, तो क्या रोबोट टूट जाएगा?" या "यदि कोई हैकर प्राथमिकता डेटा (preference data) के साथ छेड़छाड़ करता है, तो क्या रोबोट टूट जाएगा?"

उन्होंने पाया कि यदि आप केवल पाठ्यपुस्तक पर हमला करते हैं, तो दूसरा चरण पूरा होने के बाद रोबोट ठीक लगता है। यदि आप केवल प्राथमिकता डेटा पर हमला करते हैं, तो भी रोबोट ठीक लगता है। ऐसा लग रहा था कि रोबोट सुरक्षित था क्योंकि दूसरे प्रशिक्षण चरण के बाद "बुरा" व्यवहार गायब हो गया था।

बड़ी खोज: "एकल-आक्रमणकारी भ्रम" (The Single-Attacker Illusion)

लेखकों को लगा कि यह एक जाल है। वे इसे "एकल-आक्रमणकारी भ्रम" कहते हैं।

उपमा:
कल्पना कीजिए कि आप एक सुरक्षित इमारत में एक जासूस को चुपके से भेजने की कोशिश कर रहे हैं।

  • प्रयास 1: आप मुख्य दरवाजे पर गार्ड को रिश्वत देने की कोशिश करते हैं (चरण 1)। गार्ड आपको पकड़ लेता है, और जासूस को बाहर निकाल दिया जाता है। आप सोचते हैं, "फू, इमारत सुरक्षित है।"
  • प्रयास 2: आप अंदर के मैनेजर को रिश्वत देने की कोशिश करते हैं (चरण 2)। मैनेजर आपको पकड़ लेता है, और जासूस को बाहर निकाल दिया जाता है। आप सोचते हैं, "फू, इमारत सुरक्षित है।"

वास्तविकता:
यह शोध पत्र दिखाता है कि यदि आपके पास दो अलग-अलग तोड़फोड़ करने वाले (या एक बहुत ही चालाक तोड़फोड़ करने वाला जो दो चरणों में काम करता है) हैं, तो वे इमारत को तोड़ने के लिए मिलकर काम कर सकते, भले ही उनमें से कोई भी अकेले ऐसा नहीं कर सकता था।

  • चाल: पहला तोड़फोड़ करने वाला चरण 1 के दौरान रोबोट के मस्तिष्क में एक "सोने वाला" गुप्त कोड प्लांट करता है। दूसरा प्रशिक्षण चरण (alignment) इस कोड को हटाता नहीं है; यह बस इसे सुला देता है। रोबोट सामान्य और सुरक्षित दिखता है।
  • जागने का कॉल (Wake-Up Call): दूसरा तोड़फोड़ करने वाला चरण 2 में प्राथमिकता डेटा के साथ छेड़छाड़ करता है। यह केवल नया बुरा व्यवहार नहीं जोड़ता है; यह एक "वेक-अप कॉल" की तरह काम करता है जो चरण 1 के सोते हुए कोड को फिर से सक्रिय कर देता है।

अचानक, रोबोट सुरक्षित होता है जब तक आप एक विशिष्ट जादुई शब्द (ट्रिगर) नहीं बोलते। यदि आप वह शब्द बोलते हैं, तो रोबोट सभी सुरक्षा नियमों को अनदेखा कर देता है और बिल्कुल वैसा ही करता है जैसा हैकर्स चाहते हैं।

वे एक साथ कैसे काम करते हैं (दो परिदृश्य)

शोध पत्र ने रोबोट को प्रशिक्षित करने के दो अलग-अलग तरीकों का परीक्षण किया और पाया कि तोड़फोड़ करने वाले प्रत्येक में अलग तरह से काम करते हैं:

1. "योगात्मक" टीम (SFT → DPO)

  • यह कैसे काम करता है: कल्पना कीजिए कि दो लोग एक भारी कार को धक्का दे रहे हैं। यदि व्यक्ति A थोड़ा धक्का देता है, तो कार नहीं हिलती। यदि व्यक्ति B थोड़ा धक्का देता है, तो कार नहीं हिलती। लेकिन यदि वे एक ही समय में धक्का देते हैं, तो कार आगे बढ़ जाती है।
  • परिणाम: पाठ्यपुस्तक और प्राथमिकता डेटा के बीच "बुरे डेटा" के बजट को विभाजित करना, सारा बुरा डेटा केवल एक ही जगह रखने की तुलना में बेहतर काम करता है। वे एक-दूसरे की मदद करते हैं।

2. "पूरक" टीम (SFT → PPO)

  • यह कैसे काम करता है: यह एक ताले और चाबी की तरह है।
    • पहला तोड़फोड़ करने वाला (चरण 1) रोबोट के मस्तिष्क में एक ताला लगाता है।
    • दूसरा तोड़फोड़ करने वाला (चरण 2) चाबी बनाता है।
    • यदि आपके पास केवल ताला है, तो रोबोट सुरक्षित है। यदि आपके पास केवल चाबी है, तो रोबोट सुरक्षित है। लेकिन यदि आपके पास दोनों हैं, तो दरवाजा खुल जाता है।
  • परिणाम: इनमें से कोई भी हमला अपने आप में काम नहीं करता है। आपको दोनों चरणों को ज़हरीला बनाना ही होगा ताकि हैक सफल हो सके।

मल्टी-एडवर्सरी ट्विस्ट (The Multi-Adversary Twist)

शोध पत्र ने एक ऐसे परिदृश्य को भी देखा जहाँ दो अलग-अलग हैकर्स स्वतंत्र रूप से काम कर रहे हैं, जो एक-दूसरे को नहीं जानते।

  • परिणाम: बिना एक-दूसरे से बात किए भी, उनके हमले सिस्टम को तोड़ने के लिए मिलकर काम करते हैं। यदि हैकर A चरण 1 में एक जाल बिछाता है और हैकर B चरण 2 में एक जाल बिछाता है, तो अंतिम रोबोट दोनों जालों के प्रति संवेदनशील होता है। बाद वाला चरण आमतौर पर हावी रहता है, लेकिन पहले चरण का नुकसान अभी भी वहीं है, जो ट्रिगर होने का इंतज़ार कर रहा है।

निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि हम केवल उसके प्रशिक्षण के एक चरण को देखकर AI की सुरक्षा का आकलन नहीं कर सकते।

  • भ्रम: एक चरण की जाँच करना AI को सुरक्षित दिखाता है क्योंकि "बुराई" छिपी हुई या दबी हुई होती है।
  • सच्चाई: पूरी प्रक्रिया नाजुक है। जब आप शुरुआत से अंत तक की पूरी यात्रा को देखते हैं, तो आपको एहसास होता है कि विभिन्न चरणों में होने वाले छोटे, स्पष्ट रूप से हानिरहित हमले मिलकर एक बड़ा सुरक्षा छेद बना सकते हैं।

संक्षेप में: सिर्फ इसलिए कि एक रोबोट अपने दूसरे क्लास के बाद सुरक्षित दिखता है, इसका मतलब यह नहीं है कि वह सुरक्षित है। यदि किसी ने पहली क्लास में एक गुप्त निर्देश प्लांट किया और दूसरे व्यक्ति ने ग्रेडिंग के साथ छेड़छाड़ की, तो रोबोट नियमों को तोड़ने के लिए तैयार हो सकता है जैसे ही कोई विशिष्ट शब्द बोला जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →