← नवीनतम पेपर
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

यह शोध पत्र PRESTO पद्धति का परिचय देता है, जो लक्षित वितरण में टोकन रैंक को मिलाने के माध्यम से ओपन-सोर्स LLMs में डीप सेफ्टी अलाइनमेंट को बढ़ाता है ताकि नए रैंक-असिस्टेड प्रीफिलिंग (RAP) हमले का प्रभावी ढंग से मुकाबला किया जा सके, जिससे मानक डेटा ऑग्मेंटेशन डिफेंस की तुलना में सुरक्षा में 4.7 गुना तक सुधार होता है।

मूल लेखक: Jason Vega, Gagandeep Singh

प्रकाशित 2026-07-23
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jason Vega, Gagandeep Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर कहानियाँ लिख सकते हैं, गणित की समस्याएँ हल कर सकते हैं और इंसानों की तरह बातचीत कर सकते हैं। इन्हें 'लार्ज लैंग्वेज मॉडल्स' (LLMs) कहा जाता है, और ये सुपर-स्मार्ट डिजिटल सहायकों की तरह हैं। लेकिन क्योंकि ये इतने स्मार्ट हैं, इसलिए एक चिंता है: क्या होगा अगर कोई उन्हें कुछ खतरनाक कहने के लिए बहला ले, जैसे कि बम कैसे बनाया जाए या किसी को कैसे चोट पहुँचाई जाए? इसे रोकने के लिए, वैज्ञानिक इन मॉडल्स को यह सिखाते हैं कि जब बुरी चीज़ों के बारे में पूछा जाए तो "नहीं, मैं ऐसा नहीं कर सकता" कहें। इसे "सेफ्टी अलाइनमेंट" (सुरक्षा संरेखण) कहा जाता है। हालाँकि, ठीक एक दरवाजे पर लगे ताले की तरह, इन सुरक्षा नियमों को कभी-कभी खोला जा सकता है। इसे करने का एक चालाकी भरा तरीका "प्रीफिलिंग अटैक" (prefilling attack) कहलाता है। कल्पना कीजिए कि आप एक दोस्त के साथ कहानी लिख रहे हैं, लेकिन उसे अगला वाक्य शुरू करने देने के बजाय, आप चुपके से पहले कुछ शब्द खुद लिख देते हैं, जैसे कि "बम बनाने की योजना यहाँ है..." और फिर उससे वाक्य पूरा करने के लिए कहते हैं। क्योंकि कंप्यूटर आपकी कहानी को सुचारू रूप से आगे बढ़ाने के लिए डिज़ाइन किया गया है, इसलिए वह "नहीं" कहना भूल सकता है और बस उस खतरनाक योजना को लिखना जारी रख सकता है।

हाल ही में, शोधकर्ताओं ने इसे ठीक करने का एक तरीका खोजा है, जो मॉडल को उन पहले कुछ शब्दों को लिखने के बाद भी "नहीं" कहना सिखाता है। लेकिन, जैसा कि यह नया पेपर दिखाता है, वह सुधार पूरी तरह पर्याप्त नहीं था। लेखकों ने इसे करने का एक नया तरीका खोजा है, जिसे "रैंक-असिस्टेड प्रीफिलिंग" (Rank-Assisted Prefilling - RAP) अटैक कहा जाता है। केवल कंप्यूटर द्वारा अगला सबसे संभावित शब्द चुनने देने के बजाय, एक हैकर उन शीर्ष 20 शब्दों की सूची देख सकता है जिनके बारे में कंप्यूटर सोच रहा है और उनमें से उस शब्द को चुन सकता है जो खतरनाक लगता है, भले ही कंप्यूटर को लगे कि उसे कहना बहुत ही असंभावित है। यह एक खेल की तरह है जहाँ कंप्यूटर सबसे सुरक्षित रास्ता चुनने की कोशिश कर रहा है, लेकिन हैकर को सभी रास्तों में झाँकने और डरावने वाले को चुनने की अनुमति है, जिससे वह कंप्यूटर की चेतावनियों को अनदेखा कर देता है। पेपर बताता है कि यह नया तरीका आश्चर्यजनक रूप से अच्छा काम करता है, जो उन मॉडल्स की सुरक्षा को तोड़ देता है जिन्हें सुरक्षित माना जाता था।

इसे रोकने के लिए, लेखक एक नई प्रशिक्षण विधि प्रस्तावित करते हैं जिसे PRESTO कहा जाता है। केवल कंप्यूटर को उच्च आत्मविश्वास के साथ "नहीं" कहना सिखाने के बजाय, PRESTO मॉडल को आपके द्वारा शुरू में लिखे गए चालाकी भरे शब्दों को पूरी तरह से अनदेखा करना सिखाता है। यह एक गार्ड डॉग (रखवाले कुत्ते) को चोर की फुसफुसाती हुई हिदायतों को अनदेखा करने और केवल मालिक के आदेश को सुनने के लिए प्रशिक्षित करने जैसा है। ऐसा करके, मॉडल खतरनाक शब्दों को अपने निर्णयों को प्रभावित करने से रोक देता है। शोधकर्ताओं ने तीन लोकप्रिय एआई (AI) मॉडल्स पर इसका परीक्षण किया और पाया कि PRESTO ने हैकर्स के लिए मॉडल्स को धोखा देना बहुत, बहुत कठिन बना दिया—4.7 गुना तक अधिक कठिन—बिना मॉडल्स के सामान्य कार्यों को खराब किए। यह सुझाव देता है कि मॉडल के ध्यान देने के तरीके को बदलकर, हम वास्तव में सुरक्षित एआई बना सकते हैं, भले ही कोई इसे मात देने की कोशिश करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →