← नवीनतम पेपर
💬 NLP

Token Rankings are Unforgeable Language Model Signatures

यह शोधपत्र यह प्रदर्शित करता है कि टोकन रैंकिंग भाषा मॉडलों के लिए एक अद्वितीय, अनफॉरजेबल (unforgeable) हस्ताक्षर के रूप में कार्य करती है जो उन्हें बिना उनके पैरामीटर्स को लीक किए पहचान सकती है, बशर्ते कि API आउटपुट को पर्याप्त रूप से छोटे टॉप-kk तक प्रतिबंधित करे ताकि पैरामीटर चोरी को रोका जा सके और साथ ही मॉडल के विशिष्ट रैंकिंग पैटर्न को प्रकट किया जा सके।

मूल लेखक: Matthew Finlayson, Andreas Grivas, Xiang Ren, Swabha Swayamdipta

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthew Finlayson, Andreas Grivas, Xiang Ren, Swabha Swayamdipta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत प्रसिद्ध, अद्वितीय शेफ है। यह शेफ केवल खाना नहीं बनाता; उनके पास प्लेट पर सामग्री को सजाने का एक विशिष्ट तरीका है। भले ही आप भोजन का स्वाद न ले सकें या सटीक रेसिपी न देख सकें, लेकिन जिस क्रम में सामग्रियों को रखा गया है वह इतना अनूठा है कि वह एक फिंगरप्रिंट की तरह काम करता है।

यह शोध पत्र इस विचार का उपयोग करके एक नए तरीके से AI भाषा मॉडलों की पहचान करने का परिचय देता है: शब्दों का क्रम (order), न कि उनकी सटीक संभावना (probability)।

यहाँ उनकी खोज का विवरण, सरल उपमाओं के साथ दिया गया है:

1. समस्या: "रेसिपी" का लीक होना

पहले, यह साबित करने के लिए कि एक AI वही है जो वह होने का दावा करता है, शोधकर्ता AI से उसके "कॉन्फिडेंस स्कोर" (वह प्रत्येक शब्द के बारे में कितना आश्वस्त है) मांगते थे।

  • उपमा: कल्पना कीजिए कि AI कहता है, "मुझे 99% यकीन है कि अगला शब्द 'cat' है, 1% 'dog' है, और 0.01% 'helicopter' है।"
  • जोखिम: यदि आपके पास ये सटीक संख्याएँ हैं, तो एक हैकर AI के मस्तिष्क (इसके आंतरिक पैरामीटर्स) को रिवर्स-इंजीनियर कर सकता है ताकि एक नकली प्रतिलिपि बनाई जा सके। एक बार जब उनके पास नकली प्रतिलिपि आ जाती है, तो वे हस्ताक्षर की नकल कर सकते हैं, जिससे असली AI और नकली के बीच अंतर करना असंभव हो जाता है।

2. समाधान: "रैंकिंग" सिग्नेचर

लेखक एक सुरक्षित तरीका प्रस्तावित करते हैं। सटीक कॉन्फिडेंस नंबर देने के बजाय, API केवल रैंकिंग देता है।

  • उपमा: AI बस कहता है, "पहला स्थान: 'cat', दूसरा स्थान: 'dog', तीसरा स्थान: 'helicopter'।" यह यह नहीं बताता कि 'cat' 'dog' की तुलना में कितना अधिक संभावित है।
  • खोज: लेखकों ने पाया कि प्रत्येक AI मॉडल के पास "संभावित रैंकिंग" का एक अनूठा सेट होता है जिसे वह उत्पन्न कर सकता है। क्योंकि AI का मस्तिष्क (विशेष रूप से एक "बॉटलनेक" जो यह सीमित करता है कि वह एक साथ कितने विचार रख सकता है) इस तरह से बना है, यह केवल सभी संभावित शब्द क्रमों के एक बहुत ही विशिष्ट उपसमुच्चय (subset) को ही उत्पन्न कर सकता है।
  • परिणाम: यदि आप शब्दों के क्रमों की एक विशिष्ट सूची देखते हैं, तो इसकी अत्यधिक संभावना है कि यह उसी विशिष्ट मॉडल से आई है और किसी अन्य से नहीं। यह पहेली के टुकड़ों की एक विशिष्ट व्यवस्था को देखने जैसा है; केवल एक विशिष्ट पहेली बॉक्स ही उस सटीक आकार को उत्पन्न कर सकता था।

3. यह "अनकली (Unforgeable)" क्यों है? (कठोर लॉक)

शोध पत्र यह सिद्ध करता है कि आप इस सिग्नेचर की नकल नहीं कर सकते।

  • उपमा: कल्पना कीजिए कि आप शून्य से एक नई मशीन बनाने की कोशिश कर रहे हैं जो मूल शेफ के समान ही शब्दों की रैंकिंग की सूची तैयार करती है।
  • गणित: लेखक दिखाते हैं कि ऐसा करना एक गणितीय दुःस्वप्न है। यह समस्याओं के एक ऐसे वर्ग से संबंधित है जो इतनी कठिन है कि सबसे शक्तिशाली कंप्यूटर भी उन्हें हल करने के लिए संघर्ष करेंगे। यह केवल "कठिन" नहीं है; यह सैद्धांतिक रूप से कुशलतापूर्वक करना असंभव है। यदि किसी हैकर ने मॉडल का मस्तिष्क भी चुरा लिया, तो भी वे आसानी से एक अलग मस्तिष्क नहीं बना पाएंगे जो इस विशिष्ट रैंकिंग सिग्नेचर की नकल कर सके।

4. कमी: "रफ स्केच" हमला

हालाँकि, लेखकों ने एक सुरक्षा जोखिम भी पाया है। यदि कोई API रैंकिंग की पूरी सूची (जैसे, क्रम में शीर्ष 50,000 शब्द) दे देता है, तो एक हैकर उस सूची का उपयोग AI के मस्तिष्क का एक "रफ स्केच" बनाने के लिए कर सकता है।

  • उपमा: यह चेहरे की धुंधली फोटो देखने जैसा है। आप व्यक्ति को पूरी तरह से पहचान नहीं सकते, लेकिन आप बता सकते हैं कि उसकी नाक, आँखें और मुँह है। आप उस स्केच के साथ सिग्नेचर की नकल नहीं कर सकते, लेकिन आप मॉडल की कुछ "विशेषताएं" चुरा सकते हैं।
  • समाधान: लेखकों ने एक "स्वीट स्पॉट" (सही संतुलन) खोजा है। यदि API केवल शीर्ष कुछ शब्दों (जैसे, शीर्ष 500) को दिखाता है, तो सिग्नेचर अद्वितीय और अनकलनीय रहता है, लेकिन जानकारी हैकर के लिए मॉडल का मस्तिष्क चुराने के लिए बहुत धुंधली होती है।

सारांश

  • पुराना तरीका: सटीक संभावना दिखाएं \rightarrow हैकर मस्तिष्क चुरा लेता है \rightarrow हैकर सिग्नेचर की नकल करता है।
  • नया तरीका: केवल शब्द रैंकिंग दिखाएं \rightarrow सिग्नेचर अद्वितीय है और गणितीय रूप से नकल करना असंभव है।
  • सुरक्षा टिप: सभी रैंकिंग न दिखाएं। केवल शीर्ष kk (एक छोटी संख्या) दिखाएं। यह सिग्नेचर को जालसाजों से सुरक्षित रखता है और मस्तिष्क को चोरों से सुरक्षित रखता है।

यह विधि AI कंपनियों को यह साबित करने का एक तरीका देती है कि, "हाँ, यह आउटपुट वास्तव में हमारे मॉडल से आया है," बिना अनजाने में उनके गुप्त नुस्खे (secret sauce) की चाबियाँ सौंपे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →