← नवीनतम पेपर
🤖 AI

Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures

यह शोधपत्र टेम्पोरल लॉजिट ऑब्जर्वेबिलिटी (TLO) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त नैदानिक (training-free diagnostic) है जो LLM जेलब्रेक के विभिन्न विफलता मोडों के बीच अंतर करने के लिए डिकोडिंग के दौरान टेम्पोरल लॉजिट पैटर्न का विश्लेषण करता है—जो पारंपरिक अटैक सक्सेस रेट मेट्रिक्स की तुलना में अधिक गहरी सुरक्षा अंतर्दृष्टि प्रदान करता है और बिना किसी गलत अलार्म के प्रभावी अर्ली स्टॉपिंग को सक्षम बनाता है।

मूल लेखक: Junyoung Park, Sunghwan Park, Seongyong Ju, Jaewoo Lee

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyoung Park, Sunghwan Park, Seongyong Ju, Jaewoo Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट, विनम्र रोबोट फैक्ट्री में एक सुरक्षा गार्ड हैं। आपका काम यह रोकना है कि रोबोट कोई भी खतरनाक बात न कहें जब कोई उनसे कोई पेचीदा सवाल पूछे।

लंबे समय तक, यह जांचने का एकमात्र तरीका कि आपका सुरक्षा तंत्र काम कर रहा था या नहीं, यह देखना था कि रोबोट ने अंतिम उत्तर क्या दिया। यदि रोबोट ने कहा "नहीं, मैं यह नहीं कर सकता," तो आपने इसे एक सफलता के रूप में चिह्नित किया। यदि उसने कहा "ज़रूर, यहाँ बताया गया है कैसे," तो आपने इसे एक विफलता के रूप में चिह्नित किया। यह क्या है जिसे शोधकर्ता अटैक सक्सेस रेट (ASR) कहते हैं।

समस्या: "हाँ/नहीं" का अंधा धब्बा (The "Yes/No" Blind Spot)
यह पेपर तर्क देता है कि यह "हाँ/नहीं" वाली जाँच केवल फिल्म के अंतिम दृश्य को देखकर निर्णय लेने जैसा है।

  • परिदृश्य A: रोबोट "नहीं" कहने की शुरुआत करता है, भ्रमित हो जाता है, और फिर "हाँ" कह देता है।
  • परिदृश्य B: रोबोट "नहीं" कहने के बारे में सोचता तक नहीं है और सीधे "हाँ" पर कूद जाता है।

दोनों परिदृश्यों में अंततः रोबोट "हाँ" कहता है। पुराने सिस्टम के तहत, दोनों को केवल "विफलता" (Failure) माना जाता है। लेकिन वे बिल्कुल अलग कारणों से विफल हुए थे। पुराना सिस्टम अंतर नहीं कर सकता, इसलिए आपको रोबोट को कैसे ठीक करना है, इसका पता नहीं चलता।

समाधान: "विचार प्रक्रिया" को देखना (TLO)
लेखक एक नया टूल पेश करते हैं जिसे टेम्पोरल लॉजिट ऑब्जर्वेबिलिटी (TLO) कहा जाता है।

रोबोट की "विचार प्रक्रिया" को एक रस्साकशी (tug-of-war) के रूप में सोचें। एक छोर पर अस्वीकृति टीम (Refusal Team) (कहना "नहीं") है, और दूसरे छोर पर अनुपालन टीम (Compliance Team) (कहना "हाँ") है।

  • हर बार जब रोबोट एक शब्द चुनता है, तो वह रस्सी को थोड़ा एक तरफ या दूसरी तरफ खींचता है।
  • पुराना सिस्टम केवल यह देखता था कि रस्सी अंत में कहाँ रुकी।
  • TLO उस समय रस्सी की गति को देखता है जब रोबोट बोल रहा होता है।

TLO कैसे काम करता है (एक "2D मैप")
केवल एक स्कोर के बजाय, TLO रोबोट के प्रदर्शन को एक 2D मैप पर दर्शाता है जिसमें दो अक्ष (axes) हैं:

  1. "पहले" वाला अक्ष (The "Before" Axis): क्या रोबोट को बोलने शुरू करने से पहले ही "नहीं" टीम का खिंचाव महसूस हुआ था?
  2. "दौरान" वाला अक्ष (The "During" Axis): क्या रोबोट के बात करते समय "नहीं" टीम को रस्सी खींचने का मौका मिला?

इस मैप को देखकर, शोधकर्ताओं ने कुछ आश्चर्यजनक पाया:

  • दो रोबोट जिनका विफलता दर (failure rate) बिल्कुल समान था (उदाहरण के लिए, दोनों 50% बार विफल हुए), वे वास्तव में पूरी तरह से अलग तरीकों से विफल हो रहे थे। एक शायद शुरुआत में ही भ्रमित हो गया था, जबकि दूसरा मज़बूती से शुरू हुआ लेकिन बीच में हार मान गया।
  • यह मैप एक एक्स-रे की तरह काम करता है, जो दिखाता है कि रोबोट ने गलत उत्तर तक पहुँचने के लिए कौन सा छिपा हुआ रास्ता अपनाया।

"अर्ली स्टॉप" (Early Stop) का तरीका
क्योंकि TLO देख सकता है कि बातचीत के शुरुआती दौर में ही "नहीं" टीम रस्सी खींचने की कोशिश कर रही है, शोधकर्ताओं ने एक सरल सुरक्षा नियम बनाया:

  • नियम: "यदि रोबमा 'नहीं' वाली रस्सी को खींचना शुरू करता है लेकिन फिर अचानक रुक जाता है और पहले कुछ शब्दों के भीतर 'हाँ' में बदल जाता है, तो तुरंत पावर काट दें।"
  • परिणाम: इस सरल नियम ने आधे से अधिक सफल हमलों को रोक दिया।
  • बोनस: इसने गलती से सामान्य, सुरक्षित सवालों के जवाब देने से रोबोट को नहीं रोका। यह एक मोशन डिटेक्टर की तरह था जो केवल तभी ट्रिप होता है जब कोई चुपके से घूम रहा हो, न कि तब जब कोई बस दरवाज़े से अंदर आ रहा हो।

यह पेपर वास्तव में क्या कहता है (और क्या नहीं कहता)

  • यह कहता है: हम यह देख सकते हैं कि सुरक्षा विफलता कैसे होती है, केवल उन नंबरों (logits) को देखकर जिनका उपयोग रोबोट शब्द चुनने के लिए करता है, बिना रोबोट के दिमाग (hidden states) को खोले।
  • यह कहता है: अलग-अलग रोबोट अलग-अलग पैटर्न में विफल होते हैं, भले ही वे सतह पर एक जैसे दिखें।
  • यह दावा नहीं करता: कि यह AI सुरक्षा के सभी मुद्दों के लिए एक पूर्ण, स्थायी समाधान है।
  • यह नहीं कहता: कि यह हर प्रकार के रोबोट या भाषा पर काम करता है (इसने अंग्रेजी और विशिष्ट मॉडलों पर ध्यान केंद्रित किया)।
  • यह नहीं कहता: कि इसका उपयोग अभी चिकित्सा निदान या अन्य वास्तविक दुनिया की महत्वपूर्ण प्रणालियों के लिए किया जाना चाहिए। यह शोधकर्ताओं के लिए एक नैदानिक उपकरण (diagnostic tool) है ताकि वे समझ सकें कि विफलता क्यों हुई।

संक्षेप में
पेपर कहता है: "केवल अंतिम उत्तर की जाँच करना बंद करें। पूरी फिल्म देखें। वास्तविक समय में रोबोट की आंतरिक रस्साकशी को देखकर, हम विफलताओं को जल्दी पहचान सकते हैं, समझ सकते हैं कि वे क्यों हुईं, और रोबोट के वाक्य पूरा करने से पहले ही उन्हें रोक सकते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →