← नवीनतम पेपर
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

यह शोध पत्र PhoneSafety प्रस्तुत करता है, जो 700 वास्तविक दुनिया के सुरक्षा-महत्वपूर्ण क्षणों का एक बेंचमार्क है जो फोन-उपयोग एजेंटों में वास्तविक सुरक्षा और मात्र अक्षमता के बीच अंतर करता है, यह प्रकट करते हुए कि मजबूत सामान्य क्षमताएं सुरक्षित निर्णय लेने की गारंटी नहीं देती हैं और हानिरहित परिणाम अक्सर वास्तविक सुरक्षा के बजाय कार्य करने में असमर्थता को छिपाते हैं।

मूल लेखक: Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng
प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने स्मार्टफोन को मैनेज करने के लिए एक पर्सनल असिस्टेंट रखा है। आप उसे एक गाना डाउनलोड करने के लिए कहते हैं। अचानक, स्क्रीन पर एक "VIP सब्सक्रिप्शन" पेज पॉप अप होता है जो आपके क्रेडिट कार्ड की मांग करता है।

यह पेपर एक सरल लेकिन पेचीदा सवाल पूछता है: यदि असिस्टेंट आपके क्रेडिट कार्ड को स्वाइप नहीं करता है, तो क्या इसका मतलब यह है कि वह सुरक्षित और समझदार है, या इसका मतलब यह है कि वह स्वाइप करने का तरीका समझने में बहुत भ्रमित है?

यहाँ इस पेपर के निष्कर्षों का सरल विवरण दिया गया:

बड़ी समस्या: "कुछ न करना" "सुरक्षित होने" जैसा दिखता है

लेखकों ने पाया कि फोन इस्तेमाल करने वाले AI के लिए वर्तमान परीक्षण दोषपूर्ण हैं क्योंकि वे केवल परिणाम को देखते हैं।

  • परिदृश्य A (स्मार्ट सुरक्षित विकल्प): असिस्टेंट पेमेंट स्क्रीन देखता है, जोखिम को समझता है, और कहता है, "हे, क्या आप इसके लिए भुगतान करना चाहते हैं?" उसने खतरे को समझा और सुरक्षा को चुना।
  • परिदृश्य B (भ्रमित विकल्प): असिस्टेंट पेमेंट स्क्रीन देखता है, लेआउट से भ्रमित हो जाता है, गलत बटन दबा देता है, या बस स्क्रीन को देखता रहता है और कुछ नहीं करता। कोई पैसा नहीं खोया गया, लेकिन केवल इसलिए क्योंकि वे कार्य करने में विफल रहे, न कि इसलिए कि वे सावधान थे।

वर्तमान परीक्षण अक्सर इन दोनों परिदृश्यों को "सफलता" के रूप में गिनते हैं क्योंकि कोई नुकसान नहीं हुआ। पेपर का तर्क है कि यह एक गलती है। यह एक ऐसे ड्राइवर की तरह है जो कानून जानता है इसलिए रेड लाइट पर रुकता है (सुरक्षित) बनाम एक ड्राइवर जो बीच चौराहे पर जम गया क्योंकि वह भूल गया कि गाड़ी कैसे चलाते हैं (अक्षम)। दोनों कार रोकते हैं, लेकिन केवल एक ही अच्छा ड्राइवर है।

नया टेस्ट: PHONESAFETY

इसे ठीक करने के लिए, शोधकर्ताओं ने PHONESAFETY नामक एक नया टेस्ट बनाया। एक लंबे कार्य को पूरा देखने के बजाय, वे AI को ठीक उस क्षण पर रोक देते हैं जब एक जोखिम भरा निर्णय लिया जाना होता है (जैसे पेमेंट स्क्रीन)। फिर वे पूछते हैं: AI ने आगे क्या किया?

वे उत्तरों को तीन श्रेणियों (Buckets) में बांटते हैं:

  1. सुरक्षित क्रिया (Safe Action): AI ने जोखिम को समझा और सुरक्षित रास्ता चुना (जैसे, अनुमति मांगना)।
  2. असुरक्षित क्रिया (Unsafe Action): AI ने स्क्रीन को समझा लेकिन खतरनाक रास्ता चुना (जैसे, बिना पूछे "Pay Now" पर टैप करना)।
  3. निरर्थक क्रिया (Useless Action): AI ने स्क्रीन को देखा और कुछ अप्रासंगिक किया, जैसे बैकग्राउंड पर टैप करना, स्क्रॉल करना जब उसे नहीं करना चाहिए था, या निर्णय लेने की प्रक्रिया में बिल्कुल भी शामिल न होना।

उन्होंने क्या पाया

शोधकर्ताओं ने 8 अलग-अलग AI मॉडल्स का परीक्षण किया और दो आश्चर्यजनक बातें पाईं:

1. "फोन चलाने में अच्छा होना" का मतलब "सुरक्षित होना" नहीं है
आप सोच सकते हैं कि जो AI ऐप्स चलाने और बटन खोजने में सबसे अच्छा है, वह खतरे से बचने में भी सबसे अच्छा होगा। पेपर कहता है नहीं

  • कुछ मॉडल्स सामान्य कार्यों में बेहतरीन थे लेकिन सुरक्षा में बहुत खराब थे (उन्होंने स्क्रीन को समझा लेकिन गलत बटन चुना)।
  • कुछ मॉडल्स सामान्य कार्यों में "ठीक" थे लेकिन बहुत सुरक्षित थे (उन्हें पता था कि कब रुकना है)।
  • उपमा: एक बेहतरीन शेफ होने का मतलब यह नहीं है कि आप चाकू को सुरक्षित रूप से संभालना जानते हैं। आप खाना बनाने में बहुत कुशल हो सकते हैं लेकिन सुरक्षा नियमों पर ध्यान न देने के कारण खुद को काट सकते हैं।

2. "कुछ न करना" एक क्षमता (Capability) की समस्या है, सुरक्षा की नहीं
जब कोई AI किसी उपयोगी कार्य को करने में विफल रहता है (बकेट #3), तो यह आमतौर पर इसलिए होता है क्योंकि स्क्रीन बहुत जटिल थी या कार्य उसके लिए बहुत कठिन था।

  • ये "विफलताएं" ज्यादातर जटिल स्क्रीन्स पर होती हैं।
  • ये सुरक्षा नियम कितने भी सख्त क्यों न हों, समान दर से होती हैं।
  • उपमा: यदि एक रोबोट लॉक किए गए दरवाजे को खोलने की कोशिश करता है और बस हाथ हिलाकर खड़ा रहता है, तो वह अंदर घुसने से मना करके "सुरक्षित" नहीं हो रहा है; वह बस दरवाजा खोलने का तरीका जानने में अक्षम है।

मुख्य निष्कर्ष (The Takeaway)

पेपर निष्कर्ष निकालता है कि हम केवल यह देखकर कि किसी AI ने नुकसान पहुँचाया या नहीं, यह तय नहीं कर सकते कि वह सुरक्षित है।

  • यदि कोई AI नुकसान नहीं पहुँचाता है, तो हमें जांचना होगा कि क्यों
  • क्या उसने सुरक्षा इसलिए चुनी क्योंकि वह स्मार्ट था? (अच्छा!)
  • या उसने नुकसान इसलिए नहीं पहुँचाया क्योंकि वह कार्य करने के लिए बहुत भ्रमित था? (बुरा! जैसे ही वह फोन चलाने में अधिक स्मार्ट होगा, वह नुकसान पहुँचाएगा।)

फोन एजेंटों का मूल्यांकन करने के लिए, हमें खराब निर्णय लेने (गलत चीज़ चुनना) और कार्य करने में अक्षमता (यह न जानना कि क्या करना है) के बीच अंतर करना चाहिए। एक हानिरहित परिणाम पर्याप्त प्रमाण नहीं है कि एजेंट सुरक्षित है, यदि वह केवल इतना अनाड़ी था कि कुछ भी करने में सक्षम नहीं था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →