← नवीनतम पेपर
🤖 AI

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX

यह शोध पत्र ATBench-Claw और ATBench-CodeX को प्रस्तुत करता है, जो ATBench फ्रेमवर्क के दो डोमेन-विशिष्ट विस्तार हैं, जो OpenClaw और OpenAI Codex निष्पादन वातावरणों में प्रक्षेपवक्र-स्तर (trajectory-level) के सुरक्षा जोखिमों का मूल्यांकन और निदान करने के लिए एक अनुकूलित त्रि-आयामी सुरक्षा वर्गीकरण (taxonomy) का उपयोग करते हैं।

मूल लेखक: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्व-चालित कार (self-driving car) बना रहे हैं। आपके पास एक सुरक्षा नियमावली (बेंचमार्क) है जो कार को ट्रैफिक, पैदल यात्रियों और सड़क के संकेतों को संभालने का तरीका सिखाती है। लेकिन क्या होता है जब आप उसी कार को हाईवे से हटाकर एक निर्माण क्षेत्र (construction zone) में ले जाते हैं? या किसी नर्सिंग होम में? नियम बदल जाते हैं। खतरे बदल जाते हैं। एक "स्टॉप साइन" निर्माण क्षेत्र में हाईवे की तुलना में बिल्कुल अलग मतलब रख सकता है।

यह शोध पत्र दो बहुत ही विशिष्ट, नए "निर्माण क्षेत्रों" के लिए सुरक्षा नियमावली को अपडेट करने के बारे में है जहाँ AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) काम करना शुरू कर रहे हैं।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: पुराने मानचित्र नए क्षेत्रों के लिए उपयुक्त नहीं हैं

AI एजेंट स्मार्ट होते जा रहे हैं। वे अब केवल चैट नहीं कर रहे हैं; वे वास्तव में काम कर रहे हैं।

  • पुराना AI: "मौसम कैसा है?" -> उत्तर देता है।
  • नया AI: "मेरे लिए पिज्जा ऑर्डर करो, फिर मेरे डेस्कटॉप से वह फ़ाइल डिलीट कर दो, और रसीद मेरे बॉस को ईमेल कर दो।" -> यह काम करता है।

शोधकर्ताओं ने महसूस किया कि पुराने सुरक्षा परीक्षण (बेंचमार्क) इस बात की जाँच करने जैसे थे कि क्या एक कार रेड लाइट पर रुक सकती है। लेकिन अब, हमें यह जाँचने की आवश्यकता है कि क्या कार एक निर्माण स्थल (जहाँ वह गलती से क्रेन गिरा सकती है) या एक सर्जरी रूम (जहाँ वह गलत स्कैल्पल उठा सकती है) को संभाल सकती है।

2. समाधान: "यूनिवर्सल सेफ्टी किट" (ATBench)

टीम ने ATBench नामक एक लचीली सुरक्षा प्रणाली बनाई है। इसे एक Lego-आधारित सुरक्षा किट के रूप में सोचें।

  • हर नए काम के लिए एक नया सुरक्षा वाहन बनाने के बजाय, उन्होंने एक ऐसा चेसिस बनाया है जो एक जैसा रहता है।
  • एकमात्र चीज़ जिसे वे बदलते हैं, वह है इसके साथ जुड़ी निर्देश पुस्तिका ("Taxonomy")।
  • यह नियमावली बताती है: खतरा कहाँ से आता है? रोबोट कैसे विफल होता है? वास्तविक दुनिया में होने वाला नुकसान क्या है?

मा 3. दो नए "निर्माण क्षेत्र"

यह शोध पत्र इस किट के दो विशिष्ट संस्करणों को दो अलग-अलग प्रकार के AI कार्यों के लिए पेश करता है:

🛠️ ATBench-Claw: द "स्विस आर्मी नाइफ" एजेंट

  • सेटिंग: कल्पना कीजिए कि एक AI सहायक है जिसके पास एक विशाल टूलबॉक्स है। वह लोगों से बात कर सकता है, ईमेल भेज सकता है, फाइलें खोल सकता है और अन्य ऐप्स को नियंत्रित कर सकता है।
  • खतरा: यहाँ जोखिम एक अव्यवस्थित कार्यालय जैसा है। AI "बॉस को भेजें" को "स्पैम में भेजें" के साथ भ्रमित कर सकता है, या यह मान सकता है कि कोई फ़ाइल अस्थायी नोट है और उसे गलती से डिलीट कर सकता है।
  • समाधान: शोधकर्ताओं ने सुरक्षा नियमावली को पहचान भ्रम (कौन बात कर रहा है?), सेशन स्टेट (AI 10 मिनट पहले क्या कर रहा था?), और अनुमोदन श्रृंखला (क्या इंसान ने "हाँ" कहा था, इससे पहले कि AI ने "भेजें" पर क्लिक किया?) पर ध्यान केंद्रित करने के लिए अपडेट किया।

💻 ATBench-CodeX: द "कोड मंकी" एजेंट

  • सेटिंग: कल्पना कीजिए कि एक AI है जो कोड लिखता है, बग्स ठीक करता है और सॉफ्टवेयर प्रोजेक्ट्स को मैनेज करता है। वह कोड रिपॉजिटरी और सर्वर से भरी एक डिजिटल वर्कशॉप के भीतर रहता है।
  • खतरा: यहाँ जोखिम एक साजिश की गई फैक्ट्री जैसा है। AI एक वायरस इंस्टॉल कर सकता है जो एक मददगार टूल के रूप में छिपा हो, पूरी फैक्ट्री का फर्श (वर्कस्पेस) डिलीट कर सकता है, या गुप्त ब्लूप्रिंट (पासवर्ड) लीक कर सकता है।
  • समाधान: सुरक्षा नियमावली को कोड इंजेक्शन (बुरे कोड के साथ AI को धोखा देना), डिपेंडेंसी चेन (एक ऐसा टूल इंस्टॉल करना जो बाकी सब कुछ तोड़ दे), और विनाशकारी उत्परिवर्तन (destructive mutations) (गलती से पूरे प्रोजेक्ट को डिलीट कर देना) पर ध्यान केंद्रित करने के लिए बदला गया।

4. जादुई ट्रिक: "नियमों को कस्टमाइज़ करें, इंजन को वही रखें"

इस शोध पत्र का सबसे शानदार हिस्सा उनका दर्शन है।

  • पहले: यदि आप एक नए प्रकार के AI का परीक्षण करना चाहते थे, तो आपको एक नया टेस्टिंग लैब शुरू से बनाना पड़ता था।
  • अब: आप बस उस विशिष्ट कार्य के लिए नियम पुस्तिका को फिर से लिखते हैं, लेकिन आप उसी टेस्टिंग इंजन का उपयोग करते रहते हैं।

यह एक ड्राइविंग टेस्ट की तरह है।

  • एक टैक्सी ड्राइवर के लिए, नियम पुस्तिका कहती है: "पैदल यात्रियों और ट्रैफिक लाइटों से सावधान रहें।"
  • एक रेस कार ड्राइवर के लिए, नियम पुस्तिका कहती है: "टायर के घिसाव और एरोडायनामिक्स से सावधान रहें।"
  • कार (AI फ्रेमवर्क) और टेस्ट ट्रैक (डेटा जनरेटर) समान हैं। आप बस ड्राइवर के अनुकूल होने के लिए नियम बदलते हैं।

5. परिणाम: कौन टेस्ट में पास हुआ?

शोधकर्ताओं ने कई AI मॉडल्स का इन नए, कठिन सुरक्षा परीक्षणों पर परीक्षण किया।

  • "गार्ड" मॉडल्स: ये वे AI मॉडल्स हैं जिन्हें विशेष रूप से सुरक्षा पुलिस के रूप में प्रशिक्षित किया गया है। इन्होंने ठीक-ठाक प्रदर्शन किया, लेकिन नए, जटिल नियमों के साथ इन्हें थोड़ा संघर्ष करना पड़ा।
  • "जनरल" मॉडल्स: ये स्मार्ट, सामान्य-उद्देश्य वाले AI हैं। इन्होंने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, जिससे पता चलता है कि यदि आप उन्हें सही नियम सिखाते हैं, तो वे बहुत सुरक्षित हो सकते हैं।
  • विजेता: टीम का अपना सिस्टम, AgentDoG, जो एक स्मार्ट "गार्डरेल" दृष्टिकोण का उपयोग करता है, सबसे अधिक स्कोर करता है। यह दोनों "स्विस आर्मी नाइफ" और "कोड मंकी" परिदृश्यों में सूक्ष्म, खतरनाक गलतियों को पकड़ने में सबसे अच्छा था।

मुख्य निष्कर्ष

जैसे-जैसे AI अधिक खतरनाक और जटिल कार्य करने लगता है, हम केवल उन्हीं सुरक्षा परीक्षणों का उपयोग नहीं कर सकते जिनका उपयोग हमने चैटबॉट्स के लिए किया था। हमें अपने सुरक्षा नियमों को उस विशिष्ट वातावरण के अनुसार अनुकूलित (adapt) करने की आवश्यकता है जिसमें AI काम कर रहा है।

यह शोध पत्र साबित करता है कि हमें हर बार पहिए का पुनरुद्धार करने की आवश्यकता नहीं है। हमें बस एक लचीली नियम पुस्तिका की आवश्यकता है जिसे काम के अनुसार कस्टमाइज़ किया जा सके, ताकि यह सुनिश्चित हो सके कि हमारे AI एजेंट खाना पकाने के प्रयास में घर को अनजाने में जला न दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →