← नवीनतम पेपर
💻 computer science

SPHINX: First Explain, Then Explore

SPHINX एक क्लोज्ड-लूप फ्रेमवर्क है जो प्रतिकूल ड्राइविंग परिदृश्यों को उत्पन्न करने के लिए, पहले नीति विफलताओं (policy failures) का निदान करने हेतु व्याख्यात्मक एआई (explainable AI) का उपयोग करता है और फिर उन विशिष्ट कमजोरियों के आधार पर लक्षित परिदृश्यों का पता लगाने और उन्हें संश्लेषित करने के लिए एक विजन-लैंग्वेज मॉडल का लाभ उठाता है, जिससे स्वायत्त वाहनों की मजबूती में सुधार होता है।

मूल लेखक: Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार को सुरक्षित रूप से गाड़ी चलाना सिखा रहे हैं। आप इसे एक वीडियो गेम सिमुलेशन में टेस्ट करना चाहते हैं ताकि देख सकें कि क्या यह कठिन स्थितियों को संभाल सकती है, जैसे कि अचानक सड़क पर कोई पैदल यात्री आ जाए या कोई कार आपके सामने अचानक आ जाए।

वर्तमान परीक्षण विधियों के साथ समस्या यह है कि वे एक ऐसे शिक्षक की तरह हैं जो सिर्फ यह कहता है, "तुम इस परीक्षा में फेल हो गए," बिना यह बताए कि क्यों। वे हजारों रैंडम कठिन परिदृश्य (scenarios) बना सकते हैं, इस उम्मीद में कि वे एक ऐसा मामला ढूंढ लेंगे जहाँ कार दुर्घटनाग्रस्त हो जाए। यदि कार दुर्घटनाग्रस्त होती है, तो उन्हें पता चल जाता है कि वह विफल रही, लेकिन उन्हें यह नहीं पता चलता कि वह इसलिए विफल हुई क्योंकि उसने कार को देखा नहीं, या क्योंकि वह घबरा गई, या क्योंकि उसने आखिरी सेकंड में गलत निर्णय लिया। यह एक टूटी हुई मशीन को ठीक करने की कोशिश करने जैसा है जहाँ आप काम करने तक रैंडम पुर्जे फेंकते रहते हैं, बजाय इसके कि ब्लूप्रिंट को देखकर यह देखें कि कौन सा गियर अटका हुआ है।

SPHINX से मिलिए।

इस पेपर के लेखक SPHINX नामक एक नई प्रणाली प्रस्तावित करते हैं। इसका आदर्श वाक्य सरल है: "पहले समझाओ, फिर खोजो (First Explain, Then Explore)।"

SPHINX को एक अत्यधिक कुशल ड्राइविंग इंस्ट्रक्टर की तरह समझें जो केवल कार के दुर्घटनाग्रस्त होने का इंतज़ार नहीं करता; बल्कि वह कार के "दिमाग" के अंदर जाकर देखता है कि जब चीजें गलत हुईं तो वह वास्तव में क्या सोच रही थी।

SPHINX यहाँ कैसे काम करता है, चरण-दर-चरण:

1. "एक्सप्लेन" चरण (जासूसी का काम)

सिर्फ दुर्घटना का इंतज़ार करने के बजाय, SPHINX कार को चलते हुए देखता है और हर पल के निर्णय के बारे में तीन विशिष्ट प्रश्न पूछता है:

  • यह कहाँ देख रहा है? (विजुअल ग्राउंडिंग): क्या कार अपने सामने वाली कार की लाल ब्रेक लाइटों पर ध्यान दे रही है, या वह किसी बिलबोर्ड से विचलित है?
  • क्या यह आत्मविश्वासी है? (अनिश्चितता): क्या कार हिचकिचा रही है? क्या वह घबराहट में कह रही है, "क्या मुझे बाईं ओर मुड़ना चाहिए? या दाईं ओर? या सीधा रहना चाहिए?"
  • क्या यह स्थिर है? (स्थिरता): क्या कार स्टीयरिंग व्हील को झटके से इधर-उधर घुमा रही है, या वह सुचारू और शांत हलचल कर रही है?

यदि कार कोई गलती करती है, तो SPHINX केवल "क्रैश!" नहीं कहता। यह एक विस्तृत रिपोर्ट बनाता है: "कार ने बाधा को देखा लेकिन ब्रेक लगाने के लिए बहुत अनिश्चित थी, और फिर इसने बहुत देर से पहिया झटका दिया।"

2. "क्रिटिक" चरण (कोच)

SPHINX एक स्मार्ट AI "क्रिटिक" (एक सख्त लेकिन निष्पक्ष कोच की तरह) का उपयोग करता है जो उस विस्तृत रिपोर्ट को पढ़ता है। क्रिटिक तकनीकी डेटा को सरल अंग्रेजी (साधारण भाषा) में अनुवादित करता है।

  • उदाहरण आलोचना: "यह कार सामने से आने वाले ट्रैफिक के प्रति प्रतिक्रिया देने में बहुत धीमी है। यह मुड़ने के लिए आखिरी सेकंड तक इंतज़ार करती है, जो खतरनाक है।"

3. "एक्सप्लोर" चरण (कस्टम ट्रेनिंग)

यही असली जादू है। रैंडम नए परिदृश्य बनाने के बजाय, SPHINX क्रिटिक के नोट्स का उपयोग करके कस्टम-मेड ट्रेनिंग ड्रिल बनाता है।

  • यदि कार सामने से आने वाले ट्रैफिक पर प्रतिक्रिया देने में खराब थी, तो SPH_Hinx एक विशिष्ट सिमुलेशन बनाता है जहाँ एक कार गलत दिशा से आती है, जिससे ड्राइवर को जल्दी पहचान और निर्णायक स्टीयरिंग का अभ्यास करने के लिए मजबूर किया जाता है।
  • यह एक बास्केटबॉल खिलाड़ी को फ्री थ्रो मिस करने के कारण होने वाली स्थिति जैसा है क्योंकि वह अपने घुटने नहीं मोड़ रहा है, इसलिए कोच उसे केवल 1,000 रैंडम शॉट मारने के बजाय विशेष रूप से घुटने मोड़ने का अभ्यास करने के लिए एक ड्रिल डिजाइन करता है।

4. लूप (अभ्यास)

कार सिमुलेशन में इन कस्टम ड्रिल्स का अभ्यास करती है। वह अपनी उस विशिष्ट कमजोरी को ठीक करना सीखती है। फिर, SPHINX इसे फिर से टेस्ट करता है, अगली छोटी कमजोरी ढूंढता है, उसे समझाता है, और एक नया ड्रिल बनाता है। यह एक लूप में चलता रहता है जब तक कि कार बहुत अधिक मजबूत और स्मार्ट न हो जाए।

यह बेहतर क्यों है?
पेपर में SPHINX का परीक्षण अन्य तरीकों (जैसे "ChatScene" और "LLM-Attacker") के मुकाबले अलग-अलग प्रकार के सेल्फ-ड्राइविंग कार ब्रेन्स के साथ किया गया।

  • पुराना तरीका: सामान्य ज्ञान के आधार पर कई परिदृश्य उत्पन्न किए। कार थोड़ा सुधरी, लेकिन अक्सर उसने उन विशिष्ट ट्रिक्स को बस याद कर लिया जो उसने देखी थीं, बजाय इसके कि वह अंतर्निहित कौशल सीख सके।
  • SPHINX का तरीका: क्योंकि इसने ठीक उसी कारण को लक्षित किया जिसके कारण कार विफल हुई थी, कार बहुत तेज़ी से सीखी। परीक्षणों में, SPHINX के साथ प्रशिक्षित कारों ने लगभग 100% कठिन परिदृश्यों में सफलता प्राप्त की, जबकि अन्य संघर्ष करती रहीं।

संक्षेप में: SPHINX यह अनुमान लगाना बंद करता है कि कार को क्या सीखने की आवश्यकता है। यह कार की अपनी "विचार प्रक्रिया" को सुनता है, यह पता लगाता है कि वह वास्तव में कहाँ कमजोर है, और फिर उस विशिष्ट कमजोरी को ठीक करने के लिए एक कस्टम ट्रेनिंग कोर्स बनाता है। यह एक अंधेरे ट्रायल-एंड-एरर (परीक्षण और त्रुटि) की प्रक्रिया को एक स्मार्ट, लक्षित कोचिंग सत्र में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →