← नवीनतम पेपर
💻 computer science

World2Rules: A Neuro-Symbolic Framework for Learning World-Governing Safety Rules for Aviation

World2Rules एक न्यूरो-सिम्बोलिक फ्रेमवर्क है जो उम्मीदवार पीढ़ी (candidate generation) के लिए न्यूरल मॉडल्स को इंडक्टिव लॉजिक प्रोग्रामिंग और पदानुक्रमित परावर्तक तर्क (hierarchical reflective reasoning) के साथ जोड़कर, शोर वाले मल्टीमॉडल विमानन डेटा से व्याख्या योग्य, सत्यापन योग्य सुरक्षा नियम सीखता है, जो सटीकता में शुद्ध रूप से न्यूरल और बेसलाइन न्यूरो-सिम्बोलिक दृष्टिकोणों से बेहतर प्रदर्शन करता है।

मूल लेखक: Haichuan Wang, Jay Patrikar, Sebastian Scherer

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haichuan Wang, Jay Patrikar, Sebastian Scherer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सुरक्षित रूप से विमान उड़ाना सिखाने की कोशिश कर रहे हैं। आपके पास जानकारी के दो विशाल ढेर हैं:

  1. "सामान्य दिन" का ढेर: हजारों वीडियो और लॉग्स जो दिखाते हैं कि बिना किसी समस्या के विमान कैसे लैंड कर रहे हैं, उड़ान भर रहे हैं और टैक्सी कर रहे हैं।
  2. "ओप्स" (गलती) का ढेर: दुर्घटना रिपोर्टों और लगभग होने वाली घटनाओं की एक छोटी, बिखरी हुई स्टैक जहाँ चीजें गलत हो गईं।

लक्ष्य यह है कि रोबोट को आसमान के "अलिखित नियमों" को सिखाया जाए ताकि वह कभी दुर्घटनाग्रस्त न हो। "World2Rules" पेपर वास्तव में इसी के बारे में है।

यहाँ बताया गया है कि उन्होंने इसे रोजमर्रा के उदाहरणों का उपयोग करके कैसे किया।

समस्या: "बुद्धिमान लेकिन अनाड़ी" छात्र

शोधकर्ताओं ने रोबोट को सिखाने के दो मुख्य तरीके आजमाए, और दोनों में कमियां थीं:

  • "सुपर-रीडर" (न्यूरल मॉडल/LLMs): कल्पना कीजिए कि एक छात्र है जिसने लाइब्रेरी की हर किताब पढ़ ली है। वे "ओप्स" ढेर में पैटर्न पहचानने में माहिर हैं। यदि आप उन्हें दुर्घटना की रिपोर्ट दिखाते हैं, तो वे अनुमान लगा सकते हैं, "ओह, विमान दूसरे वाले के बहुत करीब था!"
    • कमी: यह छात्र थोड़ा ख्याली पुलाव पकाने वाला है। कभी-कभी वे चीजें बना लेते हैं (hallucinations), रिपोर्टों में खराब लिखावट से भ्रमित हो जाते हैं, या ऐसे नियम बना लेते हैं जो सुनने में स्मार्ट लगते हैं लेकिन वास्तव में खतरनाक होते हैं। वे यह साबित नहीं कर सकते कि वे क्यों सही हैं, वे बस उसे "महसूस" करते हैं।
  • "सख्त वकील" (सिंबोलिक लॉजिक/ILP): कल्पना कीजिए कि एक वकील है जो केवल उन तथ्यों को स्वीकार करता है जो 100% प्रमाणित और पत्थर की लकीर हैं। वे यह जांचने में माहिर हैं कि क्या कोई नियम तार्किक रूप से सही है।
    • कमी: यह वकील खराब लिखावट पढ़ने में बहुत बुरा है। यदि आप उन्हें एक धुंधली दुर्घटना रिपोर्ट देते हैं जिसमें गलतियाँ (typos) हैं, तो वे अटक जाते हैं और कुछ भी सीखने से इनकार कर देते हैं क्योंकि डेटा पर्याप्त "साफ" नहीं है।

समाधान: "World2Rules" टीम

लेखकों ने सुपर-रीडर और सख्त वकील के बीच एक टीम-अप बनाया। वे इसे एक "न्यूरो-सिंबोलिक" फ्रेमवर्क कहते हैं।

इसे एक जासूसी एजेंसी की तरह समझें:

  1. जासूस (न्यूरल मॉडल): जासूस बिखरी हुई दुनिया (दुर्घटना रिपोर्ट और वीडियो फीड) में जाता है। वे सुराग इकट्ठा करते हैं, इस बात का सिद्धांत बनाते कि क्या हुआ था, और एक नियम प्रस्तावित करते हैं: "मुझे लगता है कि नियम यह है: यदि विमान A लैंड कर रहा है और विमान B रनवे पर है, तो वह एक दुर्घटना है!"
  2. जज (लॉजिक सॉल्वर): जज जासूस के सिद्धांत को लेता है और उस पर मुकदमा चलाता है। वे इसे "सामान्य दिन" के ढेर और "ओप्स" के ढेर के विरुद्ध परखते हैं।
    • क्या यह नियम एक सुरक्षित उड़ान को तोड़ता है? यदि हाँ, तो जज उसे खारिज कर देता है।
    • क्या इस नियम को पर्याप्त सबूतों का समर्थन प्राप्त है? यदि जासूस ने केवल एक अजीब दुर्घटना के आधार पर अनुमान लगाया है, तो जज कहता है, "पर्याप्त सबूत नहीं हैं।"

गुप्त मंत्र: "रिफ्लेक्टिव रीजनिंग" (चिंतनशील तर्क)

World2Rules का जादू यह है कि वे इसे केवल एक बार नहीं करते हैं। वे इसे चार स्तरों की जाँच में करते हैं, जो एक उच्च-सुरक्षा हवाई अड्डा स्क्रीनिंग प्रक्रिया की तरह है:

  1. स्तर 1 (ID चेक): जज द्वारा सिद्धांत को देखने से पहले, वे जासूस के नोट्स की जांच करते हैं। क्या लिखावट पठनीय है? क्या जासूस ने एक ऐसा विमान बना लिया है जो अस्तित्व में ही नहीं है? यदि नोट्स बेकार हैं, तो उन्हें तुरंत फेंक दिया जाता है।
  2. स्तर 2 (छोटा समूह ट्रायल): वे नियम का परीक्षण केवल एक दुर्घटना और एक सामान्य दिन पर करते हैं। क्या यह नियम इस विशिष्ट जोड़ी के लिए कायम रहता है? यदि नियम यहाँ विफल हो जाता है, तो इसे त्याग दिया जाता है।
  3. स्तर 3 (जूरी का विचार-विमर्श): यह सबसे महत्वपूर्ण हिस्सा है। वे उन सभी नियमों को लेते हैं जो छोटे परीक्षणों में पास हुए थे और उन्हें संयोजित करने की कोशिश करते हैं। कल्पना कीजिए कि एक जूरी एक एकल निर्णय पर सहमत होने की कोशिश कर रही है। यदि एक नया नियम जोड़ने से पूरा समूह असहमत (असंगत) हो जाता है, तो उस नियम को बाहर निकाल दिया जाता है। वे केवल उन्हीं नियमों को रखते हैं जो सभी के लिए पूरी तरह से काम करते हैं।
  4. स्तर 4 (अंतिम पॉलिश): अंत में, वे जीवित बचे नियमों को देखते हैं। यदि कोई नियम केवल एक बहुत ही विशिष्ट, अजीब दुर्घटना पर लागू होता है (जैसे "विमान केवल मंगलवार को दुर्घटनाग्रस्त होते हैं"), तो वे उसे हटा देते हैं। वे केवल उन नियमों को रखते हैं जो अक्सर होते हैं और बहुत मायने रखते हैं।

यह क्यों मायने रखता है

वास्तविक दुनिया में, सुरक्षा नियम अव्यवस्थित होते हैं। दुर्घटना रिपोर्ट थक चुके मनुष्यों द्वारा गलतियों के साथ लिखी जाती हैं। सामान्य उड़ान डेटा उबाऊ और विशाल होता है।

  • इस सिस्टम के बिना: एक रोबोट "आसमान नीला है जब विमान दुर्घटनाग्रस्त होते हैं" जैसा नियम सीख सकता है क्योंकि उसने एक नीले दिन पर एक दुर्घटना देखी थी। यह खतरनाक है।
  • World2Rules के साथ: यह सिस्टम शोर (noise) को छान देता है। यह सीखता है कि "विमान तब दुर्घटनाग्रस्त होते हैं जब दो विमान एक ही रनवे का उपयोग करने की कोशिश करते हैं।"

परिणाम

जब उन्होंने वास्तविक विमानन डेटा पर इसका परीक्षण किया:

  • अकेले "सुपर-रीडर" ने लगभग 70% सुरक्षा नियमों को सही पाया।
  • अकेले "सख्त वकील" (जासूस की मदद के बिना) ने लगभग 50% सही पाया क्योंकि डेटा बहुत बिखरा हुआ था।
  • World2Rules (द टीम) ने 94% सही पाया!

निष्कर्ष

यह पेपर दिखाता है कि महत्वपूर्ण नौकरियों (जैसे विमान उड़ाना, कार चलाना, या अस्पताल चलाना) के लिए सुरक्षित AI बनाने के लिए, आप केवल "अंतर्ज्ञान" (gut feeling) वाले AI पर भरोसा नहीं कर सकते। आपको एक ऐसे सिस्टम की आवश्यकता है जहाँ AI विचार प्रस्तावित करता है, लेकिन एक तार्किक "सुरक्षा जाल" वास्तविकता के नियमों के विरुद्ध उनमें से प्रत्येक की जाँच करता है।

यह एक प्रतिभाशाली लेकिन अराजक आविष्कारक के साथ एक सूक्ष्म सुरक्षा निरीक्षक के काम करने जैसा है। आविष्कारक विचार लाता है, और निरीक्षक यह सुनिश्चित करता है कि वे वास्तव में काम करें और फैक्ट्री को उड़ा न दें। परिणाम सुरक्षा नियमों का एक सेट है जो न केवल स्मार्ट है बल्कि सिद्ध, स्पष्ट और विश्वसनीय भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →