AeroGround: An Open, Citation-Grounded Aviation Dataset forTraining and Evaluating Trustworthy Domain Language Models
यह शोध पत्र AeroGround को प्रस्तुत करता है, जो अमेरिकी सार्वजनिक-डोमेन स्रोतों से प्राप्त एक खुला, उद्धरण-आधारित (citation-grounded) विमानन डेटासेट है, जो विश्वसनीय भाषा मॉडल के प्रशिक्षण और मूल्यांकन को सक्षम बनाता है जो आधिकारिक, उद्धृत उत्तर प्रदान करने या साक्ष्य अपर्याप्त होने पर अंशांकित परहेज (calibrated abstentions) करने में सक्षम हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही स्मार्ट, स्वचालित उड़ान प्रशिक्षक (flight instructor) बना रहे हैं। आप चाहते हैं कि यह प्रशिक्षक विमानन नियमों और सुरक्षा के बारे में सवालों के जवाब दे, लेकिन इसके लिए एक सुनहरा नियम है: इसे कभी भी अनुमान नहीं लगाना चाहिए। यदि इसे आधिकारिक नियम पुस्तिका के आधार पर उत्तर नहीं पता है, तो इसे एक विश्वसनीय लगने वाला झूठ बोलने के बजाय यह कहना चाहिए, "मेरे पास पर्याप्त जानकारी नहीं है।" उड्डयन की दुनिया में, एक मनगढ़ंत उत्तर केवल एक गलती नहीं है; यह खतरनाक है।
समस्या यह है कि अधिकांश AI मॉडल उन छात्रों की तरह हैं जिन्होंने एक पाठ्यपुस्तक रट ली है लेकिन वे "भ्रमित" (hallucinating) होने या तथ्य बनाने के प्रति भी प्रवृत्त होते हैं। वे अक्सर ऐसे डेटा पर निर्भर होते हैं जो पे-वॉल (paywalls) या कॉपीराइट के पीछे बंद होता है, जिससे भरोसेमंद उपकरण बनाना कठिन हो जाता है।
यह शोध पत्र AeroGround को पेश करता है, जो इन समस्याओं का एक समाधान है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. स्रोत सामग्री: "सार्वजनिक पुस्तकालय"
गुप्त या कॉपीराइट वाली किताबों के बजाय, शोधकर्ताओं ने अपना डेटासेट पूरी तरह से मुफ्त, सार्वजनिक डोमेन के सरकारी दस्तावेजों से बनाया है। इसे ऐसे समझें जैसे कि केवल आधिकारिक FAA हैंडबुक और संघीय नियमों का उपयोग करना जिन्हें कोई भी अमेरिका में मुफ्त में पढ़ सकता है। उन्होंने अंतरराष्ट्रीय संगठनों (जैसे ICAO) से संबंधित किसी भी चीज़ को बाहर कर दिया क्योंकि वे कॉपीराइट सुरक्षित हैं। यह सुनिश्चित करता है कि कानूनी परेशानी के बिना इस डेटा का उपयोग हर कोई कर सके।
2. निर्माण: "तथ्य-जांचकर्ता पाइपलाइन"
शोधकर्ताओं ने केवल इन किताबों को कंप्यूटर में नहीं डाला। उन्होंने एक ऐसी मशीन बनाई जो एक सख्त लाइब्रेरियन की तरह कार्य करती है:
- चंकिंग (Chunking): उन्होंने विशाल नियमपुस्तिकाओं को छोटे, प्रबंधनीय टुकड़ों में काट दिया (जैसे एक उपन्यास को व्यक्तिगत अध्यायों में काटना)।
- प्रश्नोत्तरी: प्रत्येक टेक्स्ट के टुकड़े के लिए, सिस्टम एक परीक्षण प्रश्न बनाता है।
- "अच्छा" उत्तर: यह एक उत्तर उत्पन्न करता है जिसे उस विशिष्ट टेक्स्ट द्वारा समर्थित होना ही चाहिए, जिसमें एक उद्धरण (जैसे फुटनोट) भी शामिल हो।
- "बुरा" उत्तर: यह एक "डिस्ट्रैक्टर" उत्तर भी बनाता है जो अच्छा लगता है लेकिन बिना टेक्स्ट देखे मनगढ़ंत बनाया गया है (एक "क्लोज्ड-बुक" अनुमान)।
- "मुझे नहीं पता" उत्तर: लगभग 10% समय, वे सिस्टम को एक ऐसा प्रश्न देते हैं जो अप्रासंगिक टेक्स्ट के साथ होता है। यहाँ सही प्रतिक्रिया यह है कि कहना, "सुरक्षित उड़ान प्रोटोकॉल सलाह के लिए डेटा अपर्याप्त है।" यह AI को यह सिखाता है कि कब रुकना है और हार स्वीकार करनी है।
3. सत्यापन: "दोहरा-चेक"
डेटा जारी करने से पहले, उन्होंने एक कठोर ऑडिट चलाया। उन्होंने केवल AI पर भरोसा नहीं किया; उन्होंने जांचा कि क्या AI के उत्तर वास्तव में स्रोत टेक्स्ट से मेल खाते हैं।
- वाक्य समर्थन (Sentence Support): क्या AI ने उन शब्दों का उपयोग किया जो स्रोत में मौजूद थे? (96.9% समय, हाँ)।
- एंटिटी समर्थन (Entity Support): क्या AI ने विशिष्ट संख्याओं, फॉर्म कोड और नियम अनुभागों को सही ढंग से प्राप्त किया? (98.2% समय, हाँ)।
- परिणाम: "अच्छे" उत्तर वास्तविकता में गहराई से निहित थे, जबकि "बुरे" उत्तर (अनुमान) स्पष्ट रूप से असमर्थ थे।
4. प्रशिक्षण: AI को "परहेज" करना सिखाना
शोधकर्ताओं ने एक मानक AI मॉडल लिया और उसे एक विशेष तकनीक जिसे DPO (डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन) कहा जाता है, का उपयोग करके प्रशिक्षित किया।
- पाठ: AI ने "ग्राउंडेड" उत्तर (उद्धरणों के साथ) को "अनुमान" की तुलना में प्राथमिकता देना सीखा।
- सुरक्षा जाल: उन्होंने एक "थ्री-लेयर अनसर्टेन्टी स्टैक" जोड़ा। इसे AI के लिए एक ट्रैफिक लाइट सिस्टम की तरह समझें:
- लेयर 1: क्या प्रश्न टेक्स्ट से मेल खाता है?
- लेयर 2: क्या AI भ्रमित है या अनुमान लगा रहा है?
- लेयर 3: एक अंतिम निर्णय द्वार। यदि AI 100% सुनिश्चित नहीं है, तो वह "परहेज" (abstain) बटन दबा देता है और उत्तर देने से मना कर देता है।
5. परिणाम: एक विश्वसनीय पायलट
जब उन्होंने इस नए सिस्टम का परीक्षण किया:
- सटीकता: जब इसने उत्तर दिया, तो यह बहुत सटीक था (मानक भाषा परीक्षणों पर उच्च स्कोर किया)।
- सुरक्षा: "परहेज गेट" (abstention gate) यह जानने में उत्कृष्ट था कि कब नहीं बोलना है। इसने कठिन प्रश्नों के लिए जवाब देने से मना करने में 94% बार सही पहचान की।
- कैलिब्रेशन: AI का आत्मविश्वास उसकी वास्तविकता से मेल खाता था। यदि इसने कहा कि वह 90% सुनिश्चित है, तो वह वास्तव में 90% सही था। इसने अपने ज्ञान का अतिरंजित आकलन नहीं किया।
कमी (सीमाएं)
लेखक बहुत ईमानदार हैं कि यह उपकरण क्या नहीं है:
- यह केवल अमेरिकी नियमों पर केंद्रित है।
- प्रश्न और उत्तर AI द्वारा उत्पन्न किए गए और फिर जांचे गए थे, न कि मानव पायलटों द्वारा लिखे गए।
- महत्वपूर्ण रूप से: यह एक अनुसंधान उपकरण है। आप आज वास्तविक उड़ान निर्णय लेने के लिए इस विशिष्ट AI का उपयोग नहीं कर सकते। यह भविष्य के सुरक्षित उपकरण बनाने के लिए एक आधार है।
सारांश
AeroGround एक AI पायलट के लिए प्रशिक्षण जिम की तरह है। यह एक विशाल, मुफ्त और कानूनी रूप से सुरक्षित अभ्यासों का सेट प्रदान करता है जहाँ AI नियम पुस्तिका का सख्ती से पालन करना सीखता है और सबसे महत्वपूर्ण बात यह है कि वह यह कहना सीखता है कि "मुझे नहीं पता" जब नियम पुस्तिका में उत्तर नहीं होता है। यह साबित करता है कि सही डेटा और सुरक्षा जांच के साथ, AI को उड्डयन जैसे उच्च-जोखिम वाले क्षेत्रों के लिए भरोसेमंद बनाया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।