← नवीनतम पेपर
🔢 mathematics

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

यह शोध पत्र AutoResearch को प्रस्तुत करता है, जो एक ऑडिट करने योग्य (auditable), LLM-संचालित ढांचा है जो एयरोस्पेस कंट्रोल पॉलिसी विकास के माध्यम से स्वायत्त रूप से पुनरावृत्ति करता है और सीड नॉइज़ (seed noise) एवं इष्टतम बेंचमार्क के विरुद्ध सुधारों को कठोरता से मान्य करता है, जिससे रेंडेवू (rendezvous) और टकराव-परिहार (collision-avoidance) कार्यों के लिए मजबूत समाधान सफलतापूर्वक उत्पन्न होते हैं जहाँ अननिर्देशित खोज विफल हो जाती है।

मूल लेखक: Amit Jain, Richard Linares

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amit Jain, Richard Linares

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अंतरिक्ष यान उड़ाना सिखाने की कोशिश कर रहे हैं। आप उसे सिर्फ यह नहीं कह सकते कि "वहाँ उड़कर जाओ"; आपको उसके लिए एक जटिल कंप्यूटर प्रोग्राम लिखना होगा, उसकी सेटिंग्स को ट्यून करना होगा, एक परीक्षण चलाना होगा, देखना होगा कि क्या वह क्रैश हो गया, और फिर से कोशिश करनी होगी। इस प्रक्रिया को "अनुसंधान" (रिसर्च) कहा जाता है, और आमतौर पर, यह एक मानव वैज्ञानिक द्वारा किया जाता है जो हफ्तों तक यह अनुमान लगाने में बिता देता है कि कौन सी सेटिंग्स सबसे अच्छा काम करती हैं।

यह पेपर एक नए टूल के बारे में बताता जिसे AutoResearch कहा जाता है। इसे एक सुपर-स्मार्ट, अथक रोबोट सहायक (जो एक लार्ज लैंग्वेज मॉडल द्वारा संचालित है) को अपने लिए अनुमान लगाने और परीक्षण करने के लिए काम पर रखने के रूप में समझें। लेकिन यहाँ एक पेच है: अंतरिक्ष और AI की दुनिया में, भाग्यशाली होना बहुत आसान है। एक रोबोट शायद इसलिए अच्छी तरह से उड़ पा रहा हो क्योंकि उसे एक रैंडम "सीड" नंबर (जैसे पासे पर छह आने जैसा) मिल गया, न कि इसलिए कि उसने वास्तव में उड़ना सीख लिया है।

लेखकों ने एक ऐसा सिस्टम बनाया है जहाँ रोबोट सहायक अनुसंधान करता है, लेकिन इसमें एक अंतर्निहित "क्रेडिबिलिटी लेयर" (विश्वसनीयता परत) है—एक सख्त गुणवत्ता नियंत्रण निरीक्षक जो इस चक्र के भीतर रहता है। यह निरीक्षक यह सुनिश्चित करता है कि रोबोट द्वारा दावा किया गया कोई भी "सुधार" वास्तविक है और केवल एक भाग्यशाली संयोग नहीं है।

यह सिस्टम कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. रिसर्च लूप (रोबोट वैज्ञानिक)

कल्पना कीजिए कि रोबोट सहायक सूप का एक बेहतर स्वाद बनाने के लिए एक शेफ है।

  • कार्य: इंसान रोबोट को एक सरल विवरण देता है: "सूप का स्वाद बेहतर बनाओ।"
  • क्रिया: रोबोट वर्तमान रेसिपी को देखता है, बदलाव का अनुमान लगाता है (जैसे, "थोड़ा नमक डालें" या "5 मिनट और पकाएं"), और सिमुलेशन चलाता है (सूप पकाता है)।
  • परिणाम: वह सूप का स्वाद लेता है और स्कोर दर्ज करता है।
  • चक्र: वह सैकड़ों बार इसे दोहराता है, लगातार रेसिपी को ट्यून करता रहता है ताकि सबसे अच्छा स्कोर मिल सके।

2. क्रेडिबिलिटी लेयर (सख्त निरीक्षक)

आमतौर पर, यदि कोई रोबोट कहता है, "मैंने एक बेहतर रेसिपी खोज ली है!" तो आप बस उसकी बात मान सकते हैं। लेकिन विज्ञान में, एक अच्छा परीक्षण केवल भाग्य हो सकता है। क्रेडिबिलिटी लेयर एक सख्त फूड क्रिटिक (खाद्य समीक्षक) की तरह है जो तब तक विश्वास करने से इनकार करता है जब तक कि तीन चीजें न हो जाएं:

  • शोर (Noise) को मापना: सबसे पहले, समीक्षक यह मापता है कि रैंडम कारकों के कारण स्वाद में स्वाभाविक रूप से कितना उतार-चढ़ाव आता है। (जैसे, "भले ही रेसिपी वही हो, रैंडम कारकों के कारण स्वाद 1 पॉइंट ऊपर-नीचे हो सकता है।")
  • रीसीडिंग (पुनः परीक्षण): यदि रोबोट दावा करता है कि एक नई रेसिपी अद्भुत है, तो समीक्षक केवल एक बार उसका स्वाद नहीं लेता। वे अलग-अलग रैंडम सीड्स के साथ उस रेसिपी को दस बार बनाते हैं। यदि रेसिपी वास्तव में बेहतर है, तो उसे सभी दस प्रयासों में स्वादिष्ट होना चाहिए, न कि केवल एक भाग्यशाली बार।
  • प्रूनिंग ("वास्तव में क्या काम कर रहा है?" की जाँच): यदि रोबोट ने पाँच चीजें बदलीं (नमक, काली मिर्च, गर्मी, समय और ढक्कन), तो समीक्षक प्रत्येक को व्यक्तिगत रूप से जाँचता है। वे पूछते हैं, "यदि हम अतिरिक्त नमक हटा दें, तो क्या यह खराब हो जाएगा?" यह साबित करता है कि वास्तव में किस बदलाव ने सूप को बेहतर बनाया, न कि केवल अनुमान लगाया।

3. स्पेस मिशन्स (परीक्षण)

लेखकों ने इस सिस्टम का परीक्षण दो वास्तविक अंतरिक्ष समस्याओं पर किया:

  • मिशन A: द रेंडेवूज़ (पार्किंग का काम)

    • लक्ष्य: अंतरिक्ष यान को कक्षा में दूसरे यान के साथ डॉक करने के लिए उड़ाना।
    • परिणाम: रोबोट सहायक ने अविश्वसनीय सटीकता के साथ यान को डॉक करने का तरीका खोज लिया। "लकी" रैंडम सर्च (बिना स्मार्ट असिस्टेंट के केवल सेटिंग्स का अनुमान लगाना) बहुत निचले प्रदर्शन स्तर पर अटक गया। रोबට का समाधान इतना अच्छा था कि उसने सामान्य उतार-चढ़ाव (noise) के अंतर को बहुत बड़े अंतर (15 गुना) से पार कर लिया।
  • मिशन B: द कीप-आउट ज़ोन (खतरनाक पार्किंग का काम)

    • लक्ष्य: एक अंतरिक्ष यान के साथ डॉक करना, लेकिन आपको बीच में एक खतरनाक "कीप-आउट" गोले के चारों ओर से उड़ना होगा। यदि आप उससे टकराते हैं, तो आप क्रैश हो जाएंगे।
    • परिणाम: यह बहुत कठिन था। रैंडम सर्च पूरी तरह विफल रहा; वह बिना क्रैश हुए डॉक करने का एक भी तरीका नहीं ढूंढ सका। हालाँकि, रोबोट सहायक ने खतरे के क्षेत्र के चारों ओर जाने और सुरक्षित रूप से डॉक करने का रास्ता निकाल लिया।
    • ऑडिट: क्रेडिबिलिटी लेयर ने इस परिणाम की दस बार जाँच की। हर बार, रोबोट की पॉलिसी सुरक्षित रही और सफलतापूर्वक डॉक हुई। रैंडम सर्च एक बार भी सफल नहीं हुआ।

मुख्य निष्कर्ष

यह पेपर अंतरिक्ष यान उड़ाने के नए तरीके के बारे में नहीं है; यह उन्हें उड़ाना खोजने के एक नए तरीके के बारे में है।

लेखक दिखाते हैं कि आप एक AI का उपयोग अनुसंधान प्रक्रिया चलाने के लिए कर सकते हैं, लेकिन आपको इसे एक सख्त "ऑडिट" सिस्टम के भीतर रखना चाहिए। यह सिस्टम भाग्य को छानता है, यह साबित करता है कि परिणाम वास्तविक हैं, और पहचानता है कि किस बदलाव ने अंतर पैदा किया। यह एक अराजक, भाग्यशाली अनुमान के खेल को एक विश्वसनीय, ईमानदार और ऑडिट योग्य वैज्ञानिक प्रक्रिया में बदल देता है।

संक्षेप में: AutoResearch एक रोबोट वैज्ञानिक है जो काम करता है, लेकिन एक सख्त निरीक्षक यह सुनिश्चित करता है कि जश्न मनाने से पहले परिणाम वास्तविक हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →