← नवीनतम पेपर
🤖 AI

Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence

यह शोध पत्र Safactory को प्रस्तुत करता है, जो एक नवीन, एकीकृत ढांचा है जो अगली पीढ़ी के विश्वसनीय स्वायत्त एजेंटों को प्रशिक्षित करने में दीर्घकालिक निर्णय लेने और जोखिम खोज की चुनौतियों को व्यवस्थित रूप से संबोधित करने के लिए समानांतर सिमुलेशन, विश्वसनीय डेटा प्रबंधन और स्वायत्त विकास प्लेटफार्मों को एकीकृत करता है।

मूल लेखक: Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang
प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang Xu, Yiwen Cong, Meng Jin, Gaolei Li, Xuansheng Wu, Linhan Liu, Zijing He, An Li, Yan Teng, Xin Tan, Dongrui Liu, Jing Shao, ChaoChao Lu, Ji He, Jie Li, Chunfeng Song, Jinya Xu, Fan Song, Shujie Wang, Jianmin Qian, Jie Hou, Xuhong Wang, Yingchun Wang, Hui Wang, Xia Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन बहुत नए, रोबोटिक सहायक को कंप्यूटर प्रबंधित करने, फोन चलाने, या यहाँ तक कि वीडियो गेम खेलने जैसे जटिल कार्य करना सिखा रहे हैं। अतीत में, हम इन रोबोटों को मुख्य रूप से सरल प्रश्न पूछकर और यह जाँचकर सिखाते थे कि उनके उत्तर सुरक्षित हैं या नहीं। लेकिन अब, ये रोबोट स्वायत्त एजेंट (autonomous agents) बनते जा रहे हैं—वे केवल बात नहीं करते; वे कार्य करते हैं। वे बटन क्लिक करते हैं, फाइलें खोलते हैं और कई चरणों की लंबी श्रृंखला के माध्यम से निर्णय लेते हैं।

समस्या यह है कि जब एक रोबोट एक बातचीत के दौरान गलती करता है, तो वह केवल एक गलत वाक्य होता है। लेकिन जब एक रोबोट वास्तविक दुनिया में गलती करता है (जैसे कि गलत फाइल डिलीट करना या किसी हानिकारक लिंक पर क्लिक करना), तो इसके परिणाम वास्तविक और नुकसानदेह हो सकते हैं।

Safactory एक नया "फैक्ट्री" है जिसे शंघाई एआई लैबोरेटरी द्वारा इस समस्या को हल करने के लिए बनाया गया है। इसे एक एकल उपकरण के रूप में नहीं, बल्कि एक पूर्ण, स्व-चालित पारिस्थितिकी तंत्र के रूप में देखें जिसे इन रोबोटों को सुरक्षित, विश्वसनीय और भरोसेमंद बनाने के लिए डिज़ाइन किया गया है।

Safactory कैसे काम करता है, इसे इस फैक्ट्री के भीतर तीन "वर्कशॉप" में विभाजित किया गया है:

1. पैरेलल सिमुलेशन प्लेटफॉर्म (द "मैसिव टेस्टिंग ग्राउंड")

कल्पना कीजिए कि आप एक नई कार का परीक्षण करना चाहते हैं। आप उसे केवल एक धूप वाले दिन में नहीं चलाएंगे; आप उसे बारिश में, रात में, बर्फीली सड़कों पर चलाएंगे, और शायद इसे सिम्युलेटर में कुछ बार क्रैश भी करेंगे यह देखने के लिए कि क्या होता है।

मौजूदा सिस्टम ऐसे थे जैसे आप कार को केवल एक बार चलाते हैं। Safactory अलग है। यह एक विशाल, समानांतर परीक्षण मैदान (massive, parallel testing ground) बनाता है जहाँ हजारों रोबोट एजेंट आभासी वातावरण (जैसे कि एक नकली कंप्यूटर डेस्कटॉप, एक नकली एंड्रॉइड फोन, या एक नकली माइनक्राफ्ट दुनिया) में एक साथ एक ही कार्य चला सकते हैं।

  • "टाइम-ट्रैवल" फीचर: यदि कोई रोबोट गलती करता है, तो Safactory पूरे दिन को फिर से शुरू नहीं करता है। इसमें "एजेंट्स के लिए गिट (Git for Agents)" फीचर है। यह किसी भी बिंदु पर रोबोट की स्थिति को सहेज सकता है, जैसे कि एक वीडियो गेम सेव फ़ाइल। यदि रोबोट लगभग एक फ़ाइल डिलीट करने वाला होता है, तो सिस्टम उस सटीक क्षण पर "रीवाइंड" कर सकता है और एक अलग रास्ता अपनाकर देख सकता है कि क्या रोबोट खतरे से बचने के लिए सीख सकता है।
  • लक्ष्य: उन छिपे हुए खतरों को ढूंढना जो 20 या 30 चरणों के संपर्क के बाद ही दिखाई देते हैं, जिन्हें साधारण परीक्षण मिस कर देते।

2. ट्रस्टवर्दी डेटा प्लेटफॉर्म (द "स्मार्ट लाइब्रेरियन")

हर बार जब एक रोबोट एक परीक्षण चलाता है, तो वह भारी मात्रा में डेटा उत्पन्न करता है: उसने क्या देखा, उसने क्या क्लिक किया, उसने क्या सोचा, और क्या वह सफल रहा या विफल। आमतौर पर, इस डेटा को बस एक फोल्डर में डाल दिया जाता है और भुला दिया जाता है।

Safactory इस डेटा को सोना मानता है। यह एक विशेष "AI लाइब्रेरियन" का उपयोग करता है जिसे DataElf कहा जाता है।

  • "इंटेंट" का जादू: आपको इस डेटा को व्यवस्थित करने के लिए जटिल कोड लिखने की आवश्यकता नहीं है। आप बस DataElf को साधारण अंग्रेजी में बता सकते हैं: "रोबोट ने किन सभी मौकों पर फिशिंग लिंक पर क्लिक करने ही वाला था, उन्हें खोजें और मुझे उसका सारांश दें।"
  • "ब्लैक बॉक्स" सुरक्षा: DataElf एक सुरक्षित "ब्लैक बॉक्स" के भीतर संवेदनशील डेटा (जैसे पासवर्ड या निजी फाइलें) को देख सकता है। यह डेटा का विश्लेषण जोखिम खोजने के लिए कर सकता है बिना उस निजी जानकारी को देखे या लीक किए।
  • परिणाम: यह अव्यवस्थित लॉग्स को साफ, व्यवस्थित "अनुभव पुस्तकों" में बदल देता है जिन्हें रोबोट बाद में अपनी गलतियों से सीखने के लिए पढ़ सकता है।

3. ऑटोनॉमस इवोल्यूशन प्लेटफॉर्म (द "कंटीन्यूअस ट्रेनिंग जिम")

एक बार जब रोबोटों का परीक्षण किया जाता है और उनके डेटा को व्यवस्थित किया जाता है, तो उन्हें बेहतर होने की आवश्यकता होती है। यहीं पर इवोल्यूशन प्लेटफॉर्म आता है।

  • लूप: रोबोट को एक बार प्रशिक्षित करने और फिर रुकने के बजाय, यह प्लेटफॉर्म एक निरंतर लूप बनाता है। रोबोट अभ्यास करता है, सिस्टम परिणामों को रिकॉर्ड करता है, "लाइब्रेरियन" सबसे अच्छे सबक चुनता है, और रोबोट तुरंत फिर से प्रशिक्षण लेता है।
  • "टीचर" सिस्टम: यह ऑन-पॉलिसी डिस्टिलेशन (On-Policy Distillation) नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि एक मास्टर शिक्षक छात्र रोबोट को देख रहा है। यदि छात्र हिचकिचाता है या कोई जोखिम भरा कदम उठाता है, तो शिक्षक उन्हें वास्तविक समय में सुरक्षित विकल्प की ओर धीरे से निर्देशित करता है, जिससे रोबोट तेजी से और अधिक स्थिरता से सीख पाता है।
  • लक्ष्य: एक ऐसा सिस्टम बनाना जहाँ रोबोट हर एक दिन स्वचालित रूप से सुरक्षित और स्मार्ट होता जाए, बिना किसी मानव इंजीनियर के हर बग को मैन्युअल रूप से ठीक किए।

इंजन रूम: DeepLink कंप्यूटिंग

इन हजारों सिमुलेशन और प्रशिक्षण सत्रों को चलाने के लिए भारी कंप्यूटिंग शक्ति की आवश्यकता होती है। Safactory को DeepLink पर चलने के लिए बनाया गया है, जो एक घरेलू (चीनी) हार्डवेयर और सॉफ्टवेयर पारिस्थितिकी तंत्र है। इसे फैक्ट्री के पावर प्लांट और लॉजिस्टिक्स नेटवर्क के रूप में सोचें, जो यह सुनिश्चित करता है कि भले ही हार्डवेयर मानक पश्चिमी चिप्स से अलग हो, फैक्ट्री सुचारू रूप से, कुशलता से और सुरक्षित रूप से चलती रहे।

बड़ा चित्र (The Big Picture)

पेपर का तर्क है कि सुरक्षा कोई चेकलिस्ट नहीं है जिसे आप रोबोट को रिलीज करने से पहले पूरा कर लेते हैं। यह एक निरंतर प्रक्रिया है।

  • पुराना तरीका: रोबोट का परीक्षण करें \rightarrow बग्स ठीक करें \rightarrow रिलीज करें।
  • Safactory का तरीका: एक विशाल सिमुलेशन में रोबोट का परीक्षण करें \rightarrow हर गलती को रिकॉर्ड करें \rightarrow गलतियों को सबक में बदलें \rightarrow रोबोट को फिर से प्रशिक्षित करें \rightarrow अनंत काल तक दोहराएं।

Safactory वह बुनियादी ढांचा है जो इस "अनंत लूप" को संभव बनाता है, यह सुनिश्चित करता है कि जैसे-जैसे AI एजेंट अधिक शक्तिशाली और स्वायत्त होते जा रहे हैं, वे वास्तविक दुनिया के लिए नियंत्रणीय, ऑडिट योग्य और सुरक्षित बने रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →