← नवीनतम पेपर
💬 NLP

Orchard: An Open-Source Agentic Modeling Framework

यह शोध पत्र Orchard को प्रस्तुत करता है, जो एक हल्का एनवायरनमेंट लेयर (Orchard Env) और विशिष्ट प्रशिक्षण रेसिपी वाला एक ओपन-सोर्स फ्रेमवर्क है, जो कोडिंग, GUI और पर्सनल असिस्टेंट डोमेन में स्केलेबल, उच्च-प्रदर्शन वाले एजेंटिक मॉडलिंग को सक्षम बनाता है और ओपन-सोर्स मॉडलों के बीच अत्याधुनिक परिणाम प्राप्त करता है।

मूल लेखक: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI के लिए एक सार्वभौमिक "खेल का मैदान" (Playground) बनाना

कल्पना कीजिए कि आप एक रोबोट को जटिल काम करना सिखाना चाहते हैं, जैसे कि एक टूटे हुए कंप्यूटर प्रोग्राम को ठीक करना, किराने का सामान खरीदने के लिए वेबसाइट चलाना, या आपका ईमेल मैनेज करना। सीखने के लिए, रोबोट को एक सुरक्षित, अलग "सैंडबॉक्स" (जैसे कि एक वीडियो गेम लेवल) में अभ्यास करने की आवश्यकता होती है जहाँ वह चीजें आजमा सके, गलतियाँ कर सके और देख सके कि क्या होता है, बिना वास्तविक दुनिया को नुकसान पहुँचाए।

लंबे समय तक, इन सैंडबॉक्स को बनाना हर एक खिलौने के लिए एक कस्टम खेल का मैदान बनाने जैसा था। यदि आप एक कोडिंग रोबोट का परीक्षण करना चाहते थे, तो आपने एक खेल का मैदान बनाया। यदि आप एक शॉपिंग रोबोट का परीक्षण करना चाहते थे, तो आपको बिल्कुल शुरुआत से एक पूरी तरह से अलग खेल का मैदान बनाना पड़ता था। इससे शोध धीमा, महंगा और साझा करने में कठिन हो गया था।

Orchard एक नया ओपन-सोर्स फ्रेमवर्क है जो इसे एक एक सार्वभौमिक, उच्च-गुणवत्ता वाला खेल का मैदान बनाकर हल करता है जो किसी भी प्रकार के रोबोट एजेंट के लिए काम करता है। शोधकर्ता इसे "Orchard Env" कहते हैं।

Orchard को AI शोधकर्ताओं के लिए एक सार्वभौमिक पावर स्ट्रिप और टूल बेल्ट के रूप में सोचें। हर डिवाइस के लिए एक नया इलेक्ट्रिकल आउटलेट बनाने के बजाय, उन्होंने एक स्मार्ट आउटलेट बनाया जो सभी के साथ काम करता है। यह शोधकर्ताओं को AI को सोचने का तरीका सिखाने पर ध्यान केंद्रित करने की अनुमति देता है, बजाय इसके कि वे सैंडबॉक्स की प्लंबिंग (व्यवस्था) की चिंता करें।


तीन "रेसिपी" (उन्होंने क्या बनाया)

इस सार्वभौमिक खेल के मैदान का उपयोग करते हुए, टीम ने तीन विशिष्ट क्षेत्रों में AI एजेंटों को प्रशिक्षित करने के लिए तीन अलग-अलग "रेसिपी" तैयार कीं। उन्होंने केवल रसोई नहीं बनाई; उन्होंने तीन अलग-अलग, स्वादिष्ट व्यंजन बनाना भी दिखाया।

1. Orchard-SWE: द "जूनियर डेवलपर" एजेंट

  • काम: सॉफ्टवेयर कोड में बग्स (गलतियाँ) ठीक करना।
  • चुनौती: कोडिंग कठिन है। कभी-कभी AI बीच में ही अटक जाता है या गलती कर देता है। अधिकांश प्रशिक्षण विधियाँ केवल "परफेक्ट" समाधानों को देखती हैं और असफल प्रयासों को फेंक देती हैं।
  • Orchard की ट्रिक: उन्होंने "क्रेडिट-असाइनमेंट" (Credit-Assignment) नामक तकनीक का उपयोग किया। कल्पना कीजिए कि एक छात्र गणित के टेस्ट में फेल हो जाता है। केवल टेस्ट को फेंक देने के बजाय, एक शिक्षक पेपर को देखता है और कहता है, "तुमने पहले तीन स्टेप सही किए! वह अच्छा था।" Orchard AI के साथ यही करता है। यह असफल प्रयासों के "अच्छे हिस्सों" को सुरक्षित रखता है और AI को उन सफल कदमों को पहचानने के लिए सिखाता है।
  • परिणाम: उन्होंने एक ऐसा मॉडल प्रशिक्षित किया जो कोड ठीक करने में बहुत बड़े और महंगे मॉडलों जितना ही अच्छा है, लेकिन इसने सफलताओं और "लगभग सफल" प्रयासों के मिश्रण से सीखा।

2. Orchard-GUI: द "ब्राउज़र नेविगेटर" एजेंट

  • काम: वेबसाइटों पर क्लिक करना, फॉर्म भरना और उत्पाद ढूँढना (जैसे Amazon पर डॉग बेड ढूँढना)।
  • चुनौती: वेबसाइटें विजुअल (दृश्य आधारित) होती हैं। AI को एक स्क्रीनशॉट "देखना" होता है और यह समझना होता है कि कहाँ क्लिक करना है। यह किसी को केवल सड़क की तस्वीरें दिखाकर कार चलाना सिखाने जैसा है।
  • Orchard की ट्रिक: उन्होंने एक छोटा, कुशल मॉडल (केवल 4 बिलियन पैरामीटर्स, जो AI के लिए बहुत छोटा है) को अभ्यास सत्रों और एक "जज" (एक अन्य AI) के मिश्रण का उपयोग करके प्रशिक्षित किया जो परिणामों को ग्रेड देता है। उन्हें लाखों उदाहरणों की आवश्यकता नहीं थी; उन्होंने लगभग 2,600 कार्यों के सावधानीपूर्वक चुने गए सेट का उपयोग किया।
  • परिणाम: यह छोटा मॉडल अब तक का सबसे मजबूत ओपन-सोर्स ब्राउज़र एजेंट बन गया। इसने Google और OpenAI जैसी कंपनियों के विशाल, महंगे सिस्टम के समान (और कभी-कभी उनसे बेहतर) प्रदर्शन किया, जिससे यह साबित हुआ कि यदि आपके पास सही प्रशिक्षण है, तो आपको विशाल मस्तिष्क की आवश्यकता नहीं है।

3. Orchard-Claw: द "पर्सनल असिस्टेंट" एजेंट

  • काम: ईमेल सॉर्ट करना, कैलेंडर चेक करना और फाइलें व्यवस्थित करने जैसे दैनिक जीवन के कार्यों को प्रबंधित करना।
  • चुनौती: ये कार्य अलग-अलग "टूल्स" (ईमेल ऐप, कैलेंडर ऐप) में होते हैं। आमतौर पर, एक टूल पर प्रशिक्षित AI दूसरे पर स्विच करने पर भ्रमित हो जाता है।
  • Orchard की ट्रिक: उन्होंने AI को एक साथ दो अलग-अलग "कंट्रोल पैनल" (हार्नेस) का उपयोग करके प्रशिक्षित किया। यह एक ड्राइवर को एक ही समय में मैनुअल और ऑटोमैटिक दोनों कार चलाना सिखाने जैसा है। इसने AI को केवल एक कार के विशिष्ट पेडल्स को सीखने के बजाय, ड्राइविंग की अवधारणा (concept) सीखने के लिए मजबूर किया।
  • परिणाम: AI बहुत लचीला हो गया। जब उन्होंने अंत में इसे एक अधिक उन्नत कंट्रोल पैनल पर स्विच किया, तो यह टूटा नहीं; वास्तव में यह काम में और बेहतर हो गया, जिससे पता चला कि इसने वास्तव में कौशल सीखा है, न कि केवल बटनों को रटा है।

यह क्यों मायने रखता है: "थिन लेयर" (पतली परत) क्रांति

पेपर का तर्क है कि AI अनुसंधान में सबसे बड़ी बाधा "दिमाग" (मॉडल) नहीं है; बल्कि "पैर" (पर्यावरण/environment) है।

  • पहले: शोधकर्ता हर कार के लिए एक कस्टम इंजन बनाते थे। यदि आप एक नया इंजन टेस्ट करना चाहते थे, तो आपको एक पूरी नई कार बनानी पड़ती थी।
  • अब (Orchard): Orchard एक सार्व通用 चेसिस (chassis) है। आप इसमें कोई भी इंजन (AI मॉडल) डाल सकते हैं, और यह चल पड़ेगा।
    • यह सस्ता है: क्योंकि यह मानक क्लाउड तकनीक पर चलता है, इसकी लागत मौजूदा वाणिज्यिक सेवाओं की तुलना में लगभग 10 गुना कम है।
    • यह तेज़ है: यह क्रैश हुए बिना एक ही समय में हजारों अभ्यास सत्र चला सकता है।
    • यह पुन: प्रयोज्य (Reusable) है: कोडिंग रोबोट के लिए एकत्र किया गया डेटा शॉपिंग रोबोट को प्रशिक्षित करने के लिए पुन: उपयोग किया जा सकता है।

निचोड़ (The Bottom Line)

Orchard पेपर कहता है: "पहिया दोबारा बनाने में समय बर्बाद न करें।"

एक साफ, खुले और सस्ते "खेल के मैदान" का निर्माण करके, जो सभी के लिए काम करता है, उन्होंने दिखाया कि ओपन-सोर्स AI सबसे बड़ी टेक दिग्गजों के साथ प्रतिस्पर्धा कर सकता है। उन्होंने साबित किया कि सही इंफ्रास्ट्रक्चर और स्मार्ट प्रशिक्षण रेसिपी (जैसे गलतियों से सीखना और कई टूल्स पर प्रशिक्षण) के साथ, छोटे, ओपन मॉडल भी विशाल, क्लोज्ड सिस्टम की तरह ही जटिल, वास्तविक दुनिया की समस्याओं को हल कर सकते हैं।

उन्होंने अपना सारा कोड, डेटा और रेसिपी सार्वजनिक रूप से जारी कर दी है, इस उम्मीद में कि यह पूरे AI अनुसंधान क्षेत्र को गति देगा क्योंकि "खेल का मैदान" अब सभी के लिए उपलब्ध है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →