daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
यह शोध पत्र daVinci-Agency को प्रस्तुत करता है, जो एक डेटा-कुशल ढांचा है जो लार्ज लैंग्वेज मॉडल्स के लिए उच्च-गुणवत्ता वाले, लॉन्ग-होराइज़न प्रशिक्षण डेटा को संश्लेषित करने के लिए प्रामाणिक पुल रिक्वेस्ट (Pull Request) अनुक्रमों का लाभ उठाता है, जिससे अत्यधिक एनोटेशन लागत के बिना जटिल एजेंटिक वर्कफ़्लो में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ daVinci-Agency पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं, रोज़मर्रा के उदाहरणों और लेखकों द्वारा किए गए विशिष्ट दावों में विभाजित किया गया है।
बड़ी समस्या: AI की "कम ध्यान अवधि" (Short Attention Span)
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र है जो एकल प्रश्नों के उत्तर देने में माहिर है, जैसे "2+2 क्या है?" या "एक बिल्ली के बारे में कविता लिखें।" यह छात्र एक लार्ज लैंग्वेज मॉडल (LLM) है।
हालाँकि, यदि आप इस छात्र को एक घर बनाने के लिए कहते हैं, तो वह संघर्ष करता है। वह शायद नींव तो रख देगा, फिर भूल जाएगा कि उसे छत की भी ज़रूरत है, या वह दीवार गलत जगह बना सकता है और अंत तक उसे पता नहीं चलेगा कि उसने क्या गलती की है। AI की दुनिया में, इसे लॉन्ग-होराइजन टास्क (long-horizon task) कहा जाता है। यह एक ऐसा काम है जिसमें कई चरणों की आवश्यकता होती है, जहाँ शुरुआत में की गई गलतियाँ बाद में पूरे प्रोजेक्ट को बर्बाद कर सकती हैं।
पेपर का तर्क है कि वर्तमान AI मॉडल इन लंबे कामों में इसलिए विफल होते हैं क्योंकि उन्हें ऐसे डेटा पर प्रशिक्षित नहीं किया गया है जो उन्हें लंबे समय तक योजना बनाने (plan ahead), निरंतर रहने (stay consistent) और अपनी गलतियों को सुधारने (fix their own mistakes) के बारे में सिखा सके।
समाधान: "सॉफ्टवेयर इवोल्यूशन" से सीखना
लेखकों (SII, SJTU और GAIR से) ने महसूस किया कि AI को लंबे, जटिल प्रोजेक्ट्स संभालने के तरीके सिखाने का सबसे अच्छा तरीका यह है कि हम देखें कि वास्तविक इंसान सॉफ्टवेयर कैसे बनाते हैं।
उपमा: "पुल रिक्वेस्ट" (Pull Request) की श्रृंखला
सॉफ्टवेयर विकास में, जब एक प्रोग्रामर कोई नया फीचर जोड़ना चाहता है या बग ठीक करना चाहता है, तो वे केवल तैयार कोड को सीधे नहीं डाल देते। वे एक "पुल रिक्वेस्ट" (PR) सबमिट करते हैं।
- चरण 1: वे एक छोटा सा बदलाव सबमिट करते हैं (PR #15)।
- चरण 2: समीक्षक (Reviewers) कहते हैं, "यह अच्छा लग रहा है, लेकिन आपने सुरक्षा जाल (safety net) छोड़ दिया है।"
- चरण 3: प्रोग्रामर इसे ठीक करता है और एक नया बदलाव (PR #21) सबमिट करता है जो पहले वाले पर आधारित होता है।
- चरण 4: यह प्रक्रिया कई राउंड तक चलती है जब तक कि फीचर एकदम सही न हो जाए।
लेखक इसे "चेन ऑफ पुल रिक्वेस्ट्स" (Chain of Pull Requests) कहते हैं। यह एक कहानी की तरह है जहाँ प्रत्येक अध्याय पिछले अध्याय पर निर्भर करता है, और पात्र (कोड) समय के साथ विकसित और बेहतर होते हैं।
नवाचार: daVinci-Agency
टीम ने daVinci-Agency नामक एक नई प्रणाली बनाई। AI को सिखाने के लिए नकली परिदृश्य बनाने या इंसानों को लंबी कहानियाँ लिखने के लिए भुगतान करने के बजाय (जो महंगा और धीमा है), वे GitHub (वास्तविक सॉफ्टवेयर प्रोजेक्ट्स का एक विशाल पुस्तकालय) पर गए और वहां से इन प्राकृतिक "चेन ऑफ पुल रिक्वेस्ट्स" को एकत्र किया।
उन्होंने इन वास्तविक दुनिया के विकास कार्यों को प्रशिक्षण डेटा (training data) में बदल दिया।
- प्रशिक्षण (The Training): उन्होंने एक मॉडल (GLM-4.6) लिया और उसे ये श्रृंखलाएँ दिखाईं।
- सबक (The Lesson): AI ने सीखा कि सफल होने के लिए उसे क्या करना चाहिए:
- डिकंपोज़ (Decompose): एक बड़े लक्ष्य को छोटे, प्रबंधनीय चरणों में तोड़ना।
- निरंतरता बनाए रखना (Stay Consistent): 50 चरणों के बाद भी मूल लक्ष्य को याद रखना।
- परिष्कृत करना (Refine): अपनी गलतियों (बग्स) को देखना और बिना दोबारा शुरू किए उन्हें ठीक करना।
"जादुई" परिणाम: कम डेटा, बड़े लाभ
आमतौर पर, AI को स्मार्ट बनाने के लिए आपको इसे लाखों उदाहरण खिलाने पड़ते हैं।
- पुराना तरीका: 66,000 उदाहरणों पर प्रशिक्षित करना (जैसे पेपर के अन्य डेटासेट)।
- daVinci का तरीका: केवल 239 उदाहरणों पर प्रशिक्षित करना।
परिणाम:
200 गुना कम डेटा का उपयोग करने के बावजूद, daVinci-Agency पर प्रशिक्षित मॉडल ने विशाल डेटासेट पर प्रशिक्षित मॉडलों की तुलना में काफी बेहतर प्रदर्शन किया।
- Toolathlon (जहाँ AI को समस्याओं को हल करने के लिए टूल्स का उपयोग करना होता है) पर, मॉडल में 47% का सुधार हुआ।
- SWE-bench (वास्तविक सॉफ्टवेयर बग्स को ठीक करने का एक टेस्ट) पर भी इसने बहुत अधिक स्कोर किया।
क्यों? क्योंकि वे 239 उदाहरण उच्च गुणवत्ता वाले थे। वे रैंडम नहीं थे; वे वास्तविक कहानियाँ थीं कि जटिल समस्याओं को समय के साथ कैसे हल किया जाता है। AI ने केवल तथ्यों को याद नहीं किया; इसने दृढ़ता और सुधार की आदत सीखी।
AI वास्तव में क्या सीखा (मेटा-कौशल/Meta-Skills)
पेपर दिखाता है कि AI केवल कोडिंग में बेहतर नहीं हुआ; यह सोचने में बेहतर हुआ।
- पहले: यदि AI कोई गलती करता था, तो वह भ्रमित हो जाता था, अप्रासंगिक विषयों की ओर भटक जाता था, या हार मान लेता था (जिसे "एस्केपिज़्म" या escapism कहा जाता है)।
- बाद में: जब AI ने गलती की, तो वह रुका, महसूस किया, "रुको, मैं यह गलत कर रहा हूँ," और उसे ठीक किया। इसने योजना बनाना और रास्ते पर टिके रहना सीखा।
दक्षता: कम में अधिक करना
पेपर ने यह भी पाया कि नया AI अधिक कुशल है।
- उपमा: कल्पना कीजिए कि दो लोग भूलभुलैया (maze) सुलझाने की कोशिश कर रहे हैं।
- व्यक्ति A (पुराना AI): हर गलत रास्ते में घुस जाता है, चिल्लाता है और 100 अलग-अलग गलत रास्तों को आज़माता है।
- व्यक्ति B (daVinci AI): नक्शा देखता है, डेड एंड (dead ends) पहचानता है, और सीधा रास्ता लेता है।
- daVinci-प्रशिक्षित AI ने समान समस्याओं को हल करने के लिए कम शब्दों (tokens) और कम टूल क्लिक्स का उपयोग किया। इसने भ्रम में अपनी ऊर्जा बर्बाद नहीं की।
"स्केलिंग" की खोज
अंत में, लेखकों ने परीक्षण किया कि यदि वे प्रशिक्षण कहानियों को और लंबा कर दें तो क्या होगा।
- उन्होंने पाया कि यदि उन्होंने AI को अधिक चरणों (लंबी पुल रिक्वेस्ट श्रृंखलाओं) वाली श्रृंखलाओं पर प्रशिक्षित किया, तो AI और भी बेहतर हो गया।
- यह सुझाव देता है कि AI जितना अधिक "लॉन्ग-डिस्टेंस" सोचने का अभ्यास करता है, वह उतनी ही बेहतर तरीके से बहुत लंबी और जटिल समस्याओं को हल करने में सक्षम होता है।
सारांश
daVinci-Agency AI एजेंटों को प्रशिक्षित करने का एक नया तरीका है। उन्हें लाखों छोटी, नकली कार्यों को याद करने के लिए मजबूर करने के बजाय, यह उन्हें दिखाकर सिखाता है कि इंसान वास्तव में सॉफ्टवेयर कैसे बनाते हैं। इन प्राकृतिक "घटनाओं की श्रृंखलाओं" से सीखकर, AI योजना बनाना, निरंतर रहना और अपनी गलतियों को सुधारना सीखता है, जिससे वह पहले के मुकाबले बहुत कम डेटा के साथ बहुत अधिक स्मार्ट और कुशल बन जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।