← नवीनतम पेपर
💬 NLP

CurateEvo: Data-Curation Evolving for Agentic Post-Training

CurateEvo एक विफलता-संचालित गतिशील विकास ढांचा (failure-driven dynamic evolution framework) है जो डेटा क्यूरेशन को निष्पादन योग्य कोड के रूप में प्रस्तुत करता है और बड़े भाषा मॉडल एजेंटों के लिए पोस्ट-ट्रेनिंग डेटा की प्रभावशीलता और दक्षता दोनों को अनुकूलित करने के लिए एजेंट विफलता प्रक्षेप पथों (agent failure trajectories) का उपयोग करके इसे पुनरावर्ती रूप से फिर से लिखता है।

मूल लेखक: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट सहायक को जटिल वास्तविक दुनिया की समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि बजट का प्रबंधन करते हुए उड़ान बुक करना या कोड के किसी हिस्से को डीबग करना। आपके पास पुराने लॉग्स का एक विशाल पुस्तकालय है जो दिखाते हैं कि मनुष्यों (और अन्य रोबोटों) ने इन कार्यों को कैसे करने का प्रयास किया। कुछ लॉग्स पूर्ण सफलता दिखाते हैं, लेकिन कई में रोबोट अटक जाता है, गलत कदम उठाता है, या क्रैश हो जाता है।

यह शोध पत्र एक नए सिस्टम जिसे CURATEEVO कहा जाता है, को इस समस्या को हल करने के लिए पेश करता है: हम इस अस्त-व्यस्त लॉग्स के पुस्तकालय को हमारे रोबोट के लिए एक आदर्श प्रशिक्षण नियमावली (training manual) में कैसे बदल सकते हैं?

समस्या: "स्थिर शेफ" बनाम "स्मार्ट संपादक"

वर्तमान में, इन रोबोट सहायकों को प्रशिक्षित करने के अधिकांश तरीके एक स्थिर शेफ (static chef) की तरह कार्य करते हैं। वे लॉग्स के कच्चे पुस्तकालय को लेते हैं और नियमों का एक निश्चित सेट लागू करते हैं: "अधिक उदाहरण जोड़ें," "बुरे उदाहरणों को बाहर फेंक दें," या "सब कुछ रखें।"

  • दोष: एक बार जब रोबलेट सीखने की कोशिश करता है और एक नए परीक्षण पर विफल हो जाता है, तो शेफ रेसिपी नहीं बदलता है। वे बस उसी पुराने, संभावित रूप से त्रुटिपूर्ण निर्देशों के साथ खाना बनाना जारी रखते हैं। वे इस तथ्य को अनदेखा कर देते हैं कि रोबोट एक विशिष्ट कमजोरी (जैसे मौसम की जांच करना भूल जाना) के कारण विफल हुआ था और उस विशिष्ट कमी को दूर करने के लिए प्रशिक्षण डेटा को ठीक नहीं करते हैं।

CURATEEVO अलग है। यह एक स्मार्ट, विकसित होने वाले संपादक (evolving editor) की तरह कार्य करता है। केवल डेटा चुनने के बजाय, यह डेटा चुनने के नियमों को लिखता है और उन्हें फिर से लिखता है।

CURATEEVO कैसे काम करता है: "अभ्यास चक्र" (The Practice Loop)

CURATEEVO को एक कोच के रूप में सोचें जो एक निरंतर फीडबैक लूप चलाता है:

  1. ट्रायल रन (परीक्षण दौड़): कोच वर्तमान "प्रशिक्षण नियमावली" (डेटा क्यूरेशन नियम) लेता है और रोबोट को परीक्षण प्रश्नों (एक "होल्ड-आउट" डेवलपमेंट सेट) पर अभ्यास करने के लिए देता है।
  2. विफलता रिपोर्ट: जब रोबोट विफल होता है, तो कोच केवल स्कोर नोट नहीं करता है। वे विश्लेषण करते हैं कि क्यों वह विफल हुआ। क्या उसने गलत उपकरण चुना? क्या वह एक चरण भूल गया? क्या वह लंबी बातचीत से भ्रमित हो गया?
  3. नियमों को फिर से लिखना (विकास/Evolution): कोच फिर उस कंप्यूटर कोड के पास जाता है जो यह तय करता है कि किस डेटा का उपयोग किया जाए। वे उस विशिष्ट समस्या को ठीक करने के लिए जो चरण 2 में पाई गई थी, उस कोड को फिर से लिखते हैं।
    • यदि रोबलेट एक विशिष्ट उपकरण का उपयोग करना सीखने में विफल रहा, तो कोड को प्रशिक्षण डेटा में उस उपकरण के अधिक उदाहरण जोड़ने के लिए अपडेट किया जाता है।
    • यदि रोबोट बहुत अधिक शोर (noise) के कारण भ्रमित हुआ, तो कोड को उन अस्त-व्यस्त उदाहरणों को बाहर निकालने के लिए अपडेट किया जाता है।
    • यदि रोबोट लंबे, बेकार चरणों में समय बर्बाद कर रहा था, तो कोड को प्रशिक्षण को तेज़ बनाने के लिए उन चरणों को काटने के लिए अपडेट किया जाता है।
  4. दोहराना: यह बार-बार होता है। हर दौर के साथ, "प्रशिक्षण नियमावली" रोबोट की विशिष्ट कमजोरियों के लिए अधिक अनुकूलित होती जाती है।

दो मुख्य लक्ष्य: प्रभावशीलता और दक्षता

पेपर कहता है कि CURATEEVO दो चीजों को संतुलित करता है, जैसे एक शेफ एक ऐसे व्यंजन को बनाने की कोशिश करता है जो स्वादिष्ट भी हो और जल्दी भी बने:

  • प्रभावशीलता (इसे स्वादिष्ट बनाना): सिस्टम देखता है कि रोबोट कहाँ विफल होता है और उन विशिष्ट कमियों को भरने के लिए डेटा जोड़ता है या उसे परिष्कृत करता है। यह सुनिश्चित करता है कि रोबलेट वही सीखे जो उसे जानने की आवश्यकता है।
  • दक्षता (इसे त्वरित बनाना): सिस्टम प्रशिक्षण डेटा को देखता है और पूछता है, "क्या यह आवश्यक है?" यदि रोबोट पहले ही एक अवधारणा सीख चुका है, या यदि कोई प्रशिक्षण उदाहरण बहुत लंबा और दोहराव वाला है, तो CURATEEVO उसे काट देता है। यह रोबोट के प्रदर्शन को नुकसान पहुँचाए बिना समय और कंप्यूटिंग शक्ति बचाता है।

परिणाम: बेहतर रोबोट, कम बर्बादी

शोधकर्ताओं ने तीन अलग-अलग प्रकार की रोबोट चुनौतियों (benchmarks) पर दो प्रकार के डेटा का उपयोग करके इस प्रणाली का परीक्षण किया:

  1. लेबल वाला डेटा (Labeled Data): स्वच्छ, मानव-एनोटेटेड लॉग्स (जैसे एक पाठ्यपुस्तक)।
  2. वाइल्ड डेटा (Wild Data): वास्तविक उपयोगकर्ता इंटरैक्शन से प्राप्त अस्त-व्यस्त, वास्तविक दुनिया के लॉग्स (जैसे एक अराजक डायरी)।

निष्कर्ष स्पष्ट थे:

  • बेहतर स्कोर: CURATEEVO के साथ प्रशिक्षित रोबोटों ने पुराने, स्थिर तरीकों की तुलना में काफी उच्च स्कोर (औसतन लगभग 3 से 4 अंक बेहतर) प्राप्त किया।
  • अस्त-व्यस्त डेटा पर काम करता है: भले ही इनपुट डेटा "वाइल्ड" और शोर वाला था, CURATEEVO इसे उच्च-गुणवत्ता वाली प्रशिक्षण सामग्री में फिल्टर और परिष्कृत करने में सक्षम था।
  • तेज़ प्रशिक्षण: अनावश्यक चरणों को काटकर, CURATEEVO ने अन्य तरीकों की तुलना में रोबोट को प्रशिक्षित करने के लिए आवश्यक समय और कंप्यूटिंग शक्ति को लगभग 50% कम कर दिया।
  • सार्वभौमिक (Universal): यह इस बात पर निर्भर नहीं था कि रोबोट के लिए कौन सा विशिष्ट प्रशिक्षण नुस्खा (एल्गोरिदम) उपयोग किया जा रहा है; यह हर जगह अच्छी तरह से काम करता है।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि डेटा तैयारी को एक बार के, निश्चित चरण के रूप में देखने के बजाय, हमें इसे एक गतिशील, विकसित होने वाली प्रक्रिया के रूप में देखना चाहिए। डेटा क्यूरेशन रणनीति को रोबोट की विफलताओं से सीखने और अपने स्वयं के नियमों को फिर से लिखने की अनुमति देकर, हम स्मार्ट, अधिक कुशल AI एजेंट बना सकते हैं जो जटिल, वास्तविक दुनिया की समस्याओं को हल करने में बेहतर होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →