← नवीनतम पेपर
🤖 AI

ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

यह शोध पत्र ARCO का प्रस्ताव करता है, जो एक साझा मॉडल बैकबोन के भीतर प्रति-चरण रूब्रिक मानदंडों के लिए एक जनरेशन हेड और चरण-स्तरीय पुरस्कारों के लिए एक स्कोरिंग हेड को सह-विकसित (co-evolves) करता है, जो चरण-स्तरीय लेबल या स्थिर क्लोज्ड-सोर्स जजों की आवश्यकता के बिना गतिशील क्रेडिट असाइनमेंट और बेहतर मल्टी-स्टेप एजेंट प्रदर्शन को सक्षम बनाता है।

मूल लेखक: Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल रहस्य सुलझाना सिखा रहे हैं, जैसे कि एक बहु-चरणीय जासूसी कहानी। रोबोट को सुराग खोजने, कड़ियों को जोड़ने और अंत में एक उत्तर देने की आवश्यकता है।

अतीत में, इन रोबोटों को सिखाना एक बहुत ही सख्त रेफरी के साथ "हॉट और कोल्ड" (पास या दूर) खेलने जैसा था।

  • पुराना तरीका: रोबोट पूरे रहस्य को सुलझाने की कोशिश करता। यदि वह अंतिम उत्तर सही देता, तो रेफरी उसे "अच्छा काम किया!" (एक उच्च स्कोर) देता। यदि वह गलत होता, तो रेफरी उसे "बुरा काम किया!" (एक कम स्कोर) देता।
  • समस्या: रोबोट को यह पता नहीं चलता था कि वह क्यों विफल हुआ। क्या उसने गलत सवाल पूछा? क्या उसने किसी सुराग को अनदेखा कर दिया? क्या उसने बहुत जल्दी अनुमान लगा लिया? रेफरी बस "गलत" कहकर छोड़ देता, जिससे रोबोट केवल अंदाज़ा लगाता कि क्या गलत हुआ। यह एक छात्र को गणित के चरणों में हुई विशिष्ट गलतियों पर शिक्षक की टिप्पणी के बिना केवल एक लाल "F" ग्रेड प्राप्त करने जैसा है।

ARCO से मिलिए: एक "सह-विकसित" (Co-Evolving) कोच

यह पेपर ARCO (Adaptive Rubric CO-evolution) को पेश करता है, जो इन AI एजेंटों को प्रशिक्षित करने का एक नया तरीका है। ARCO को केवल एक एकल रेफरी के रूप में नहीं, बल्कि एक स्मार्ट कोच के रूप में सोचें जो छात्र को काम करते हुए देखते हुए अपना स्वयं का ग्रेडिंग रूब्रिक (मूल्यांकन पद्धति) लिखता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "समान-स्तर" का कोच और छात्र

आमतौर पर, हम रोबोट को ग्रेड देने के लिए एक अत्यंत बुद्धिमान, महंगे "ब्लैक बॉक्स" जज (जैसे कि एक विशाल, बंद-स्रोत AI) का उपयोग करते हैं। लेकिन वह जज स्थिर है; वह सीखता नहीं है।
ARCO एक कोच (रूब्रिक मॉडल) का उपयोग करता है जो छात्र रोबोट के समान आकार और "मस्तिष्क शक्ति" का होता है। वे भागीदार हैं। जैसे-जैसे छात्र बेहतर होता है, कोच भी ग्रेडिंग करने में बेहतर होता जाता है। वे एक साथ बढ़ते हैं।

2. चेकलिस्ट लिखना (द रूब्रिक)

केवल एक स्कोर देने के बजाय, कोच रोबोट द्वारा उठाए गए प्रत्येक कदम के लिए एक चेकलिस्ट लिखता है।

  • चरण 1: रोबोट "सर्गेई टोकारेव कौन है?" के लिए खोज करता है।
  • कोच की चेकलिस्ट: "क्या रोबोट ने सही व्यक्ति की खोज की? क्या इसने यादृच्छिक लोगों की खोज करने से खुद को बचाया? क्या इसे पर्याप्त सबूत मिले?"
  • चरण 2: रोबोट "उसका विश्वविद्यालय कब स्थापित हुआ था?" के लिए खोज करता है।
  • कोच की नई चेकलिस्ट: "क्या रोबोट को समझ आया कि उसे पहले विश्वविद्यालय का नाम चाहिए? क्या इसने असंबंधित तथ्यों की खोज करना बंद कर दिया?"

कोच हर एक चाल के लिए एक नया चेकलिस्ट लिखता है क्योंकि गलतियाँ बदलती रहती हैं जैसे-जैसे रोबोट सीखता है। शुरुआत में, रोबोट गलत व्यक्ति की खोज कर सकता है। बाद में, वह सही व्यक्ति की खोज कर सकता है लेकिन गलत तरीके से। एक स्थिर चेकलिस्ट सभी विकसित होती गलतियों को नहीं पकड़ सकती, लेकिन ARCO का कोच हर बार एक ताज़ा चेकलिस्ट लिखता है।

3. "हिस्सों का योग" का नियम

यही जादू का मंत्र है। कोच चरणों को बेतरतीब ढंग से ग्रेड नहीं करता है। कोच को एक स्वर्णिम नियम सिखाया जाता है: सभी चरणों के स्कोर का योग अंतिम परिणाम के बराबर होना चाहिए।

  • यदि रोबच रहस्य को पूरी तरह से सुलझा लेता है (अंतिम स्कोर = 100), तो कोच को अच्छे चरणों को उच्च स्कोर और बुरे चरणों को कम स्कोर देने का तरीका खोजना होगा ताकि वे 100 तक पहुँच सकें।
  • यदि वह विफल हो जाता है (अंतिम स्कोर = 0), तो कोच को यह पता लगाना होगा कि किन विशिष्ट चरणों ने स्कोर को नीचे गिराया।

यह कोच को यह समझने के लिए मजबूर करता है कि रोबोट कहाँ गलत हुआ, भले ही उसे कोई इंसान यह न बताए कि "चरण 3 खराब था।" कोच अंतिम परिणाम को छोटे, निष्पक्ष हिस्सों में तोड़ना सीख जाता है।

4. सह-विकास का नृत्य (The Dance of Co-Evolution)

सबसे अनूठा हिस्सा यह है कि छात्र और कोच दोनों को एक ही समय में अपडेट किया जाता है।

  • छात्र पहेली सुलझाने की कोशिश करता है।
  • कोच देखता है, चेकलिस्ट लिखता है, और स्कोर देता है।
  • छात्र स्कोर से सीखता है और स्मार्ट बनता है।
  • क्योंकि छात्र अब स्मार्ट है, वह नए प्रकार की गलतियाँ करता है (वह अब शुरुआती गलतियाँ नहीं कर रहा है)।
  • कोच इन नई गलतियों को देखता है और उन्हें पकड़ने के लिए अपनी चेकलिस्ट को अपडेट करता है।

यह एक नृत्य की तरह है जहाँ साथी (कोच) लगातार डांसर (छात्र) के कदमों के साथ तालमेल बिठाने के लिए अपने कदम समायोजित करता है। यदि छात्र एक शानदार स्पिन (घूमना) शुरू करता है, तो कोच केवल बुनियादी कदमों को नहीं, बल्कि उस स्पिन को ग्रेड करना सीख जाता है।

यह बेहतर क्यों है?

  • कोई ब्लैक बॉक्स नहीं: यह काम को ग्रेड करने के लिए किसी रहस्यमय, अपरिवर्तनीय विशाल AI पर निर्भर नहीं है। यह एक पारदर्शी, ओपन-सोर्स मॉडल का उपयोग करता है जो साधारण भाषा में अपने तर्क समझाता है।
  • चरण-दर-चरण स्पष्टता: यह रोबोट को ठीक से बताता है कि कौन सा चरण अच्छा था या बुरा, बजाय इसके कि केवल यह कहे कि "आप पूरे मामले में विफल रहे।"
  • अनुकूलन क्षमता: जैसे-जैसे रोबोट बेहतर होता है, ग्रेडिंग मानदंड अधिक परिष्कृत होते जाते हैं, जो उन सूक्ष्म त्रुटियों को पकड़ लेते हैं जिन्हें एक निश्चित चेकलिस्ट मिस कर सकती थी।

संक्षेप में, ARCO प्रशिक्षण प्रक्रिया को "मैंने क्या गलत किया इसका अंदाज़ा लगाओ" वाले खेल से बदलकर एक स्पष्ट, चरण-दर-चरण ट्यूटोरियल में बदल देता है जहाँ शिक्षक और छात्र एक साथ सीखते हैं, और जैसे-जैसे वे आगे बढ़ते हैं, खेल के नियमों को लगातार परिष्कृत करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →