← नवीनतम पेपर
🤖 AI

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach एक स्व-विकसित रूब्रिक फ्रेमवर्क है जो वास्तविक रोलआउट्स से प्रक्रिया-उन्मुख मानदंडों को व्युत्पन्न करके LLM एजेंटों के मूल्यांकन और प्रशिक्षण में सुधार करता है ताकि कौशल चयन, अनुपालन, संयोजन और प्रतिबिंब का आकलन किया जा सके, जिससे वास्तविक प्रक्रिया गुणवत्ता को आकस्मिक कार्य सफलता से अलग किया जा सके।

मूल लेखक: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फैक्ट्री में एक जटिल मशीन चलाने के लिए एक नया कर्मचारी रख रहे हैं। आपके पास हर संभव काम के लिए निर्देश पुस्तिकाओं (निर्देशों/कौशल) का एक विशाल पुस्तकालय है। इनमें से कुछ मैनुअल गोल्ड स्टैंडर्ड (Gold Standard) हैं (काम करने का सही तरीका), जबकि कुछ डिस्ट्रैक्टर (Distractors) हैं (एक जैसे दिखने वाले मैनुअल जो गलत हैं या अलग मशीनों के लिए हैं)।

समस्या यह है कि भले ही कर्मचारी काम पूरा कर ले और मशीन काम करने लगे (अंतिम परिणाम), उसने इसे गलत तरीके से किया हो सकता है: शायद उसने गलत मैनुअल चुना, किसी सुरक्षा चरण को छोड़ दिया, या किस्मत के सहारे प्रक्रिया के माध्यम से अपना रास्ता खोज लिया। यदि आप केवल यह देखते हैं कि मशीन काम कर रही है, तो आप वास्तव में एक ऐसे व्यक्ति को काम पर रख सकते हैं जो खतरनाक या अक्षम है।

SkillCoach एक नया सिस्टम है जिसे इस समस्या को ठीक करने के लिए बनाया गया है। केवल अंतिम परिणाम की जांच करने के बजाय, यह एक स्व-सुधार करने वाले सुपरवाइजर (self-improving supervisor) की तरह काम करता है जो कर्मचारी की पूरी प्रक्रिया को चरण-दर-चरण देखता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "किस्मत" बनाम "कौशल"

अतीत में, AI एजेंटों का मूल्यांकन केवल इस आधार पर किया जाता था कि क्या उन्हें सही उत्तर मिला।

  • दोष: एक एजेंट गलत उपकरण चुन सकता है, तीन सुरक्षा जांच छोड़ सकता है, और फिर गलती से सही उत्तर तक पहुँच सकता है।
  • उपमा: कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है। उसे सही उत्तर मिल जाता है, लेकिन उसने गलत फॉर्मूला लिखा, सही वाले को मिटाया, और फिर संख्या का अनुमान लगा लिया। यदि आप केवल अंतिम उत्तर देखते हैं, तो आप सोचते हैं कि वह एक जीनियस है। यदि आप उसके रफ वर्क (प्रक्रिया) को देखते हैं, तो आप देखते हैं कि वह वास्तव में भ्रमित है।

2. समाधान: "स्व-विकसित होने वाला रूब्रिक" (The "Self-Evolving Rubric")

SkillCoach एक रूब्रिक (Rubric) (एक विस्तृत ग्रेडिंग चेकलिस्ट) बनाता है जो केवल उत्तर नहीं देखता। यह काम को चार विशिष्ट आदतों में विभाजित करता है:

  1. चयन (Selection): क्या उन्होंने लाइब्रेरी से सही मैनुअल चुना, या उन्होंने एक मिलता-जुलता डिस्ट्रैक्टर उठा लिया?
  2. अनुसरण (Following): क्या उन्होंने मैनुअल के चरणों का ठीक से पालन किया, या उन्होंने कुछ हिस्से छोड़ दिए?
  3. संरचना (Composition): यदि उन्होंने दो मैनुअल का उपयोग किया, तो क्या उन्होंने उन्हें सही क्रम में रखा?
  4. चिंतन (Reflection): "सबमिट" करने से पहले, क्या उन्होंने नियमों के विरुद्ध अपने काम की दोबारा जांच की?

"स्व-विकसित होने वाला" भाग:
शुरुआत में, सिस्टम की चेकलिस्ट केवल एक ड्राफ्ट होती है। जैसे-जैसे AI कार्य करने की कोशिश करता है, SkillCoach देखता है कि वह कहाँ विफल होता है। इसके बाद, यह अगली बार उन विशिष्ट गलतियों को बेहतर ढंग से पकड़ने के लिए अपनी चेकलिस्ट को अपडेट करता है।

  • उपमा: एक शिक्षक के बारे में सोचें जो एक टेस्ट लिखता है। छात्रों के पहले बैच को ग्रेड करने के बाद, शिक्षक को एहसास होता है, "ओह, आधे छात्रों ने इस विशिष्ट नियम को मिस कर दिया।" फिर शिक्षक अगले बैच के लिए उस नियम को अधिक स्पष्ट बनाने के लिए अपने ग्रेडिंग रूब्रिक को फिर से लिखता है। सिस्टम खुद को ग्रेड करने में अधिक स्मार्ट होता जाता है।

3. "डिस्ट्रैक्टर" चुनौती

वास्तविक दुनिया की फैक्ट्रियां (या एंटरप्राइज सॉफ्टवेयर) साफ-सुथरी नहीं होती हैं। उनके पास हजारों मैनुअल होते हैं, जिनमें से कई एक जैसे दिखते हैं।

  • SkillCoach AI का परीक्षण एक "शोर वाले" (noisy) वातावरण में करता है जहाँ सही मैनुअल को 2 असंबंधित और 3 बहुत मिलते-जुलते लेकिन गलत मैनुअल के साथ मिला दिया जाता है।
  • निष्कर्ष: बहुत बुद्धिमान AI मॉडल भी अक्सर गलत मैनुअल उठा लेते हैं जब लाइब्रेरी बड़ी हो जाती है। वे अंततः काम पूरा कर सकते हैं, लेकिन उन्होंने समय बर्बाद किया या जोखिम उठाया। SkillCoach इस "बुरे व्यवहार" को पकड़ लेता है, भले ही अंतिम परिणाम ठीक लग रहा हो।

4. यह क्यों महत्वपूर्ण है: बेहतर प्रशिक्षण

पेपर दिखाता है कि यदि आप प्रशिक्षण डेटा को फ़िल्टर करने के लिए SkillCoach का उपयोग करते हैं, तो आपको बहुत बेहतर AI प्राप्त होता है।

  • पुराना तरीका: AI को किसी भी प्रयास पर प्रशिक्षित करें जिसने सही उत्तर प्राप्त किया। (परिणाम: AI अनुमान लगाना और चरणों को छोड़ना सीख जाता है)।
  • SkillCoach का तरीका: केवल उन प्रयासों पर AI को प्रशिक्षित करें जिन्होंने सही उत्तर प्राप्त किया और एकदम सही प्रक्रिया का पालन किया।
  • परिणाम: AI एक भरोसेमंद कार्यकर्ता बनना सीखता है जो नियमों का पालन करता है, न कि केवल एक भाग्यशाली अनुमान लगाने वाला।

सारांश

SkillCoach एक ऐसा सिस्टम है जो AI एजेंटों को केवल "क्या वे जीते?" के आधार पर आंकना बंद करता है और यह पूछना शुरू करता है कि "क्या उन्होंने निष्पक्ष खेल खेला और नियमों का पालन किया?" यह एक स्मार्ट ग्रेडिंग सिस्टम बनाता है जो सीखने के साथ विकसित होता है, यह सुनिश्चित करता है कि AI एजेंट केवल भाग्यशाली न हों, बल्कि वास्तव में अपने उपकरणों का सही ढंग से उपयोग करना सीखें, भले ही उपकरणों का पुस्तकालय अव्यवस्थित और जालों से भरा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →