SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution
यह शोध पत्र SkillTV-Bench प्रस्तुत करता है, जो LLM एजेंटों में स्किल-अवेयर ट्रजेक्टरी वेरिफिकेशन के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, साथ ही SkillTV-Evolve भी प्रस्तुत करता है, जो पुन: प्रयोज्य जज स्किल्स (reusable judge skills) को परिष्कृत करने वाली एक विधि है जो वेरिफिकेशन सटीकता और ट्रजेक्टरी चयन सफलता दर दोनों में महत्वपूर्ण सुधार करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल आपसे बातें ही नहीं करते, बल्कि वास्तव में काम भी करते हैं। वे फाइलें खोल सकते हैं, कोड लिख सकते हैं, वेब ब्राउज़ कर सकते हैं, और यहाँ तक कि जटिल, बहु-चरणीय समस्याओं को हल करने के लिए रोबोट को भी नियंत्रित कर सकते हैं। इन्हें "AI एजेंट्स" कहा जाता है। लेकिन यहाँ एक पेचीदा बात है: जब एक AI एजेंट किसी टूटी हुई वेबसाइट को ठीक करने या यात्रा की योजना बनाने की कोशिश करता है, तो वह आपको केवल एक अंतिम उत्तर नहीं देता है। वह एक लंबी यात्रा तय करता है, जिसमें सैकड़ों छोटे कदम उठाए जाते हैं, टूल्स का उपयोग किया जाता है, और रास्ते में अपने काम की जाँच की जाती है।
बड़ा सवाल वैज्ञानिकों के लिए यह है: हमें कैसे पता चलेगा कि AI ने वास्तव में अच्छा काम किया है? अतीत में, हम केवल अंतिम परिणाम देखते थे। यदि वेबसाइट ठीक दिख रही थी, तो हम कहते थे "बहुत बढ़िया!" लेकिन क्या होगा यदि AI ने शॉर्टकट लेकर लक्ष्य प्राप्त किया हो, या यदि उसने गलत चीज़ को ठीक किया और इस प्रक्रिया में कुछ और ही तोड़ दिया हो? हमें केवल फिनिश लाइन को नहीं, बल्कि पूरी यात्रा को देखने के तरीके की आवश्यकता है। यहीं पर "जज" (judges) आते हैं—विशेष AI सिस्टम जिन्हें एजेंट के काम की समीक्षा करने के लिए प्रशिक्षित किया गया है। लेकिन ये जज वर्तमान में संघर्ष कर रहे हैं। वे अक्सर चमकदार अंतिम उत्तरों से भ्रमित हो जाते हैं और उन छिपी हुई गलतियों को मिस कर देते हैं जो प्रक्रिया के दौरान हुई थीं, विशेष रूप से तब जब एजेंट अपने विशेष "कौशलों" (जैसे कि पूर्व-प्रोग्राम किए गए ट्रिक्स का एक टूलबॉक्स) का उपयोग कर रहा हो।
यह शोध पत्र इन जजों को टेस्ट और ट्रेन करने का एक नया तरीका पेश करता है। शोधकर्ताओं ने एक विशाल खेल का मैदान बनाया जिसे SkillTV-Bench कहा जाता है, जो एक विशाल टीवी शो मैराथन की तरह है जिसमें 681 अलग-अलग एपिसोड शामिल हैं, जहाँ AI एजेंट साइबर सुरक्षा से लेकर खाना पकाने तक, 11 विभिन्न क्षेत्रों में वास्तविक दुनिया के कार्यों को हल करने की कोशिश कर रहे हैं। ट्विस्ट यह है कि जज केवल एक वीडियो नहीं देख रहे हैं; उन्हें एजेंट का "कौशल मैनुअल" (skills manual) और एजेंट द्वारा बनाई गई वास्तविक फाइलों और लॉग्स तक पहुँच दी गई है। यह उन्हें ठीक से देखने देता है कि एजेंट को क्या करना चाहिए था और क्या उसने नियमों का पालन किया या नहीं।
टीम ने पाया कि यहाँ तक कि सबसे स्मार्ट वर्तमान जज भी उलझ रहे हैं। वे अक्सर उन एजेंटों को "पास" कह देते हैं जो सतह पर तो अच्छे दिखते हैं लेकिन वास्तव में मिशन में विफल रहे होते हैं। इसे ठीक करने के लिए, लेखकों ने एक सिस्टम बनाया जिसे SkillTV-Evolve कहा जाता है। इसे एक "कोच" के रूप में समझें जो जज के लिए काम करता है। केवल अनुमान लगाने के बजाय, जज को एक गतिशील चेकलिस्ट (जिसे "JudgeSkill" कहा जाता है) दी जाती है जो उसे ठीक से बताती है कि क्या देखना है, कहाँ देखना है, और कौन सा प्रमाण साबित करता है कि एजेंट सफल हुआ या विफल। यदि जज कोई गलती करता है, तो सिस्टम स्वचालित रूप से चेकलिस्ट को फिर से लिख देता है ताकि अगली बार उस त्रुटि को रोका जा सके।
परिणाम प्रभावशाली थे। इस विकसित होती चेकलिस्ट का उपयोग करके, जज की सटीकता लगभग 15 प्रतिशत अंक बढ़ गई। लेकिन असली जादू तब हुआ जब उन्होंने इस बेहतर जज का उपयोग AI एजेंटों के एक समूह में से सबसे अच्छे प्रयासों को चुनने के लिए किया। कल्पना कीजिए कि एक AI एक पहेली को 10 बार हल करने की कोशिश कर रहा है और 10 अलग-अलग प्रयास उत्पन्न कर रहा है। एक बुरा जज एक "नकली" सफलता को चुन सकता है, लेकिन यह नया, कौशल-जागरूक (skill-aware) जज वास्तविक सफलता को पहचान सकता है। इस बेहतर जज के साथ, टीम 10 प्रयासों में से एक सफल समाधान को 45.5% बार चुनने में सक्षम थी, जबकि एक एकल प्रयास या कमजोर जज के साथ यह केवल 22.9% था।
संक्षेप में, यह शोध पत्र सुझाव देता है कि AI एजेंटों पर भरोसा करने के लिए, हमें ऐसे जजों की आवश्यकता है जो केवल अंतिम फोटो को न देखें, बल्कि पूरे एल्बम का निरीक्षण करें, और नकली चीज़ों को पहचानने के लिए एजेंट के अपने निर्देश मैनुअल का उपयोग करें। इन जजों को एक बेहतर "नियम पुस्तिका" देकर जो अपनी गलतियों से सीखती है, हम AI को जटिल, वास्तविक दुनिया के कार्यों के लिए बहुत अधिक विश्वसनीय बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।