← नवीनतम पेपर
💬 NLP

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

यह शोध पत्र TRACE Bench को प्रस्तुत करता है, जो एक कार्य-संचालित एजेंटिक चेकलिस्ट मूल्यांकन ढांचा है जो भूमिका प्रोफाइलों को सत्यापन योग्य मदों में विभाजित करता है ताकि पारदर्शी, साक्ष्य-आधारित स्कोरिंग प्रदान की जा सके और मौजूदा फ्री-डायलॉग बेंचमार्क की तुलना में भूमिका आवश्यकताओं का लगभग पूर्ण कवरेज प्राप्त किया जा सके।

मूल लेखक: Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

प्रकाशित 2026-08-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को किसी विशिष्ट पात्र की तरह व्यवहार करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक चिड़चिड़ा जादूगर या एक हंसमुख बरिस्ता। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "रोलप्ले" (roleplay) कहा जाता है। लंबे समय तक, वैज्ञानिकों ने इन रोबोट्स का परीक्षण करने के लिए उनसे "आपका नाम क्या है?" या "आपको क्या खाना पसंद है?" जैसे सरल प्रश्न पूछे। यह एक छात्र के होमवर्क की जांच करने जैसा है जहाँ आप केवल उनकी वर्तनी (spelling) देखते हैं। यह ग्रेड देना आसान है, लेकिन इससे आपको यह पता नहीं चलता कि क्या छात्र वास्तव में बातचीत कर सकता है या जटिल होने पर भी अपने पात्र पर टिका रह सकता है।

बेहतर करने के लिए, शोधकर्ताओं ने रोबोट्स को आपस में स्वतंत्र रूप से चैट करने के लिए कहना शुरू किया, इस उम्मीद में कि एक लंबी बातचीत यह प्रकट कर देगी कि क्या रोबोट वास्तव में अपनी भूमिका निभा रहा है। लेकिन यह एक ऐसे नाटक को देखने जैसा है जहाँ अभिनेता अपने संवाद भूल जाते हैं और बस कुछ भी बना लेते हैं; आप एक मजेदार शो तो देख सकते हैं, लेकिन आपको पता नहीं चलेगा कि क्या उन्होंने वास्तव में पटकथा का पालन किया है। बड़ा सवाल यह था कि: हम बिना किसी अस्पष्ट भावना के अनुमान लगाए, यह कैसे जान सकते हैं कि एक रोबट वास्तव में अपनी भूमिका पर टिका हुआ है, अपने रहस्यों को याद रख रहा है, और अपने नियमों का पालन कर रहा है?

यहाँ आता है TRACE BENCH, रोलप्ले रोबोट्स को परखने का एक नया तरीका जो इस प्रक्रिया को जादू के खेल के बजाय एक जासूस द्वारा केस सुलझाने की तरह मानता है। रोबोट को केवल "10 में से 8" जैसा एकल स्कोर देने के बजाय, यह विधि रोबोट के काम को कार्यों की एक विशिष्ट चेकलिस्ट में तोड़ देती है। इसे एक वीडियो गेम की तरह समझें जहाँ खिलाड़ी को उद्देश्यों की एक सूची पूरी करनी होती है: "पात्र में बने रहना," "संबंध को याद रखना," "दुनिया के नियमों को जानना," और "लक्ष्य का पालन करना।"

यह शोध पत्र एक चतुर प्रणाली पेश करता है जहाँ एक "यूजर एजेंट" (एक स्मार्ट AI जो एक मानव खिलाड़ी के रूप में कार्य करता है) रोबोट से बात करता है। लेकिन यहाँ एक मोड़ है: यूजर एजेंट के पास एक गुप्त चेकलिस्ट होती है। जैसे-जैसे वे चैट करते हैं, यूजर एजेंट चुपचाप सूची के आइटम्स को टिक करता जाता है। यदि रोबोट कोई विवरण भूल जाता है, तो यूजर एजेंट यह देखने के लिए एक फॉलो-अप प्रश्न पूछ सकता है कि क्या रोबोट को याद है। यदि रोबोट पात्र से बाहर होता है, तो यूजर एजेंट उसे तुरंत नोट कर लेता है। अंत में, स्कोर केवल एक अनुमान नहीं होता; यह एक गणितीय समस्या होती है जो ठीक इस बात पर आधारित होती है कि रोबोट ने कितने चेकलिस्ट आइटम्स पूरे किए, जिसके पीछे सबूत (चैट लॉग्स) भी होते हैं।

शोधकर्ताओं ने पाया कि पुराने तरीके में रोबोट्स को केवल स्वतंत्र रूप से चैट करने देने से वास्तव में बहुत सी महत्वपूर्ण चीजें छूट जाती थीं। जब उन्होंने 95 मौजूदा फ्री-चैट बातचीत का विश्लेषण किया, तो उन्होंने पाया कि 102 संदेशों के बाद भी, रोबोट्स ने भूमिका की महत्वपूर्ण आवश्यकताओं का केवल 73.74% ही कवरेज किया था। बातचीत अक्सर साइड स्टोरीज की ओर भटक जाती थी, जिससे मुख्य नियम अनपरीक्षित रह जाते थे। हालाँकि, जब उन्होंने स्मार्ट यूजर एजेंट के साथ TRACE BENCH विधि का उपयोग किया, तो वे कम टर्न (केवल 65 संदेशों) में 99.91% आवश्यकताओं को कवर करने में सफल रहे। यूजर एजेंट एक कुशल साक्षात्कारकर्ता की तरह था जिसे पता था कि रोबोट के असली स्वभाव को उजागर करने के लिए कौन से प्रश्न पूछने हैं।

शोध पत्र ने यह भी परीक्षण किया कि क्या यह प्रणाली निष्पक्ष और विश्वसनीय है। उन्होंने एक ही परीक्षण को कई बार चलाया और यहाँ तक कि यूजर एजेंट को विभिन्न AI मॉडल्स के साथ बदल दिया। परिणाम सुसंगत रहे, जिससे पता चला कि रोबोट की रैंकिंग केवल संयोग या पूछने वाले के बदलने से नहीं बदली। उन्होंने एक "क्लोज्ड-लूप" (Closed-Loop) प्रणाली भी बनाई, जहाँ परीक्षण अपनी गलतियों से सीखता है। यदि कोई रोबोट किसी विशिष्ट प्रकार के प्रश्न में विफल रहता है, तो सिस्टम उस ट्रिक को याद रखेगा और भविष्य के परीक्षणों में इसे फिर से उपयोग करेगा ताकि यह देखा जा सके कि क्या रोबोट में सुधार हुआ है। जब उन्होंने इसे 26 अलग-अलग मॉडल्स पर लागू किया, तो नए, स्मार्ट टेस्टों ने वास्तव में रोबोट्स को बदतर दिखाया (उनके स्कोर को औसतन 8.48 अंक कम कर दिया), जिससे यह साबित हुआ कि पुराने टेस्ट बहुत आसान थे और नए टेस्ट खामियों को खोजने में कहीं बेहतर थे।

संक्षेप में, TRACE BENCH सुझाव देता है कि यह जानने के लिए कि क्या कोई AI एक अच्छा अभिनेता है, आप केवल शो नहीं देख सकते; आपको एक स्क्रिप्ट, एक चेकलिस्ट और एक निर्देशक की आवश्यकता है जो जानता हो कि वास्तव में क्या देखना है। रोलप्ले मूल्यांकन को एक ट्रैसेबल (traceable), साक्ष्य-आधारित प्रक्रिया में बदलकर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो आपको केवल यह नहीं बताता कि रोबोट ने कैसे प्रदर्शन किया, बल्कि यह भी बताता है कि वह क्यों सफल हुआ या विफल हुआ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →