Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents
यह शोध पत्र प्रॉक्सी स्टेट-बेस्ड इवैल्यूएशन (Proxy State-Based Evaluation) को प्रस्तुत करता है, जो एक LLM-संचालित सिमुलेशन फ्रेमवर्क है जो इंटरेक्शन ट्रेसेस से स्ट्रक्चर्ड प्रॉक्सी स्टेट्स का अनुमान लगाकर मल्टी-टर्न टूल-कॉलिंग एजेंट्स के स्केलेबल और विश्वसनीय मूल्यांकन को सक्षम बनाता है, जिससे लागत प्रभावी डिटर्मिनिस्टिक बैकएंड्स का एक व्यावहारिक विकल्प मिलता है और मॉडल रैंकिंग एवं ऑन-पॉलिसी ट्रेनिंग दोनों को समर्थन मिलता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए कर्मचारी (AI एजेंट) को जटिल ग्राहक अनुरोधों को संभालना सिखाने की कोशिश कर रहे हैं, जैसे कि जूतों की एक आदर्श जोड़ी खोजना या बैंक खाता प्रबंधित करना। इसे करने के लिए, आपको उन्हें टेस्ट करने का एक तरीका चाहिए।
पुराना तरीका: एक पूर्ण, महंगा सिमुलेशन बनाना
परंपरागत रूप से, इन AI एजेंटों को टेस्ट करने के लिए, कंपनियां एक "पूर्ण दुनिया" का सिमुलेशन बनाती थीं। इसे एक बैंक या स्टोर के पूर्ण-स्तरीय, कामकाजी मॉडल बनाने जैसा समझें जिसमें वास्तविक पैसा, वास्तविक इन्वेंट्री और सख्त नियम हों।
- समस्या: इस "पूर्ण दुनिया" को बनाना अविश्वसनीय रूप से महंगा और धीमा है। यह एक डिलीवरी ड्राइवर को टेस्ट करने के लिए एक नकली शहर बनाने के लिए इंजीनियरों की एक टीम को काम पर रखने जैसा है। यदि आप टेस्ट बदलना चाहते हैं (जैसे, "क्या होगा यदि ग्राहक के पास पैसे न हों?"), तो आपको पूरे नकली शहर के कोड को फिर से लिखना होगा। पेपर में उल्लेख किया गया है कि एक ऐसे सिस्टम को इंजन चलाने के लिए लगभग 1,00,000 लाइनों के कोड और एक साल से अधिक के काम की आवश्यकता थी।
नया तरीका: "प्रॉक्सि स्टेट" (द स्मार्ट स्क्रिप्ट)
इस पेपर के लेखक एक स्मार्ट और तेज़ तरीका प्रस्तावित करते हैं जिसे प्रॉक्सि स्टेट-बेस्ड इवैल्यूएशन (Proxy State-Based Evaluation) कहा जाता है। एक नकली शहर बनाने के बजाय, वे एक नाटक चलाने के लिए बहुत ही बुद्धिमान AI "डायरेक्टर्स" की एक टीम का उपयोग करते हैं।
यहाँ एनालॉजी (उपमा) कैसे काम करती है:
- परिदृश्य (द स्क्रिप्ट):
एक डेटाबेस के बजाय, वे एक विस्तृत स्क्रिप्ट लिखते हैं। यह स्क्रिप्ट कहती है:
- ग्राहक कौन है? (जैसे, सारा, जिसे सफेद जूते पसंद हैं)।
- लक्ष्य क्या है? (जैसे, उसके लिए जूते ढूंढना जो वह खरीद सके)।
- अंतिम परिणाम कैसा दिखना चाहिए? (जैसे, सारा के खाते में $300 हैं, लेकिन उसने अभी तक कुछ खरीदा नहीं है)।
- अभिनेता (AI सिमुलेटर्स):
- यूजर सिमुलेटर (The User Simulator): एक AI ग्राहक की भूमिका निभाता है, जो एजेंट के साथ बातचीत करता है।
- टूल सिमुलेटर्स (The Tool Simulators): अन्य AI बैंक या स्टोर होने का नाटक करते हैं। उनके पास वास्तव में कोई वास्तविक बैंक खाता नहीं होता; वे केवल स्क्रिप्ट के आधार पर ऐसा अभिनय करते हैं जैसे कि उनके पास हो।
- स्टेट ट्रैकर (The State Tracker - मेमोरी कीपर): यह सबसे महत्वपूर्ण नया हिस्सा है। जैसे-जैसे बातचीत होती है, एक विशेष AI सब कुछ देखता है और एक "मानसिक स्कोरबोर्ड" (प्रॉक्सि स्टेट) को अपडेट करता है। यह ट्रैक करता है: क्या एजेंट ने पैसे मांगे? क्या "बैंक" ने हाँ कहा? अब बैलेंस क्या है? यह बिना किसी वास्तविक डेटाबेस के, कदम-दर-कदम स्थिति की एक तस्वीर बनाता है।
- जज (द डायरेक्टर):
अंत में, एक अंतिम AI जज बातचीत के ट्रांसक्रिप्ट और "मानसिक स्कोरबोर्ड" को देखता है। वह पूछता है: "क्या एजेंट ने स्क्रिप्ट में परिभाषित लक्ष्य को प्राप्त किया?"
- यदि एजेंट ने जूते ढूंढ लिए और "मानसिक स्कोरबोर्ड" में बैलेंस को सही ढंग से अपडेट कर दिया, तो वह पास हो जाता है।
- यदि एजेंट ने मनगढ़ंत बातें बनाईं (हैलुसिनेशन) या बैलेंस चेक करना भूल गया, तो वह फेल हो जाता है।
यह बेहतर क्यों है?
- गति और लचीलापन: आपको नकली बैंक बनाने की आवश्यकता नहीं है। आप बस एक नई स्क्रिप्ट लिखते हैं। यदि आप एक अलग परिदृश्य का परीक्षण करना चाहते हैं, तो आप टेक्स्ट बदलते हैं, कोड नहीं।
- विश्वसनीयता: लेखकों ने मानव विशेषज्ञों द्वारा AI की ग्रेडिंग की जांच करवाकर इसका परीक्षण किया। वे 90% से अधिक समय में AI जजों के साथ सहमत थे।
- प्रशिक्षण: क्योंकि यह प्रणाली तेज़ है, यह अभ्यास के हजारों संवाद उत्पन्न कर सकती है। AI एजेंट इन अभ्यास सत्रों से सीख सकता है (जब वह इसमें भाग ले रहा हो और जब वह किसी बेहतर एजेंट को खेलते हुए देख रहा हो), जिससे वह बहुत तेज़ी से स्मार्ट बनता है।
परिणाम
पेपर ने विभिन्न AI मॉडलों के साथ इस प्रणाली का परीक्षण किया। उन्होंने पाया कि:
- स्मार्ट AI मॉडल (या वे मॉडल जो उत्तर देने से पहले अधिक सोचते हैं) उच्च स्कोर प्राप्त करते हैं।
- इस प्रणाली का उपयोग करके AI को प्रशिक्षित करने से वह समस्याओं को हल करने में काफी बेहतर हो गया, यहाँ तक कि उन परिदृश्यों पर भी जिन्हें उसने पहले कभी नहीं देखा था।
- प्रणाली AI द्वारा झूठ बोलने या गलतियाँ करने का पता लगाने में बहुत अच्छी थी, जिसमें सिमुलेशन की ओर से लगभग शून्य "नकली" त्रुटियाँ थीं।
संक्षेप में
यह पेपर AI एजेंटों को टेस्ट और ट्रेन करने का एक तरीका पेश करता है, जिसमें एक विशाल, महंगे, वास्तविक दुनिया के सिमुलेशन के बजाय AI अभिनेताओं और एक मेमोरी रखने वाले AI के साथ एक "स्क्रिप्टेड प्ले" का उपयोग किया जाता है। यह तेज़, सस्ता और उतना ही सटीक है, जिससे कंपनियों को अपने AI एजेंटों को बहुत तेज़ी से सुधारने और विकसित करने की अनुमति मिलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।