The Necessity of a Unified Framework for LLM-Based Agent Evaluation
यह शोध पत्र तर्क देता है कि विभिन्न प्रॉम्प्ट्स और वातावरणों जैसे भ्रमित करने वाले कारकों के कारण एलएलएम-आधारित एजेंटों के मूल्यांकन में वर्तमान मानकीकरण की कमी, मॉडल के प्रदर्शन के निष्पक्ष, पुनरुत्पादनीय और कठोर मूल्यांकन को सुनिश्चित करने के लिए एक एकीकृत ढांचे की आवश्यकता को अनिवार्य बनाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।
बड़ी समस्या: "ब्लाइंड टेस्ट टेस्ट" (The Blind Taste Test)
कल्पना कीजिए कि आप यह जानना चाहते हैं कि किसी विशिष्ट व्यंजन को बनाने में कौन सा शेफ सबसे अच्छा है। आप एक 'ब्लाइंड टेस्ट' आयोजित करते हैं। हालाँकि, इसमें एक पेंच है:
- शेफ A को एक उच्च श्रेणी का, पेशेवर ओवन, प्रीमियम सामग्री और सब्जियां काटने के लिए एक सहायक दिया गया है।
- शेफ B को एक जंग लगा हुआ टोस्टर, जमी हुई सामग्री और कोई मदद नहीं दी गई है।
यदि शेफ A एक स्वादिष्ट भोजन बनाता है और शेफ B का खाना जल जाता है, तो आप सोच सकते हैं कि शेफ A बेहतर रसोइया है। लेकिन वास्तव में, परिणाम में अंतर केवल शेफ के कौशल के कारण नहीं था; यह उन रसोईघरों (kitchens) के बारे में था जिनमें वे काम कर रहे थे।
यही वह समस्या है जिसे यह शोध पत्र लार्ज लैंग्वेज मॉडल (LLM) एजेंट्स के संदर्भ में पहचानता है।
वर्तमान में, जब शोधकर्ता AI एजेंटों (AI जो टूल्स का उपयोग कर सकते हैं, योजना बना सकते हैं और निर्णय ले सकते हैं) का परीक्षण करते हैं, तो वे प्रत्येक AI को एक अलग "रसोई" (जिसे हार्नेस/harness कहा जाता है) में लपेट देते हैं। एक AI को शानदार प्रॉम्प्ट, एक स्मार्ट मेमोरी सिस्टम और एक सख्त टूल इंटरफेस मिल सकता है। दूसरे को एक साधारण प्रॉम्प्ट और एक अव्यवस्थित इंटरफेस मिल सकता है। जब स्कोर सामने आते हैं, तो हमें यह नहीं पता होता कि AI अधिक बुद्धिमान है, या उसे बस एक बेहतर "रसोई" मिली है।
शोध पत्र का समाधान: एक मानकीकृत "रेस ट्रैक" (A Standardized Race Track)
लेखकों का तर्क है कि AI मॉडलों की निष्पक्ष तुलना करने के लिए, हमें एक एकीकृत रूपरेखा (Unified Framework) की आवश्यकता है। इसे एक एकल, मानकीकृत रेस ट्रैक के रूप में सोचें जिस पर सभी कारों (AI मॉडलों) को दौड़ना है।
- कार (The AI Model): यह वह है जिसका हम परीक्षण करना चाहते हैं। क्या यह तेज़ है? क्या यह कुशल है?
- ट्रैक (The Harness & Environment): इसमें सड़क की सतह, मौसम, ईंधन का प्रकार और दौड़ के नियम शामिल हैं।
शोध पत्र कहता है: ट्रैक सभी के लिए बिल्कुल समान रखें।
यदि हम हर परीक्षण के लिए ट्रैक (प्रॉम्प्ट, मेमोरी टूल्स, इंटरनेट से बात करने का तरीका) को बदलते हैं, तो हम यह नहीं बता पाएंगे कि तेज़ समय कार के बेहतर होने के कारण आया या सड़क के चिकना होने के कारण।
क्या ठीक करने की आवश्यकता है (ट्रैक के हिस्से)
शोध पत्र "रसोई" या "ट्रैक" को पांच विशिष्ट भागों में विभाजित करता जिन्हें मानकीकृत करने की आवश्यकता है ताकि वे परिणामों को खराब न करें:
- सड़क के नियम (Inference): कभी-कभी एक AI को सुरक्षा फिल्टर (safety filter) द्वारा रोका जाता है जबकि दूसरे को नहीं, केवल इसलिए क्योंकि वे अलग-अलग इंटरनेट प्रदाताओं का उपयोग कर रहे हैं। परीक्षण को यह सुनिश्चित करना चाहिए कि नियम सभी के लिए समान हों।
- निर्देश पुस्तिका (Prompting): कुछ AI परीक्षण मॉडल को 200 शब्दों का निर्देश देते हैं, जबकि अन्य 2,000 शब्दों की मैनुअल देते हैं जो मूल रूप से AI को बताता है कि उसे कैसे सोचना है। शोध पत्र कहता है कि कार्य (task) अलग हो सकता है, लेकिन निर्देश देने का तरीका समान होना चाहिए।
- नोटबुक (Memory): कुछ AI एजेंटों को पिछली घटनाओं को याद रखने के लिए एक पूरी तरह से व्यवस्थित नोटबुक मिलती है। दूसरों को कागजों का एक ढेर मिलता है जहाँ पुरानी जानकारी बेतरतीब ढंग से फेंक दी जाती है। परीक्षण को यह सुनिश्चित करना होगा कि प्रत्येक AI को एक ही प्रकार की नोटबुक मिले।
- टूल बेल्ट (Tool Invocation): कुछ AI मॉडलों को एक बहुत ही सख्त प्रारूप में टूल्स का उपयोग करने के लिए सिखाया जाता है; अन्य को ढीला छोड़ा जाता है। यदि एक AI टूल कॉल में एक कॉमा (comma) छूट जाने के कारण विफल हो जाता है, लेकिन दूसरा सफल हो जाता है क्योंकि परीक्षण उदार था, तो यह एक निष्पक्ष तुलना नहीं है।
- दुनिया (Environment): यह एक बड़ा विषय है। यदि किसी AI का परीक्षण एक "लाइव" वेबसाइट पर किया जाता है, तो वेबसाइट कल बदल सकती है। यदि AI इसलिए विफल होता है क्योंकि वेबसाइट बदल गई, तो यह AI की गलती नहीं है। शोध पत्र का तर्क है कि हमें दुनिया के "फ्रोजन" (frozen) स्नैपशॉट का उपयोग करने की आवश्यकता है ताकि परीक्षण के दौरान वातावरण न बदले।
यह फ्रेमवर्क क्या नहीं है
लेखक बहुत सावधानी से कहते हैं कि यह फ्रेमवर्क किस लिए नहीं है:
- यह वास्तविक दुनिया के AI उत्पादों में नवाचार (innovation) को रोकने के लिए नहीं है। Anthropic या OpenAI जैसी कंपनियों को अपने उत्पादों के लिए सबसे अद्भुत, जटिल और अभिनव "रसोई" बनाने के लिए स्वतंत्र होना चाहिए।
- यह सभी AI को एक जैसा बनाने के लिए नहीं है।
- यह केवल वैज्ञानिक परीक्षण (परीक्षा) के लिए है।
इसे फॉर्मूला 1 रेसिंग की तरह समझें:
- इंजन (The AI Model): यह वह है जिसे निर्माता सुधारना चाहते हैं।
- नियम (The Unified Framework): FIA (रेसिंग संस्था) टायर के आकार, ईंधन और चेसिस के आयामों पर सख्त नियम निर्धारित करती है।
- क्यों? ताकि जब एक कार दूसरी कार से तेज़ हो, तो हम जान सकें कि यह इंजन के कारण है, न कि इसलिए कि एक टीम ने बेहतर टायर या अलग ईंधन का उपयोग किया।
प्रस्तावित योजना
शोध पत्र इस समस्या को ठीक करने के लिए तीन-भागों वाली प्रणाली का सुझाव देता है:
- एक नियंत्रित सबस्ट्रेट (A Controlled Substrate): एक मानक "रनर" जो हर परीक्षण के लिए प्रॉम्प्ट, मेमोरी और टूल्स को स्थिर रखता है।
- एक मानकीकृत स्कोरिंग पद्धति (A Standardized Scoring Method): केवल "पास/फेल" कहने के बजाय, हमें यह मापना होगा कि AI ने कैसे प्रदर्शन किया (क्या इसने बहुत अधिक कदम उठाए? क्या इसने बहुत अधिक मेमोरी का उपयोग किया?)।
- वर्जन कंट्रोल (Version Control): चूंकि तकनीक तेजी से बदलती है, इसलिए इस "नियम पुस्तिका" के संस्करण (जैसे v1.0, v2.0) होने चाहिए। यदि नियम बदलते हैं, तो हम पुराने संस्करण के स्कोर की तुलना नए संस्करण से नहीं करते हैं, ठीक वैसे ही जैसे हम नए नियमों के बिना 2020 से 2024 के कार के लैप टाइम की तुलना नहीं करते हैं।
सारांश
शोध पत्र का दावा है कि अभी हम सेब की तुलना संतरों से कर रहे हैं क्योंकि प्रत्येक AI परीक्षण एक अलग सेटअप का उपयोग करता है। यह वास्तव में जानने के लिए कि कौन सा AI "सबसे बुद्धिमान" है, हमें उन सभी को ठीक एक ही कमरे में रखना होगा, उन्हें ठीक वही टूल्स देने होंगे, और उन्हें उसी समस्या को हल करते हुए देखना होगा। तभी हम कह सकते हैं, "यह AI बेहतर है," न कि, "इस AI को बेहतर सेटअप मिला।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।