One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
One-Eval एक एजेंटिक सिस्टम है जो बेंचमार्क प्लानिंग, डेटासेट रेजोल्यूशन और निर्णय-उन्मुख रिपोर्टिंग के लिए एकीकृत घटकों के माध्यम से प्राकृतिक-भाषा अनुरोधों को पता लगाने योग्य, अनुकूलन योग्य वर्कफ़्लो में परिवर्तित करके लार्ज लैंग्वेज मॉडल्स के एंड-टू-एंड मूल्यांकन को स्वचालित करता है, जिससे मैन्युअल प्रयास कम होता है और पुनरुत्पादकता बढ़ती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ हैं जिसने अभी-अभी एक क्रांतिकारी नई रेसिपी बनाई है। दुनिया को परोसने से पहले, आपको यह जानना होगा: क्या यह वास्तव में अच्छी है? क्या इसका स्वाद पिज्जा जैसा है या पैनकेक जैसा? क्या इसने रसोई में आग लगा दी?
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इस "स्वाद परीक्षण" (taste test) को इवैल्यूएशन (Evaluation) कहा जाता है। लेकिन अभी, एक नए AI मॉडल का परीक्षण करना एक ऐसी रेस्टोरेंट किचन चलाने जैसा है जहाँ हर सामग्री किसी अलग देश से आती है, हर रेसिपी अलग भाषा में लिखी गई है, और आपको खाना बनाना शुरू करने से पहले अपना खुद का चूल्हा, ओवन और कटिंग बोर्ड खुद बनाना पड़ता है। यह धीमा, भ्रमित करने वाला और गलतियों से भरा है।
पेश है One-Eval। One-Eval को एक AI सू-शेफ (AI Sous-Chef) (एक अत्यधिक कुशल सहायक) के रूप में समझें जिससे आप साधारण अंग्रेजी में बात कर सकते हैं। जटिल कोड या स्प्रेडशीट देने के बजाय, आप बस कहते हैं, "हे, मुझे चेक करना है कि क्या मेरा नया AI गणित में अच्छा है और क्या यह सच बोल सकता है।"
यहाँ बताया गया है कि One-Eval कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:
1. द ट्रांसलेटर (NL2Bench)
समस्या: आप कहते हैं, "मेरी गणित कौशल की जाँच करें।" लेकिन AI को यह नहीं पता कि कौन सा गणित का टेस्ट इस्तेमाल करना है। क्या यह प्राथमिक स्कूल का गणित है? कॉलेज कैलकुलस? या पेचीदा पहेलियाँ?
One-Eval का समाधान: यह ट्रांसलेटर (अनुवादक) है। यह आपके अनौपचारिक अनुरोध को सुनता है और उसे एक पेशेवर शॉपिंग लिस्ट में बदल देता है।
- उपमा: कल्पना कीजिए कि आप एक ट्रैवल एजेंट को कहते हैं, "मुझे एक आरामदायक बीच वेकेशन चाहिए।" एजेंट सिर्फ एक रैंडम फ्लाइट बुक नहीं करता; वह समझ जाता है कि आप शायद हवाई (Hawaii) जाना चाहते हैं, न कि किसी रेगिस्तान में, और वह उन विशिष्ट रिसॉर्ट्स को बुक करता है जो आपके बजट में फिट बैठते हैं।
- यह क्या करता है: यह आपके वाक्य को लेता है, यह समझता है कि आपका सटीक अर्थ क्या है, और हजारों विकल्पों की एक विशाल लाइब्रेरी से सही "टेस्ट" (बेंचमार्क्स) चुनता है। यह आपसे यह भी पूछता है, "क्या आपका मतलब इस विशिष्ट टेस्ट से है?" ताकि आप इसे शुरू करने से पहले इसमें बदलाव कर सकें।
2. द लॉजिस्टिक्स मैनेजर (BenchResolve)
समस्या: भले ही आपको पता हो कि किस टेस्ट का उपयोग करना है, टेस्ट की सामग्री प्राप्त करना एक दुस्वप्न है। एक टेस्ट किसी वेबसाइट पर है, दूसरा एक ज़िप फ़ाइल में है, और तीसरा एक अजीब फॉर्मेट में है जिसे आपका कंप्यूटर नहीं समझ पाता। आपको उन्हें मैन्युअल रूप से डाउनलोड करना होगा, फ़ाइलों का नाम बदलना होगा, और टूटे हुए लिंक्स को ठीक करना होगा।
One-Eval का समाधान: यह लॉजिस्टिक्स मैनेजर है। यह पर्दे के पीछे सारा भारी काम करता है।
- उपमा: कल्पना कीजिए कि आप एक कस्टम-निर्मित घर का ऑर्डर देते हैं। आपको ईंटें, पाइप और लकड़ी खरीदने के लिए लकड़ी के स्टोर, हार्डवेयर स्टोर और प्लंबिंग सप्लाई शॉप पर जाने के बजाय, बिल्डर बाहर जाता है, सब कुछ खरीदता है, और उसे व्यवस्थित ढेर के रूप में आपके घर के सामने पहुँचा देता है।
- यह क्या करता है: यह स्वचालित रूप से सही डेटा फ़ाइलें ढूंढता है, उन्हें डाउनलोड करता है, और उन्हें एक मानक फॉर्मेट में "अनुवादित" करता है ताकि AI वास्तव में टेस्ट दे सके। यह सुनिश्चित करता है कि "चूल्हा" बन गया है और "सामग्री" तैयार है।
3. द क्रिटिक एंड रिपोर्टर (Metrics & Reporting)
समस्या: आमतौर पर, जब आप किसी AI का परीक्षण करते हैं, तो आपको एक सिंगल नंबर वापस मिलता है, जैसे "85%"। यह एक शिक्षक द्वारा आपको केवल "B" ग्रेड देने जैसा है बिना यह बताए कि क्यों आपको वह मिला, या आपने कौन से प्रश्न गलत किए। यह आपको सुधार करने में मदद नहीं करता।
One-Eval का समाधान: यह क्रिटिक (समीक्षक) है। यह आपको केवल एक स्कोर नहीं देता; यह सलाह के साथ एक पूरा रिपोर्ट कार्ड देता है।
- उपमा: केवल यह कहने के बजाय कि "आपको B मिला," एक बेहतरीन कोच कहता है, "आप तेज़ दौड़े, लेकिन आप आखिरी बाधा पर लड़खड़ा गए। साथ ही, आपकी फॉर्म बाईं ओर बहुत अच्छी थी लेकिन दाईं ओर कमजोर थी। इसे ठीक करने के लिए यहाँ तीन विशिष्ट अभ्यास दिए गए हैं।"
- यह क्या करता है: यह देखता है कि AI कैसे विफल हुआ। क्या इसने झूठ बोला? क्या यह लंबे वाक्य से भ्रमित हो गया? क्या इसने मतिभ्रम (hallucinate) किया (मनगढ़ंत बातें बनाईं)? यह एक रंगीन, आसानी से पढ़ने योग्य रिपोर्ट तैयार करता है जो आपको बताता है कि AI कहाँ मजबूत है और उसे कहाँ वापस जाकर पढ़ाई करने की ज़रूरत है।
"ह्यूमन-इन-द-लूप" सेफ्टी नेट
One-Eval स्मार्ट है, लेकिन यह जानता है कि यह पूर्ण नहीं है। इसके पास एक सेफ्टी चेकपॉइंट (सुरक्षा जांच बिंदु) है।
- उपमा: इसे एक विमान उड़ाने वाले पायलट की तरह समझें। ऑटोपायलट (One-Eval) उड़ान का 99% हिस्सा संभाल सकता है, लेकिन लैंड करने से पहले, वह पायलट (आपसे) पूछता है, "हे, मैं रनवे 4 पर लैंड करने वाला हूँ। क्या यह ठीक है?" यदि आप कहते हैं, "नहीं, रनवे 2 का उपयोग करें," तो सिस्टम तुरंत अपना रास्ता बदल लेता है।
- यह क्या करता है: महत्वपूर्ण क्षणों पर, यह रुकता है और आपको अपनी योजना दिखाता है। आप इसे अप्रूव कर सकते हैं, एडिट कर सकते हैं, या इसे फिर से शुरू करने के लिए कह सकते हैं। यह सुनिश्चित करता है कि भले ही सिस्टम उबाऊ काम कर रहा हो, नियंत्रण हमेशा आपके हाथ में रहे।
यह क्यों मायने रखता है?
One-Eval से पहले, AI का परीक्षण करना बिना निर्देशों के IKEA फर्नीचर जोड़ने जैसा था, और उन औजारों का उपयोग करना जिन्हें आपको खुद बनाना पड़ता था। इसमें कई दिन लगते थे और इसके लिए बढ़ईगीरी में पीएचडी की आवश्यकता होती थी।
One-Eval के साथ, आप बस कहते हैं, "मेरे लिए एक मेज बनाओ," और सिस्टम आपके लिए लकड़ी, पेंच, निर्देश और तैयार उत्पाद लेकर आता है, जबकि यह भी बताता है कि मेज के पैर थोड़े डगमगा रहे हैं। यह एक अराजक, मैनुअल दुस्वप्न को एक सुचारू, स्वचालित बातचीत में बदल देता है, जिससे कंपनियों के लिए सुरक्षित, स्मार्ट और अधिक विश्वसनीय AI बनाना बहुत आसान हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।