← नवीनतम पेपर
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

यह शोध पत्र 57 मशीन लर्निंग इवैल्यूएशन हार्नेस (evaluation harnesses) का एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो स्पेसिफिकेशन (Specification) चरण को परिचालन संबंधी चुनौतियों के प्राथमिक स्रोत के रूप में पहचानता है, 16,560 समस्याओं को उनके मूल कारण के आधार पर वर्गीकृत करता है जिससे यह पता चलता है कि अनिरुद्ध (unimplemented) विशेषताएं, दस्तावेज़ीकरण अंतराल और लुप्त इनपुट सत्यापन 60% से अधिक समस्याओं के लिए उत्तरदायी हैं, और मूल्यांकन इंजीनियरिंग (evaluation engineering) को एक विशिष्ट सॉफ्टवेयर इंजीनियरिंग अनुशासन के रूप में मानने के लिए एक आधार स्थापित करता है।

मूल लेखक: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नई रेसिपी का परीक्षण कर रहे हैं। आपके पास सामग्री (डेटा) है, रेसिपी कार्ड (मॉडल) है, और एक व्यंजन को "अच्छा" बनाने के नियम (मेट्रिक्स) हैं। लेकिन खाना पकाने से पहले, आपको खाना पकाने के लिए एक रसोई (kitchen), खाना पकाने का समय ट्रैक करने के लिए एक टाइमर (timer), और परिणाम लिखने के लिए एक स्कोरकार्ड (scorecard) की आवश्यकता है।

AI (आर्टिफिशियल इंटेलिजेंस) की दुनिया में, यह "रसोई" एक इवैल्यूएशन हार्नेस (Evaluation Harness) कहलाती है। यह वह सॉफ्टवेयर टूल है जो वास्तव में परीक्षण चलाता है, डेटा लोड करता है, स्कोर की गणना करता है, और आपको बताता है कि आपका AI मॉडल अच्छा काम कर रहा है या नहीं।

यह शोध पत्र 57 अलग-अलग "AI रसोईयों" के एक व्यापक निरीक्षण की तरह है ताकि यह देखा जा सके कि वे कैसे काम करती हैं, कहाँ टूटती हैं, और लोग उनसे क्यों परेशान होते हैं। शोधकर्ता इस नए क्षेत्र को "इवैल्यूएशन इंजीनियरिंग" (Evaluation Engineering) कहते हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पाँच-चरणीय रसोई कार्यप्रवाह (Five-Stage Kitchen Workflow)

शोधकर्ताओं ने पाया कि प्रत्येक AI इवैल्यूएशन रसोई पाँच विशिष्ट चरणों से गुजरती है, जैसे कि एक प्रोडक्शन लाइन:

  • प्रोविजनिंग (रसोई तैयार करना): चूल्हा, बर्तन और सामग्री तैयार करना। इसमें सॉफ्टवेयर इंस्टॉल करना और अकाउंट में लॉग इन करना शामिल है।
  • स्पेसिफिकेशन (रेसिपी लिखना): यह तय करना कि आप क्या पका रहे हैं और आप किन सामग्रियों का उपयोग कर रहे हैं। यहीं पर आप AI मॉडल और टेस्ट डेटा लोड करते हैं।
  • एक्जीक्यूशन (खाना पकाना): उत्तर उत्पन्न करने के लिए वास्तव में AI मॉडल को चलाना।
  • असेसमेंट (चखना और स्कोर देना): सही उत्तरों के विरुद्ध उत्तरों की जाँच करना और एक स्कोर की गणना करना।
  • रिपोर्टिंग (मेन्यू परोसना): अंतिम परिणाम को चार्ट या रिपोर्ट में दिखाना।

बड़ा आश्चर्य: अधिकांश रसोई "पकाने" (Execution) में तो बेहतरीन हैं, लेकिन "परोसने" (Reporting) में बहुत खराब हैं। बहुत कम ऐसी रसोई हैं जिनमें स्वचालित अलार्म हो जो आपको बता सके कि क्या आज का खाना कल की तुलना में स्वाद में खराब हो गया है।

2. चीजें कहाँ गलत होती हैं (मूल कारण)

टीम ने उपयोगकर्ताओं की 16,000 से अधिक शिकायतों (जिन्हें "इश्यूज" कहा जाता है) का अध्ययन किया। उन्होंने पाया कि समस्याएँ आमतौर पर इसलिए नहीं होतीं क्योंकि गणित गलत है या कोड नाटकीय रूप से क्रैश हो जाता है। इसके बजाय, समस्याएँ ज्यादातर नौकरशाही (bureaucratic) और गायब हिस्सों से जुड़ी हैं।

इसे लेगो (Lego) सेट बनाने की कोशिश करने जैसा समझें जहाँ निर्देश गायब हैं या बॉक्स कहता है "इसमें एक लाल ईंट शामिल है" लेकिन आपको केवल एक नीली ईंट मिलती है।

रसोई के विफल होने के शीर्ष तीन कारण हैं:

  1. लापता फीचर्स (24%): टूल ने वादा किया था कि वह कुछ करेगा (जैसे किसी विशिष्ट प्रकार के डेटा को संभालना), लेकिन डेवलपरों ने वास्तव में उसका वह हिस्सा कभी बनाया ही नहीं। यह एक ऐसी कार की तरह है जिसमें स्टीयरिंग व्हील तो है लेकिन इंजन नहीं है।
  2. खराब निर्देश (20%): टूल काम तो करता है, लेकिन मैनुअल या तो गायब है, पुराना है, या भ्रमित करने वाला है। उपयोगकर्ता समझ नहीं पाते कि इसका उपयोग कैसे करें।
  3. सुरक्षा जांच की कमी (17%): टूल यह जाँच नहीं करता कि सामग्री ताज़ा है या नहीं। यदि आप इसे खराब डेटा देते हैं, तो यह रुकता नहीं है; यह बस कचरा बनाता है और आपको कचरा स्कोर देता है।

3. रसोई के विभिन्न प्रकार

शोधकर्ताओं ने 57 रसोईयों को चार "आर्केटाइप्स" (प्रकारों) में वर्गीकृत किया, और प्रत्येक प्रकार की अपनी विशिष्ट सिरदर्द वाली समस्याएं हैं:

  • मानकीकृत टेस्ट किचन (40%): ये बड़ी, प्रसिद्ध रसोई हैं जो कई मॉडलों का मानक परीक्षाओं (जैसे AI के लिए SATs) के विरुद्ध परीक्षण करती हैं।
    • इनका सबसे बड़ा सिरदर्द: डिपेंडेंसी ब्रेकेज (Dependency Breakness)। ये बाहरी सामग्रियों (डेटासेट्स) पर निर्भर हैं जो बिना किसी चेतावनी के बदल जाती हैं या गायब हो जाती हैं। यदि आपूर्तिकर्ता पैकेजिंग बदल देता है, तो पूरी रसोई काम करना बंद कर देती है।
  • विशेष उपकरण (Specialized Tool) (21%): ये छोटे उपकरण हैं जो एक ही काम को पूरी तरह से करते हैं (जैसे यह जांचना कि क्या एक रोबोट चल सकता है)।
    • इनका सबसे बड़ा सिरदर्द: खराब निर्देश। क्योंकि वे इतने सरल हैं, डेवलपर्स यह लिखना भूल जाते हैं कि उन्हें कैसे सेटअप किया जाए।
  • कस्टम प्रोब (Custom Probe) (21%): ये विशिष्ट कौशल (जैसे कोडिंग या गणित) का परीक्षण करते हैं।
    • इनका सबसे बड़ा सिरदर्द: गणितीय त्रुटियां। चूंकि वे अपने स्वयं के स्कोरिंग फॉर्मूले बनाते हैं, इसलिए वे अक्सर गणित में गलती कर देते हैं, जिससे "साइलेंट एरर" (मौन त्रुटियां) होती हैं जहाँ स्कोर सही दिखता है लेकिन वास्तव में गलत होता है।
  • फुल-सर्विस रेस्टोरेंट (Full-Service Restaurant) (17%): ये फैंसी, ऑल-इन-वन प्लेटफॉर्म हैं जो सब कुछ करते हैं।
    • इनका सबसे बड़ा सिरदर्द: कॉन्ट्रैक्ट मिसमैच (Contract Mismatches)। क्योंकि ये कई अलग-अलग हिस्सों को जोड़ते हैं (जैसे एक रिमोट जज और एक लोकल मॉडल), हिस्से अक्सर एक ही भाषा नहीं बोल पाते, जिससे संचार में व्यवधान आता है।

4. "साइलेंट किलर" (Silent Killer)

सबसे खतरनाक समस्या जो पेपर में मिली, वह है साइलेंट स्कोरिंग एरर्स (Silent Scoring Errors)

कल्पना कीजिए कि एक जज सूप चखता है और उसे 5-स्टार रेटिंग देता है। जज आश्वस्त है, स्कोर प्रिंट किया गया है, और हर कोई खुश है। लेकिन जज वास्तव में नमक डालना भूल गया था, और सूप का स्वाद बहुत खराब है। टूल क्रैश नहीं हुआ; इसने बस एक गलत स्कोर दे दिया।

पेपर में पाया गया कि कई टूल्स स्कोर गलत तरीके से कैलकुलेट करते हैं (एल्गोरिद्मिक त्रुटियां) या यह जाँचने में विफल रहते हैं कि डेटा तर्कसंगत है या नहीं (वैलिडेशन गैप्स), और क्योंकि सिस्टम में कोई "दूसरी राय" (second opinion) नहीं जुड़ी है, इसलिए कोई भी काफी समय तक इसका पता नहीं लगा पाता।

5. भविष्य के लिए इसका क्या अर्थ है

पेपर निष्कर्ष निकालता है कि हमें इन टूल्स को केवल "स्क्रिप्ट" के रूप में नहीं बल्कि गंभीर इंजीनियरिंग उत्पादों के रूप में देखने की आवश्यकता है।

  • डेवलपर्स को यह मानना बंद करना होगा कि गणित एकदम सही है और "सुरक्षा जाल" (जैसे यह जाँच करना कि स्कोर प्रिंट करने से पहले क्या वह तर्कसंगत है) बनाना शुरू करना होगा।
  • उपयोगकर्ताओं को स्कोर पर आँख मूंदकर भरोसा करना बंद करना होगा। सिर्फ इसलिए कि टूल कहता है "95% सटीकता", इसका मतलब यह नहीं है कि वह सच है; आपको काम की दोबारा जाँच करनी होगी।
  • शोधकर्ताओं को इन टूल्स के परीक्षण के नए तरीके खोजने होंगे, क्योंकि परीक्षण करने के पुराने तरीके अब काम नहीं करते जब "परीक्षण" स्वयं एक AI है जो भ्रमित (hallucinating) हो सकता है।

संक्षेप में: हमने अन्य मशीनों का परीक्षण करने के लिए अद्भुत मशीनें बनाई हैं, लेकिन परीक्षण करने वाली मशीनें अक्सर निर्देशों के बिना, अपने तर्क में छेद वाली, और भ्रमित होने पर बताने की क्षमता के बिना होती हैं। इन "रसोईयों" को ठीक करना बेहतर "शेफ" (AI मॉडल) बनाने जितना ही महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →