← नवीनतम पेपर
💻 computer science

State-of-the-Art Claims Require State-of-the-Art Evidence

यह शोध पत्र तर्क देता है कि एआई अनुसंधान में 'स्टेट-ऑफ-द-आर्ट' के दावे अक्सर बेंचमार्क साक्ष्यों द्वारा समर्थित नहीं होते हैं, क्योंकि कुल स्कोर में सुधार अक्सर निरंतर और सुदृढ़ श्रेष्ठता के बजाय आउटलेर्स (outliers) पर निर्भर करते हैं, जो मॉडल के प्रदर्शन की अधिक ईमानदार और सटीक रिपोर्टिंग को आवश्यक बनाता है।

मूल लेखक: YongKyung Oh

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: YongKyung Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "State-of-the-Art Claims Require State-of-the-Art Evidence" (स्टेट-ऑफ-द-आर्ट दावों के लिए स्टेट-ऑफ-द-आर्ट साक्ष्य की आवश्यकता है) पेपर का सरल भाषा और रोजमर्रा के उदाहरणों के साथ अनुवाद दिया गया है।

बड़ी समस्या: "क्लास प्रेसिडेंट" का भ्रम

कल्पना कीजिए कि एक हाई स्कूल में छात्र क्लास प्रेसिडेंट के चुनाव के लिए लड़ रहे हैं। विजेता चुनने के लिए, प्रिंसिपल हर विषय (गणित, इतिहास, कला, जिम, विज्ञान) के ग्रेड लेता है और उन्हें जोड़कर एक बड़ा "कुल स्कोर" (Total Score) निकालता है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, शोधकर्ता बिल्कुल यही करते हैं। वे अपने AI मॉडल्स का कई अलग-अलग कार्यों (जैसे कोडिंग करना, इतिहास के सवालों के जवाब देना, या फोटो में बिल्लियों को पहचानना) पर परीक्षण करते हैं, उनके स्कोर जोड़ते हैं, और जिस मॉडल का कुल स्कोर सबसे अधिक होता है, उसे "स्टेट-ऑफ-द-आर्ट" (SOTA) चैंपियन घोषित कर देते हैं।

यह पेपर तर्क देता है कि यह एक जाल है। सिर्फ इसलिए कि किसी छात्र का कुल स्कोर सबसे अधिक है, इसका मतलब यह नहीं है कि वह हर चीज़ में सर्वश्रेष्ठ है। हो सकता है कि वह गणित में जीनियस हो लेकिन जिम में बहुत खराब हो, जबकि दूसरा छात्र हर चीज़ में "ठीक-ठाक" हो। पेपर कहता है कि कुल स्कोर वाले विजेता को "सर्वश्रेष्ठ" कहना वैसा ही है जैसे किसी को ट्रॉफी देना जो केवल इसलिए जीता क्योंकि उसने कुछ आसान विषयों में पूरे अंक प्राप्त किए, भले ही वह कठिन विषयों में फेल हो गया हो।

तीन तरीके जिनसे "विजेता" एक इत्तेफाक हो सकता है

लेखकों ने 10 अलग-अलग AI "लीडरबोर्ड्स" (जैसे क्लास प्रेसिडेंट का स्कोरबोर्ड) का अध्ययन किया और पाया कि आधे से अधिक मामलों में, घोषित विजेता वास्तव में स्पष्ट चैंपियन नहीं था। उन्होंने यह जांचने के लिए तीन सरल परीक्षणों का उपयोग किया कि जीत वास्तविक थी या केवल एक भाग्यशाली दुर्घटना:

1. "जीत का अंतर" परीक्षण (मैग्निट्यूड/परिमाण)

  • उदाहरण: कल्पना कीजिए कि दो धावक हैं। धावक A 10.00 सेकंड में दौड़ पूरी करता है, और धावक B 10.01 सेकंड में। क्या धावक A महत्वपूर्ण रूप से तेज़ है? या अंतर केवल हवा, जूते के फीते ढीले होने या खराब शुरुआत की वजह से है?
  • पेपर का निष्कर्ष: अक्सर, "विजेता" AI मॉडल रनर-अप (दूसरे स्थान वाले) से केवल थोड़ा ही बेहतर होता है। अंतर इतना कम है कि यह केवल रैंडम शोर (random noise) हो सकता है। फिर भी, शोधकर्ता दावा करते हैं कि विजेता "बेहतर" है, इस बात को नजरअंदाज करते हुए कि अंतर व्यावहारिक रूप से अदृश्य है।

2. "निरंतरता" परीक्षण (जीत की दर)

  • उदाहरण: कल्पना कीजिए कि एक बास्केटबॉल खिलाड़ी एक गेम में 100 अंक बनाता है लेकिन अगले पांच मैचों में हर शॉट मिस कर देता है। यदि आप उनके औसत अंकों को देखते हैं, तो वे एक स्टार दिखते हैं। लेकिन यदि आप पूछें, "क्या उन्होंने अधिकांश गेम जीते?" तो उत्तर है—नहीं।
  • पेपर का निष्कर्ष: कई "विजेता" AI मॉडल वास्तव में उन विशिष्ट कार्यों पर हार जाते हैं जिन पर उनका परीक्षण किया जाता है। वे केवल इसलिए समग्र रैंकिंग में जीतते हैं क्योंकि उन्हें एक या दो विशिष्ट कार्यों पर बहुत बड़ा स्कोर मिला जिसने उनके औसत को ऊपर खींच लिया। वे निरंतर विजेता नहीं हैं; वे विशेषज्ञ हैं जिन्हें शेड्यूल के साथ किस्मत ने साथ दिया।

3. "नाजुकता" परीक्षण (स्थिरता)

  • उदाहरण: कल्पना कीजिए कि एक जेन्गा (Jenga) टॉवर है। यदि आप केवल एक ब्लॉक निकाल सकते हैं और पूरा टॉवर गिर जाता है, तो टॉवर नाजुक है।
  • पेपर का निष्कर्ष: पेपर ने पाया कि कई AI मॉडल्स के लिए, यदि आप लीडरबोर्ड से केवल एक या दो विशिष्ट परीक्षण प्रश्न (डेटासेट्स) हटा देते हैं, तो "विजेता" अचानक आखिरी स्थान पर पहुँच जाता है। इसका मतलब है कि उनकी "चैंपियन" स्थिति पूरी तरह से कुछ विशिष्ट प्रश्नों पर निर्भर करती है। यदि आप टेस्ट में थोड़ा बदलाव करते हैं, तो रैंकिंग पूरी तरह से पलट जाती है।

"दावा-साक्ष्य अंतराल" (The Claim-Evidence Gap)

लेखक इसे "दावा-साक्ष्य अंतराल" कहते हैं।

  • साक्ष्य (Evidence): डेटा दिखाता है कि एक मॉडल "औसत में प्रथम" है।
  • दावा (Claim): पेपर कहता है, "यह मॉडल स्टेट-ऑफ-द-आर्ट (सबसे सर्वश्रेष्ठ) है।"

पेपर का तर्क है कि "स्टेट-ऑफ-द-आर्ट" शब्द का अर्थ है कि एक मॉडल मजबूत, सुसंगत और सार्थक रूप से बेहतर है। लेकिन साक्ष्य अक्सर केवल यह समर्थन करते हैं कि "इस विशिष्ट सूची के परीक्षणों पर आज इस मॉडल का औसत स्कोर सबसे अधिक है।"

यह बार-बार क्यों होता है?

लेखक सुझाव देते हैं कि ऐसा इसलिए नहीं है कि शोधकर्ता गणित में खराब हैं। यह एक संस्थागत समस्या है।

  • दबाव: कॉन्फ्रेंस और जर्नल्स को बोल्ड हेडलाइंस पसंद हैं। "हमारा मॉडल औसत में प्रथम है" शीर्षक वाला पेपर उबाऊ लगता है। "हमारा मॉडल नया स्टेट-ऑफ-द-आर्ट है!" रोमांचक लगता है और अधिक साइटेशन (citations) दिलाता है।
  • यथास्थिति (Status Quo): हर कोई ऐसा ही कर रहा है, इसलिए कोई रुकता नहीं है। यह एक ऐसे खेल की तरह है जहाँ हर कोई ट्रेडमिल पर दौड़ रहा है; यदि आप अपनी गति की जाँच करने के लिए रुकते हैं, तो आप पीछे रह जाएंगे।

समाधान: ईमानदार रिपोर्टिंग (नए प्रयोगों की आवश्यकता नहीं)

अच्छी खबर यह है कि हमें इस समस्या को ठीक करने के लिए नए AI मॉडल बनाने या महंगे नए परीक्षण चलाने की आवश्यकता नहीं है। हमें बस अपने परिणामों के बारे में बात करने का तरीका बदलने की आवश्यकता है।

इसके बजाय यह कहने के बजाय कि:

"हमारा मॉडल स्टेट-ऑफ-द-आर्ट है!"

लेखक सुझाव देते हैं कि यह कहना चाहिए:

"हमारे मॉडल ने इस बेंचमार्क पर उच्चतम औसत स्कोर प्राप्त किया, लेकिन यह केवल 60% कार्यों पर जीता, और यदि हम दो विशिष्ट डेटासेट्स को हटा दें तो इसका बढ़त गायब हो जाती है।"

मुख्य निष्कर्ष (The Takeaway):
यह पेपर AI समुदाय से आग्रह करता है कि वे एक एकल औसत संख्या को पूर्ण श्रेष्ठता के प्रमाण के रूप में मानना बंद करें। जैसे आप किसी छात्र को केवल इसलिए "स्कूल में सबसे बुद्धिमान" नहीं कहेंगे क्योंकि उसने एक आसान टेस्ट में अच्छा किया है, वैसे ही हमें किसी AI को "सर्वश्रेष्ठ" नहीं कहना चाहिए क्योंकि उसका एक अस्थिर लीडरबोर्ड पर औसत स्कोर सबसे अधिक है। हमें अपने साहसी दावों को ईमानदार, विस्तृत साक्ष्यों के साथ मेल बिठाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →