← नवीनतम पेपर
🤖 machine learning

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

यह शोध पत्र प्रदर्शित करता है कि कई डोमेनों में विषम आइटम कठिनाइयों वाले विरल मूल्यांकन मैट्रिसेस (sparse evaluation matrices) में सरल औसत विफल रहता है, जबकि आइटम रिस्पॉन्स थ्योरी (IRT) मॉडल इन परिस्थितियों में भी सुदृढ़ता से वास्तविक रैंकिंग को पुनः प्राप्त कर लेते हैं।

मूल लेखक: Jung Min Kang

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jung Min Kang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "औसत" का जाल (The "Average" Trap)

कल्पना कीजिए कि आप यह तय करने की कोशिश कर रहे हैं कि तीन धावकों में से सबसे तेज़ कौन है।

  • धावक A केवल एक सपाट, चिकने ट्रैक पर दौड़ता है।
  • धावक B केवल एक खड़ी, कीचड़ भरी पहाड़ी पर दौड़ता है।
  • धावक C दोनों के मिश्रण पर दौड़ता है।

यदि आप उन्हें रैंक करने के लिए उनके दौड़ने के औसत समय (average time) का उपयोग करते हैं, तो आपको एक भ्रामक परिणाम मिलेगा। धावक A एक सुपरस्टार की तरह दिखता है क्योंकि ट्रैक आसान था। धावक B धीमा दिखता है, इसलिए नहीं कि वह बुरा है, बल्कि इसलिए क्योंकि पहाड़ी कठिन थी।

यह शोध पत्र तर्क देता है कि आर्टिफिशियल इंटेलिजेंस (AI) बेंचमार्क ठीक यही गलती कर रहे हैं। वर्तमान में, जब हम AI मॉडल्स को रैंक करते हैं, तो हम बस उन सभी परीक्षणों का "औसत स्कोर" ले लेते हैं जिन्हें उन्होंने पास किया है। लेखकों का कहना है कि यह तरीका तब विफल हो जाता है जब दो चीजें एक साथ होती हैं:

  1. स्पर्सिटी (Sparsity/विरलता): हर AI का हर एक समस्या पर परीक्षण नहीं किया जाता (कुछ का केवल आसान परीक्षण होता है, कुछ का केवल कठिन)।
  2. कठिनाई का अंतर (Difficulty Gaps): परीक्षण इस मामले में बहुत भिन्न होते हैं कि वे कितने कठिन हैं।

जब ये दोनों चीजें मिलती हैं, तो "साधारण औसत" एक नकली लीडरबोर्ड बना देता है जो वास्तव में यह नहीं दर्शाता कि सबसे अच्छा कौन है।

समाधान: "स्मार्ट कोच" (IRT)

यह शोध पत्र एक बेहतर तरीका प्रस्तावित करता है जिसे आइटम रिस्पांस थ्योरी (Item Response Theory - IRT) कहा जाता है। IRT को केवल एक कैलकुलेटर के रूप में नहीं, बल्कि एक स्मार्ट कोच के रूप में सोचें।

केवल यह गिनने के बजाय कि एक AI ने कितने प्रश्न सही किए, स्मार्ट कोच इस बात पर नज़र रखता है कि उन्होंने कौन से प्रश्न सही किए।

  • यदि कोई AI एक "बेहद कठिन" प्रश्न सही करता है, तो कोच कहता है, "वाह, यह AI अद्भुत है!"
  • यदि कोई AI एक "आसान" प्रश्न गलत करता है, तो कोच कहता है, "यह AI संघर्ष कर रहा है।"
  • महत्वपूर्ण बात यह है कि कोच परीक्षण की कठिनाई के आधार पर स्कोर को एडजस्ट करता है।

शोध पत्र दिखाता है कि जबकि "साधारण औसत" विधि भ्रमित हो जाती है और गलत AI को विजेता के रूप में रैंक करती है, "स्मार्ट कोच" (IRT) सही ढंग से सर्वश्रेष्ठ AI की पहचान करता है, भले ही डेटा अव्यवस्थित और अधूरा हो।

प्रयोग: चार अलग-अलग दुनिया

इसे साबित करने के लिए, लेखकों ने केवल AI को नहीं देखा। उन्होंने कंप्यूटर सिमुलेशन में चार अलग-अलग "दुनियाओं" में परीक्षण चलाया ताकि यह देखा जा सके कि क्या यह समस्या हर जगह मौजूद है:

  1. NLP की दुनिया (भाषा): यहाँ, सभी ने एक ही परीक्षण दिए। "साधारण औसत" ठीक से काम कर गया। (यह "आसान मामला" है)।
  2. क्लिनिकल ड्रग की दुनिया: कल्पना कीजिए कि विभिन्न अस्पतालों में नई दवाओं का परीक्षण किया जा रहा है। कुछ अस्पताल हल्के मामलों (आसान परीक्षण) का इलाज करते हैं, अन्य गंभीर मामलों (कठिन परीक्षण) का। यदि किसी दवा का परीक्षण केवल हल्के मामलों वाले अस्पतालों में किया जाता है, तो औसत स्कोर उसे एक चमत्कारिक इलाज के रूप में दिखाता है। "स्मार्ट कोच" ने इसे देख लिया और इसे सही ढंग से रैंक किया।
  3. सेल्फ-ड्राइविंग कार की दुनिया: कुछ कारों का परीक्षण केवल धूप वाले उपनगरों (आसान) में किया जाता है, जबकि अन्य का केवल बर्फबारी और कोहरे वाले चौराहों (कठिन) में। औसत स्कोर ने उन कारों की झूठी प्रशंसा की जिन्होंने कठिन मौसम से बचाव किया। "स्मार्ट कोच" सच्चाई जानता था।
  4. साइबर सुरक्षा की दुनिया: कुछ सुरक्षा सॉफ्टवेयर का परीक्षण केवल साधारण स्पैम (आसान) के खिलाफ किया जाता है, जबकि अन्य का परीक्षण बड़े, जटिल हैकिंग हमलों (कठिन) के खिलाफ किया जाता है। औसत स्कोर ने कमजोर सॉफ्टवेयर को एक किले जैसा दिखा दिया। "स्मार्ट कोच" ने इसे सुधारा।

"स्केलिंग लॉ": विफलता का नुस्खा

लेखकों ने एक विशिष्ट नियम खोजा जिसे वे इवैल्यूएशन फेल्योर स्केलिंग लॉ (Evaluation Failure Scaling Law) कहते हैं।

इसे एक खराब रैंकिंग के नुस्खे की तरह समझें:

खराब रैंकिंग = (गायब डेटा) × (कठिनाई का अंतर)

  • यदि आपके पास कोई गायब डेटा नहीं है (हर कोई हर परीक्षण देता है), तो औसत काम करता है।
  • यदि आपके पास कोई कठिनाई का अंतर नहीं है (सभी परीक्षण एक जैसे हैं), तो औसत काम करता है।
  • लेकिन यदि आपके पास दोनों हैं (डेटा गायब भी है और परीक्षणों की कठिनाई में भी भारी अंतर है), तो त्रुटि तेजी से बढ़ती है। जितना अधिक गायब डेटा और कठिनाई का अंतर होगा, "साधारण औसत" उतना ही बड़ा झूठ बोलेगा।

"फिजिकल AI" (रोबोट) के लिए यह क्यों मायने रखता है

यह शोध पत्र विशेष रूप से फिजिकल AI (वे रोबोट जो वास्तविक दुनिया में चलते-फिरते और क्रिया करते हैं) के बारे में चेतावनी देता है।

  • वर्तमान में, रोबोट बेंचमार्क बहुत "स्पार्स" (विरल) हैं। एक रोबोट को कप उठाने के लिए टेस्ट किया जा सकता है, दूसरे को बर्फ पर चलने के लिए, लेकिन शायद ही कभी उन्हें सब कुछ करने के लिए टेस्ट किया जाता है।
  • कठिनाई का अंतर बहुत बड़ा है (बर्फ पर चलना, कप उठाने की तुलना में बहुत कठिन है)।

इस कारण से, लेखक तर्क देते हैं कि वर्तमान रोबोट लीडरबोर्ड संभवतः गलत रोबोट को विजेता के रूप में रैंक कर रहे हैं। वे यह नहीं कह रहे हैं कि रोबोट बुरे हैं, बल्कि वे यह कह रहे हैं कि जिस तरीके से हम उन्हें रैंक करते हैं वह टूटा हुआ है।

निष्कर्ष (The Takeaway)

यह शोध पत्र यह दावा नहीं करता कि इसने एक आदर्श रोबोट या आदर्श मेडिकल टेस्ट बनाया है। इसके बजाय, यह कहता है:
"जब परीक्षण असमान और अधूरे हों, तो चीजों को रैंक करने के लिए साधारण कैलकुलेटर (औसत) का उपयोग करना बंद करें। एक 'स्मार्ट कोच' (IRT) का उपयोग करना शुरू करें जो परीक्षण की कठिनाई को समझता हो।"

वे इसे करने के लिए गणित और कोड प्रदान करते हैं, यह सुझाव देते हुए कि यदि हम वास्तव में जानना चाहते हैं कि सर्वश्रेष्ठ AI कौन है, तो हमें केवल अंक गिनना बंद करना होगा और चुनौतियों की कठिनाई को महत्व देना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →