← नवीनतम पेपर
💻 computer science

CCS: A Continuous Spatial-Semantic Concordance Score for Robust Evaluation of Object Detection Models

यह शोध पत्र CCS का प्रस्ताव करता है, जो एक निरंतर स्थानिक-अर्थ संबंधी सामंजस्य स्कोर (continuous spatial-semantic concordance score) है जो अस्थिर हार्ड-थ्रेशोल्ड मेट्रिक्स को गाऊसीय-आधारित स्थानिक समानता और वर्गीकरण-संचालित अर्थ संबंधी समानता से प्रतिस्थापित करता है ताकि ऑब्जेक्ट डिटेक्शन मॉडल का मजबूत, थ्रेशोल्ड-स्वतंत्र मूल्यांकन प्रदान किया जा सके, विशेष रूप से मेडिकल टंग डायग्नोसिस जैसे क्लास-इम्बैलेंस्ड और सिमेंटिक रूप से संरचित डोमेन में।

मूल लेखक: Quoc Thai Mai

प्रकाशित 2026-07-31
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quoc Thai Mai

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टैलेंट शो के जज हैं जहाँ प्रतियोगी एक विशाल, बिखरे हुए कमरे में छिपी हुई वस्तुओं को खोजने की कोशिश कर रहे हैं। कंप्यूटर विज़न की दुनिया में, ये "प्रतियोगी" AI मॉडल हैं, और "वस्तुएं" बिल्लियाँ, कारें, या इस विशेष मामले में, पारंपरिक चीनी चिकित्सा (Traditional Chinese Medicine) के विभिन्न प्रकार के जीभ के लक्षण हैं। वर्षों से, जज एक बहुत ही सख्त, 'सब-या-कुछ-नहीं' (all-or-nothing) वाले नियम पुस्तिका का उपयोग करते आए हैं: यदि AI एक वस्तु के चारों ओर एक बॉक्स बनाता है जो वास्तविक वस्तु के साथ कम से कम 50% ओवरलैप (overlap) करता है, तो उसे एक पूर्ण "सही" स्टैम्प मिलता है। यदि बॉक्स केवल 49% ओवरलैप होता है, तो उसे "गलत" स्टैम्प मिलता है, और इसका स्कोर बिल्कुल वैसा ही होता है जैसे कि AI ने उस वस्तु को पूरी तरह से मिस कर दिया हो। यह एक डांस प्रतियोगिता की तरह है जहाँ एक डांसर जो एक मिलीमीटर की चूक करता है, उसे उतना ही स्कोर मिलता है जितना कि उसे मिलता यदि उसने पूरा रूटीन ही भूल दिया होता। यह "हार्ड-थ्रेशोल्ड" (hard-threshold) नियम इन AI जासूसों की कुशलता मापने का मानक तरीका है, लेकिन इसमें एक दोष है: यह इस तथ्य को अनदेखा करता है कि कुछ गलतियाँ दूसरों की तुलना में सही होने के बहुत करीब होती हैं।

अब, एक नए प्रकार के जज की कल्पना करें जो न केवल बॉक्स को देखता है, बल्कि अनुमान के इरादे (intent) को भी सुनता है। यह नया जज समझता है कि यदि AI ने "लाल जीभ" का अनुमान लगाया जब वास्तविक उत्तर "लाल-धब्बेदार जीभ" था, तो यह कोई पूर्ण विफलता नहीं है; यह एक 'नियर-मिस' (near-miss) है जो दर्शाता है कि AI वास्तव में सामान्य विचार को समझता है। यह पेपर CCS (कंटीन्यूअस स्पेशियल-सिमेंटिक कॉनकॉर्डेंस स्कोर) नामक एक नया स्कोरिंग सिस्टम पेश करता है जो इस स्मार्ट जज की तरह काम करता है। एक साधारण "पास/फेल" स्विच के बजाय, CCS आंशिक क्रेडिट देता है। यह गणित का उपयोग यह मापने के लिए करता है कि AI का बॉक्स वास्तविक एक के कितने करीब है (भले ही वे पूरी तरह से न मिलें) और यह भी कि AI का लेबल चिकित्सा शब्दों के एक 'फैमिली ट्री' (family tree) में वास्तविक लेबल के कितने करीब है। लेखकों ने जीभ के लक्षणों को पहचानने की कोशिश करने वाले छह अलग-अलग AI मॉडलों पर इसका परीक्षण किया और पाया कि जबकि पुराने सख्त नियमों के कारण इनके रैंकिंग में मामूली बदलावों के कारण भारी उतार-चढ़ाव आता था, यह नया CCS स्कोर स्थिर और निष्पक्ष रहा, जो यह पहचानता है कि एक "करीब की चूक" वास्तव में प्रगति का संकेत है, न कि केवल एक विफलता।

"सब-या-कुछ-नहीं" स्कोरिंग की समस्या

लंबे समय से, AI ऑब्जेक्ट डिटेक्टर्स को ग्रेड देने का मानक तरीका "हॉट या कोल्ड" के खेल जैसा रहा है जिसमें एक बहुत ही तीखा कट-ऑफ होता है। यदि आपका अनुमान "हॉट" है (अर्थात बॉक्स वास्तविक वस्तु के साथ कम से कम 50% ओवरलैप करता है), तो आपको एक अंक मिलता है। यदि यह "कोल्ड" है (49.9% ओवरलैप), तो आपको शून्य मिलता है। यह IoU (इंटरसेक्शन ओवर यूनियन) थ्रेशोल्ड है। समस्या यह है कि यह एक ढलान (cliff) बनाता है। एक बॉक्स जो 99% परफेक्ट है और एक बॉक्स जो 51% परफेक्ट है, दोनों को समान स्कोर मिलता है, जबकि 49% परफेक्ट वाला बॉक्स कुछ भी नहीं पाता। यह एक छात्र के निबंध को ग्रेड देने जैसा है जहाँ एक पेपर जिसमें एक छोटी सी टाइपिंग की गलती है उसे 'A' मिलता है, लेकिन एक पेपर जिसमें उसी गलती के साथ एक कोमा भी गायब है उसे 'F' मिलता है।

इसके अलावा, यह पुराना सिस्टम सभी गलत लेबल्स को समान रूप से बुरा मानता है। यदि AI एक "लाल जीभ" देखता है लेकिन उसे "नीली जीभ" कहता है, तो यह एक बड़ी त्रुटि है। लेकिन यदि वह "लाल-धब्बेदार जीभ" को "लाल जीभ" कहता है, तो पुराना सिस्टम इसे उतना ही कठोरता से लेता है जितना कि "लाल जीभ" को "नीली जीभ" कहने के साथ। चिकित्सा की वास्तविक दुनिया में, दो समान लाल जीभों के बीच भ्रमित होना एक बहुत छोटी, अधिक क्षम्य गलती है। पुराना स्कोरिंग सिस्टम इस सूक्ष्मता को पूरी तरह से अनदेखा करता है।

CCS का आगमन: "आंशिक क्रेडिट" देने वाला जज

इस पेपर के लेखक, क्वोक थाई माई (Quoc Thai Mai), इन समस्याओं को ठीक करने के लिए CCS नामक एक नया स्कोर प्रस्तावित करते हैं। उन्होंने इसे दो मुख्य भागों के साथ बनाया है, जैसे कि दो सामग्रियों वाला एक स्मूदी जो अकेले किसी भी सामग्री से बेहतर स्वाद देता है।

1. स्थानिक भाग (Csp): "सॉफ्ट" बॉक्स
AI के बॉक्स को कठोर किनारों वाले एक सख्त आयत के रूप में मानने के बजाय, CCS बॉक्स की कल्पना एक नरम, धुंधले बादल (गणितीय रूप से, एक 2D गॉसियन डिस्ट्रीब्यूशन) के रूप में करता है। इसे एक हीट मैप की तरह सोचें: बॉक्स का केंद्र सबसे गर्म (सबसे अधिक आत्मविश्वास वाला) होता है, और जैसे-जैसे आप किनारों की ओर बढ़ते हैं, यह ठंडा होता जाता है। जब AI का धुंधला बादल वास्तविक वस्तु के धुंधले बादल के साथ ओवरलैप होता है, तो स्कोर केवल इसलिए शून्य नहीं हो जाता क्योंकि वे पूरी तरह से संरेखित (align) नहीं हैं। इसके बजाय, यह उनके केंद्रों के बीच की दूरी और उनके आकार के अंतर के आधार पर धीरे-धीरे कम होता जाता है। इसका अर्थ है कि एक थोड़ा सा ऑफ-सेंटर बॉक्स भी उच्च स्कोर प्राप्त करता है, न कि उसे एक पूर्ण चूक की तरह दंडित किया जाता है। यह एक जज के कहने के बीच का अंतर है, "आपने लक्ष्य चूक दिया, लेकिन आप करीब थे, इसलिए यहाँ आपको 'B' मिलता है," बनाम "आपने लक्ष्य चूक दिया, इसलिए यहाँ आपको 'F' मिलता है।"

2. सिमेंटिक भाग (Csem): गलतियों का "फैमिली ट्री"
यह दूसरा चतुर घटक है। लेखकों ने आठ अलग-अलग जीभ के लक्षणों को एक फैमिली ट्री (वर्गीकरण) में व्यवस्थित किया है। उदाहरण के लिए, "लाल जीभ" और "लाल-धब्बेदार जीभ" "रंग" (Color) की शाखा में सहोदर (siblings) हैं, जबकि "बढ़ी हुई जीभ" (Enlarged Tongue) "आकार" (Shape) की शाखा में है। यदि AI "लाल जीभ" का अनुमान लगाता है लेकिन ग्राउंड ट्रुथ "लाल-धब्बेदार जीभ" है, तो पुराना सिस्टम "गलत" कहता है। CCS सिस्टम फैमिली ट्री को देखता है, देखता है कि वे सहोदर हैं, और कहता है, "ठीक है, यह एक करीबी अनुमान है। आपको आंशिक क्रेडिट मिलता है।" यह सटीक गणना करने के लिए कि अनुमान सत्य के कितने करीब है, वू-पाल्मर समानता (Wu-Palmer similarity) नामक एक गणितीय उपकरण का उपयोग करता है। यदि AI "आकार" की समस्या के लिए "लाल जीभ" का अनुमान लगाता है, तो वह एक पूर्ण चूक है (शून्य क्रेडिट)। लेकिन यदि वह "लाल-धब्बेदार जीभ" के लिए "लाल जीभ" का अनुमान लगाता है, तो उसे उच्च आंशिक स्कोर मिलता है।

उन्होंने क्या पाया: स्थिरता और निष्पक्षता

टीम ने एक लोकप्रिय AI मॉडल (YOLOv8, v10, और v11) के छह अलग-अलग संस्करणों का जीभ के लक्षणों के डेटासेट पर परीक्षण किया। यहाँ क्या हुआ:

  • पुराने नियम अस्थिर थे: जब उन्होंने पुराने "हार्ड थ्रेशोल्ड" नियमों का उपयोग किया, तो AI मॉडलों की रैंकिंग इस बात पर निर्भर करती थी कि उन्होंने थ्रेशोल्ड को 0.3, 0.5, या 0.7 पर सेट किया था। वास्तव में, 15 मॉडल जोड़ियों में से 5 के लिए, "विजेता" इस बात पर बदल गया कि उन्होंने कौन सा नियम उपयोग किया। यह एक ऐसी दौड़ की तरह था जहाँ फिनिश लाइन को कुछ इंच खिसकाने मात्र से विजेता बदल गया।
  • CCS बेहद ठोस था: CCS स्कोर उल्लेखनीय रूप से स्थिर रहा। चाहे उन्होंने सेटिंग्स में कितना भी बदलाव किया हो, मॉडलों की रैंकिंग नहीं बदली। मॉडलों का स्कोर लगातार 0.62 और 0.65 के बीच रहा, जबकि पुराने F1 स्कोर सख्त नियमों के साथ काफी कम (16.9% तक) हो गए।
  • "नियर-मिस" का बचाव: अध्ययन में पाया गया कि जिसे पुराना सिस्टम "त्रुटि" कहता था, उसका एक बड़ा हिस्सा वास्तव में केवल "नियर-मिस" था। विशेष रूप से, सबसे कठिन वर्गों (classes) पर की गई गलतियों में से 39.5% सिमेंटिक रूप से करीब थे (जैसे "लाल" को "लाल-धब्बेदार" समझना)। पुराना सिस्टम इन्हें पूर्ण विफलता मानता था, लेकिन CCS ने उन्हें आंशिक क्रेडिट दिया, जिससे पता चला कि AI वास्तव में पुराने स्कोर की तुलना में बेहतर काम कर रहा था।
  • "सर्वश्रेष्ठ" मॉडल बदल गया: पुराने सख्त नियमों (mAP) के तहत, एक मॉडल (YOLOv10n) विजेता लग रहा था। लेकिन नए CCS नियमों के तहत, एक अलग मॉडल (YOLOv8m) शीर्ष स्थान पर आ गया। यह सुझाव देता है कि पुराने नियम उन मॉडलों का पक्ष ले रहे थे जो केवल पिक्सेल-परफेक्ट केंद्र हिट करने में अच्छे थे, जबकि CCS ने उन मॉडलों को पसंद किया जो सामान्य अवधारणा और लक्षणों के आकार को बेहतर समझते थे।

सीमाएँ: CCS अभी क्या नहीं कर सकता

लेखक सावधानीपूर्वक यह स्पष्ट करते हैं कि CCS कोई जादुई छड़ी नहीं है जो सब कुछ हल कर दे।

  • यह एक "क्लास-लेवल" स्कोर है: वर्तमान में, CCS एक क्लास (जैसे "लाल जीभ") को तब मौजूद मानता है यदि AI उसके लिए कम से कम एक अच्छा बॉक्स पाता है। यह AI को दंडित नहीं करता है यदि जीभ पर 20 लाल धब्बे हैं और AI केवल 1 को पाता है। पेपर नोट करता है कि कुछ लक्षणों के लिए, जैसे "लाल-धब्बेदार जीभ", एक ही इमेज में दर्जनों धब्बे हो सकते हैं, और वर्तमान CCS विधि उन धब्बों को अनदेखा करती है जिन्हें वह मिस कर देता है।
  • फैमिली ट्री अस्थायी है: जीभ के लक्षणों के लिए जो "फैमिली ट्री" उन्होंने बनाया था, वह लेखकों द्वारा गणित को काम करने के लिए बनाया गया था, न कि चिकित्सा विशेषज्ञों के पैनल द्वारा। यह एक "प्रोविजनल" (अस्थायी) पेड़ है। यदि एक वास्तविक डॉक्टर कहता है, "नहीं, वे दो लक्षण वास्तव में संबंधित नहीं हैं," तो स्कोर की पुनर्गणना करनी होगी।
  • केवल एक डेटासेट: उन्होंने इसका परीक्षण केवल एक डेटासेट पर किया है। हालांकि परिणाम आशाजनक हैं, हमें अभी यह नहीं पता कि क्या यह कारों, ट्यूमर या अन्य वस्तुओं का पता लगाने के लिए बिना अधिक परीक्षण के पूरी तरह से काम करता है।

निष्कर्ष

यह पेपर सुझाव देता है कि हमें AI जासूसों को ग्रेड देने के लिए एक नए तरीके की आवश्यकता है। पुराना "पास/फेल" सिस्टम बहुत कठोर और अस्थिर है, जो AI को थोड़ा सा चूक जाने के लिए दंडित करता है और इस तथ्य को अनदेखा करता है कि कुछ गलतियाँ दूसरों की तुलना में अधिक समझदारी भरी होती हैं। CCS स्कोर एक अधिक सहज और निष्पक्ष तरीका प्रदान करता है, जो स्थान में करीब होने और अर्थ में करीब होने के लिए आंशिक क्रेडिट देकर AI का मूल्यांकन करता है। हालांकि यह अभी हर चिकित्सा अनुप्रयोग के लिए तैयार कोई अंतिम उत्पाद नहीं है, फिर भी यह AI मूल्यांकन को अधिक मानव-अनुकूल और नैदानिक रूप से प्रासंगिक बनाने में बहुत आशाजनक दिखता है, विशेष रूप से उन क्षेत्रों में जहाँ लक्षणों के बीच की रेखाएं अक्सर धुंधली होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →