← नवीनतम पेपर
📄 radiology and imaging

Quality versus quantity of training datasets for artificial intelligence-based whole liver segmentation

यह अध्ययन प्रदर्शित करता है कि जबकि अत्यधिक क्यूरेटेड, छोटे डेटासेट बहुत बड़े मिश्रित-क्यूरेशन डेटासेट के समान 3D सेगमेंटेशन प्रदर्शन प्राप्त कर सकते हैं, उत्तरवर्ती बेहतर सामान्यीकरण और स्थानीय सुधार प्रदान करता है, जो यह संकेत देता है कि डेटा की गुणवत्ता और मात्रा के बीच इष्टतम संतुलन विशिष्ट प्रशिक्षण लक्ष्यों पर निर्भर करता है।

मूल लेखक: Castelo, A., O'Connor, C., Gupta, A. C., Anderson, B. M., Woodland, M., Altaie, M., Koay, E. J., Odisio, B. C., Tang, T. T., Brock, K. K.

प्रकाशित 2026-02-18
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Castelo, A., O'Connor, C., Gupta, A. C., Anderson, B. M., Woodland, M., Altaie, M., Koay, E. J., Odisio, B. C., Tang, T. T., Brock, K. K.

मूल पेपर CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मेडिकल स्कैन में लिवर के चारों ओर एक सटीक रूपरेखा (outline) बनाना सिखाने की कोशिश कर रहे हैं। मुख्य सवाल जो शोधकर्ताओं ने पूछा था वह था: क्या रोबोट को कुछ बेहतरीन उदाहरण दिखाना बेहतर है, या हजारों "ठीक-ठाक" उदाहरण दिखाना?

यहाँ उनके प्रयोग का विवरण एक सरल उपमा (analogy) के साथ दिया गया है:

सेटअप: आर्ट क्लास

AI मॉडल को एक आर्ट क्लास के छात्र के रूप में सोचें, और मेडिकल स्कैन्स को उन विषयों के रूप में जिन्हें उन्हें ड्रा करना है।

  • "हाइली क्यूरेटेड" (Highly Curated) ग्रुप: यह एक ऐसे छात्र की तरह है जिसे केवल 244 ड्राइंग्स को पढ़ने का मौका मिलता है, लेकिन उनमें से हर एक एक मास्टर कलाकार द्वारा बनाई गई है। रेखाएं एकदम सटीक हैं, शेडिंग सही है, और कोई गलती नहीं है।
  • "मिक्सड क्यूरेशन" (Mixed-Curation) ग्रुप: यह एक ऐसे छात्र की तरह है जिसे 2,840 ड्राइंग्स को पढ़ने को मिलता है। अधिकांश अच्छी हैं, लेकिन कुछ में रेखाएं डगमगा रही हैं, कुछ थोड़ी बिखरी हुई हैं, और कुछ बस "ठीक-ठाक" हैं। यह काम का एक बहुत बड़ा ढेर है, लेकिन इसकी गुणवत्ता अलग-अलग है।

टेस्ट: फाइनल एग्जाम

छात्रों ने अपनी संबंधित ड्राइंग्स के ढेर का अध्ययन करने के बाद, एक टेस्ट दिया। शोधकर्ताओं ने उन्हें नई, अनदेखी स्कैन्स दीं ताकि वे आउटलाइन बना सकें और यह मापा कि उनकी ड्राइंग्स "परफेक्ट" उत्तर के कितने करीब थीं।

उन्होंने यह देखने के लिए एक स्कोरिंग सिस्टम (जैसे कि "क्लोजनेस स्कोर") का उपयोग किया कि कौन बेहतर प्रदर्शन करता है।

परिणाम: क्या हुआ?

  1. मुख्य स्कोर (3D परफॉरमेंस):
    आश्चर्यजनक रूप से, जिस छात्र ने परफेक्ट ड्राइंग्स के छोटे ढेर का अध्ययन किया था, उसने उस छात्र के बराबर ही प्रदर्शन किया जिसने मेसी (messy) ड्राइंग्स के विशाल ढेर का अध्ययन किया था।

    • उपमा: यह कहने जैसा है कि जिस छात्र ने 244 परफेक्ट रेसिपी याद कर ली हैं, वह एक स्वादिष्ट भोजन बनाने में उतना ही सक्षम है जितना कि वह छात्र जिसने 2,800 अलग-अलग रेसिपी चखी हैं, भले ही उन 2,800 में से कुछ थोड़ी जली हुई या कम पकी हुई हों। अंतिम व्यंजन के मामले में, दोनों बराबरी पर थे।
  2. "रियल वर्ल्ड" टेस्ट (जनरलाइज़ेबिलिटी):
    हालाँकि, जब शोधकर्ताओं ने छात्रों का परीक्षण एक बिल्कुल अलग प्रकार की परीक्षा पर किया (एक अलग अस्पताल के डेटा का उपयोग करके), तो मेसी ड्राइंग्स के विशाल ढेर वाले छात्र ने एक छोटे अंतर से जीत हासिल की।

    • उपमा: जिस छात्र ने हजारों अलग-अलग, थोड़ी अपूर्ण उदाहरणों को देखा था, उसने "अजीब" स्थितियों को बेहतर तरीके से संभालने के लिए अधिक लचीलापन सीखा। वे अधिक अनुकूलनीय (adaptable) थे जब टेस्ट उनके द्वारा पढ़े गए डेटा से अलग था।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर यह निष्कर्ष निकालता है कि गुणवत्ता और मात्रा एक संतुलन है, न कि केवल "एक दूसरे से बेहतर है" वाला सरल नियम।

  • यदि आपको एक ऐसा मॉडल चाहिए जो मानक, साफ डेटा पर पूरी तरह से काम करे, तो आपको लाखों इमेज की आवश्यकता नहीं हो सकती; एक छोटा, उच्च-गुणवत्ता वाला सेट पर्याप्त है।
  • लेकिन, यदि आप चाहते हैं कि AI एक "गिरगिट" (chameleon) की तरह हो जो अजीब, बिखरे हुए या अलग वास्तविक दुनिया के डेटा को संभाल सके, तो बड़ी मात्रा में डेटा होने से—भले ही वह परफेक्ट न हो—उसे बढ़त मिलती है।

संक्षेप में: किसी विषय को सीखने के लिए आपको हमेशा लाखों किताबों के पुस्तकालय की आवश्यकता नहीं होती, लेकिन यदि आप एक ऐसा विशेषज्ञ बनना चाहते हैं जो आपके सामने आने वाले किसी भी प्रश्न को संभाल सके, तो एक विशाल (भले ही थोड़ा बिखरा हुआ) पुस्तकालय आपको बड़े परिदृश्य को समझने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →