← नवीनतम पेपर
🤖 machine learning

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

यह शोध पत्र U2-BENCH को प्रस्तुत करता है, जो विविध अल्ट्रासाउंड समझ कार्यों में 23 अत्याधुनिक लार्ज विजन-लैंग्वेज मॉडल्स की क्षमताओं और सीमाओं का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला व्यापक बेंचमार्क है, जो मजबूत वर्गीकरण प्रदर्शन लेकिन स्थानिक तर्क और नैदानिक रिपोर्ट पीढ़ी में महत्वपूर्ण चुनौतियों को प्रकट करता है।

मूल लेखक: Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Nobl
प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली, सुशिक्षित छात्र (एक AI) को यह सिखाने की कोशिश कर रहे हैं कि एक कुशल सोनोग्राफर कैसे बना जाए। आपके पास पाठ्यपुस्तकों (मेडिकल इमेज) का एक पुस्तकालय है, लेकिन एक पेंच है: अल्ट्रासाउंड की छवियां बेहद पेचीदा होती हैं।

X-ray या MRI के विपरीत, जो स्पष्ट, स्थिर तस्वीरों की तरह दिखते हैं, एक अल्ट्रासाउंड एक धुंधले कमरे के भीतर एक भूत के लाइव, हिलते-डुलते वीडियो को देखने जैसा है। यह पूरी तरह से इस बात पर निर्भर करता है कि व्यक्ति अपने हाथ में पकड़े हुए वैंड (wand) को कैसे चलाता है। यह शोर (static), छाया और अजीब कोणों से भरा होता है। लंबे समय तक, AI इन छवियों को "देखने" में संघर्ष करता रहा क्योंकि ये बहुत अव्यवस्त होती हैं और इन्हें समझने के लिए मानव शरीर रचना (human anatomy) की गहरी समझ की आवश्यकता होती है।

यहाँ आता है U2-BENCH

U2-BENCH को केवल एक परीक्षण के रूप में नहीं, बल्कि AI डॉक्टरों के लिए "अल्टीमेट ड्राइविंग टेस्ट" के रूप में सोचें।

समस्या: "अंधा" AI

अब तक, अधिकांश AI मॉडल स्पष्ट, उत्तम तस्वीरों (जैसे X-ray) पर प्रशिक्षित थे। जब आप उन्हें एक धुंधली, भ्रमित करने वाली अल्ट्रासाउंड छवि देते थे, तो वे अक्सर खो जाते थे। वे शायद यह कहने के बजाय कि "यह एक बच्चे का सिर है," कह देते थे, "मुझे एक धब्बा दिख रहा है," या वे ऐसी बीमारी का भ्रम (hallucinate) पैदा कर देते थे जो वहां थी ही नहीं। हमारे पास यह मापने का कोई निष्पक्ष तरीका नहीं था कि क्या ये नए, शक्तिशाली AI मॉडल वास्तव में अल्ट्रासाउंड की अव्यवस्त वास्तविकता को संभाल सकते हैं।

समाधान: U2-BENCH परीक्षा

लेखकों ने एक विशाल, मानकीकृत परीक्षा बनाई जिसे U2-BENCH कहा जाता है। यह कैसे काम करता है, इसके कुछ सरल उदाहरण यहाँ दिए गए हैं:

1. प्रश्न बैंक (डेटासेट)
एक विशाल पुस्तकालय की कल्पना करें जिसमें 7,241 अलग-अलग अल्ट्रासाउंड मामले शामिल हैं। ये केवल रैंडम तस्वीरें नहीं हैं; ये 15 अलग-अलग शरीर के अंगों (हृदय और लिवर से लेकर थायराइड और भ्रूण तक) को कवर करती हैं।

  • उपमा: यह एक ड्राइविंग स्कूल की तरह है जो केवल धूप वाले दिन खाली पार्किंग स्थल में आपका परीक्षण नहीं करता है। वे आपका परीक्षण बारिश में, रात में, हाईवे पर, स्कूल ज़ोन में और पैरेलल पार्किंग करते समय भी करते हैं। U2-BENCH AI का अल्ट्रासाउंड में पाए जाने वाले हर तरह के "मौसम" और "सड़क की स्थिति" में परीक्षण करता है।

2. परीक्षण विषय (8 कार्य)
यह परीक्षा केवल एक प्रकार के प्रश्न नहीं है। इसमें 8 अलग-अलग "अध्याय" हैं, जिनमें से प्रत्येक एक अलग कौशल का परीक्षण करता है:

  • "अंतर पहचानें" परीक्षण (Diagnosis): क्या AI एक धुंधली छवि को देखकर कह सकता है कि, "यह एक ट्यूमर है" या "यह सामान्य है"?
  • "मैं कहाँ हूँ?" परीक्षण (Localization): क्या AI सटीक रूप से बता सकता है कि समस्या कहाँ है? (जैसे, "गांठ ऊपर-बाएँ कोने में है")।
  • "गणित" परीक्षण (Measurement): क्या AI बच्चे के सिर का आकार या हृदय की दीवार की मोटाई माप सकता है?
  • "निबंध" परीक्षण (Report Generation): क्या AI जो वह देखता है उसका वर्णन करने के लिए सही शब्दावली का उपयोग करते हुए एक पेशेवर मेडिकल रिपोर्ट लिख सकता है?

3. छात्र (AI मॉडल)
शोधकर्ताओं ने 23 अलग-अलग AI मॉडलों को इस परीक्षा से गुजारा। कुछ "जनरलिस्ट" मॉडल हैं (जैसे एक बुद्धिमान छात्र जो हर चीज़ के बारे में थोड़ा जानता है), और कुछ "स्पेशलिस्ट" मॉडल हैं (जो केवल चिकित्सा के लिए प्रशिक्षित हैं)।

परिणाम: कौन पास हुआ?

परिणाम "बहुत बढ़िया!" और "वापस स्कूल जाओ" का मिश्रण थे।

  • अच्छी खबर: AI सरल पहचान (simple recognition) में बहुत अच्छा हो रहा है। यदि आप उन्हें एक तस्वीर दिखाते हैं और पूछते हैं, "क्या यह लिवर है या किडनी?", तो वे आमतौर पर बता सकते हैं। वे उन छात्रों की तरह हैं जिन्होंने फ्लैशकार्ड रट लिए हैं।
  • बुरी खबर: वे अभी भी स्थानिक तर्क (spatial reasoning) और जटिल गणित में बहुत खराब हैं।
    • उपमा: कल्पना कीजिए कि एक छात्र से मानचित्र को देखकर यह बताने के लिए कहा जाए कि एक विशिष्ट सड़क कहाँ है, या एक धुंधली फोटो के आधार पर कार की गति की गणना करने के लिए कहा जाए। AI अक्सर भ्रमित हो जाते हैं। वे यह समझने में संघर्ष करते हैं कि 3D स्थान में चीजें कहाँ हैं या एक सुसंगत, संरचित मेडिकल रिपोर्ट कैसे लिखी जाए।
    • "भ्रम" (Hallucination) का जोखिम: कभी-कभी, AI इतना आत्मविश्वासी होता है कि वह गलत होता है। वह एक बीमारी का आविष्कार कर सकता है या किसी महत्वपूर्ण विवरण को मिस कर सकता है क्योंकि छवि बहुत शोर भरी थी।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि AI एक शक्तिशाली उपकरण बनता जा रहा है, यह अभी मानव डॉक्टर की जगह लेने के लिए तैयार नहीं है।

वर्तमान AI को एक बहुत बुद्धिमान इंटर्न के रूप में देखें।

  • वे चार्ट पढ़ सकते हैं और सामान्य पैटर्न की पहचान कर सकते हैं।
  • लेकिन यदि छवि पेचीदा है, या यदि उन्हें यह निर्णय लेने की आवश्यकता है कि शरीर में कोई चीज़ कहाँ स्थित है, तो उन्हें अपना काम दोबारा जांचने के लिए एक मानव पर्यवेक्षक की आवश्यकता होती है।

U2-BENCH महत्वपूर्ण है क्योंकि यह हमें यह मानने से रोकता है कि AI पूर्ण है। यह हमें एक स्पष्ट स्कोरबोर्ड देता है ताकि शोधकर्ता जान सकें कि उन्हें अपनी ऊर्जा कहाँ केंद्रित करनी है: AI को केवल टेक्स्टबुक रटने के लिए नहीं, बल्कि "धुंध में बेहतर देखना" सिखाने के लिए।

संक्षेप में: हमने अंतिम अल्ट्रासाउंड टेस्ट बनाया, उसे सबसे स्मार्ट AI को दिया, और पाया कि हालांकि वे स्मार्ट हो रहे हैं, फिर भी उन्हें धुंध में उनका मार्गदर्शन करने के लिए एक मानव हाथ की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →