← नवीनतम पेपर
💻 computer science

Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

यह शोधपत्र UNICORN को प्रस्तुत करता है, जो एक एकीकृत सार्वजनिक बेंचमार्क है जिसमें कई संस्थानों के विविध इमेजिंग और प्राकृतिक भाषा डेटा से मेडिकल फाउंडेशन मॉडल्स की क्रॉस-मोडैलिटी और क्रॉस-टास्क सामान्यीकरण (जनरलाइजेशन) का व्यवस्थित रूप से आकलन करने के लिए एक मानकीकृत दो-चरणीय मूल्यांकन ढांचा और एक नवीन समग्र मीट्रिक शामिल है।

मूल लेखक: Michelle Stegeman, Lena Philipp, Fennie van der Graaf, Marina D'Amato, Clément Grisi, Luc Builtjes, Joeran S. Bosma, Judith Lefkes, Rianne A. Weber, James A. Meakin, Thomas Koopman, Anne Mickan, Mathi
प्रकाशित 2026-03-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michelle Stegeman, Lena Philipp, Fennie van der Graaf, Marina D'Amato, Clément Grisi, Luc Builtjes, Joeran S. Bosma, Judith Lefkes, Rianne A. Weber, James A. Meakin, Thomas Koopman, Anne Mickan, Mathias Prokop, Ewoud J. Smit, Geert Litjens, Jeroen van der Laak, Bram van Ginneken, Maarten de Rooij, Henkjan Huisman, Colin Jacobs, Francesco Ciompi, Alessa Hering

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक परम "मेडिकल स्विस आर्मी नाइफ" (medical Swiss Army Knife) बनाने की कोशिश कर रहे हैं। आप एक ऐसा एकल AI रोबोट चाहते हैं जो एक्स-रे देख सके, माइक्रोस्कोप के नीचे पैथोलॉजी स्लाइड को पढ़ सके, और डॉक्टर के लिखे नोट्स को समझ सके, साथ ही इतना स्मार्ट भी हो कि शरीर के विभिन्न अंगों की विभिन्न बीमारियों का निदान कर सके।

लंबे समय से, वैज्ञानिक इन "मेडिकल फाउंडेशन मॉडल्स" (स्विस आर्मी नाइफ) को बनाने की कोशिश कर रहे हैं। लेकिन एक बड़ी समस्या थी: आप यह कैसे परीक्षण करेंगे कि वह चाकू वास्तव में कितना अच्छा है?

पहले, परीक्षण करना ऐसा था जैसे रोबोट को हर कार्य के लिए एक अलग परीक्षा देना।

  • यदि उन्हें फेफड़ों के नोड्यूल्स (lung nodules) खोजने के लिए परीक्षण करना था, तो वे उसे फेफड़ों की परीक्षा देते थे।
  • यदि उन्हें हृदय की रिपोर्ट पढ़नी थी, तो वे उसे हृदय की परीक्षा देते थे।
  • यदि उन्हें कैंसर कोशिकाओं को पहचानना था, तो वे उसे कैंसर की परीक्षा देते थे।

समस्या यह थी कि प्रत्येक परीक्षा के नियम, अलग स्कोरिंग सिस्टम और अलग शिक्षक थे। आप परिणामों की तुलना नहीं कर सकते थे। यह ऐसा ही था जैसे किसी तैराक के पूल में समय और एक धावक के ट्रैक पर समय की तुलना करके यह तय करना कि सबसे अच्छा एथलीट कौन है, बिना किसी सामान्य मानक के।

प्रवेश होता है UNICORN का।

यह पेपर UNICORN (Unified beNchmark for Imaging in COmputational pathology, Radiology, and Natural language) को पेश करता है। UNICORN को मेडिकल AI के लिए ओलंपिक के रूप में समझें।

यह कैसे काम करता है, इसे सरल रूप में यहाँ दिया गया है:

1. भव्य अखाड़ा (20 कार्य/Tasks)

एक एकल परीक्षण के बजाय, UNICORN ने एक विशाल स्टेडियम में 20 अलग-अलग "इवेंट्स" आयोजित किए।

  • विज़न इवेंट्स (Vision Events): एक्स-रे, सीटी स्कैन और माइक्रोस्कोप स्लाइड जैसी छवियों को देखना।
  • लैंग्वेज इवेंट्स (Language Events): डॉक्टरों की रिपोर्ट को पढ़ना और समझना।
  • हाइब्रिड इवेंट्स (Hybrid Events): एक छवि को देखना और उसके बारे में रिपोर्ट लिखना।

ये इवेंट्स टूटी हुई हड्डी को पहचानने से लेकर, कैंसर कोशिकाओं को गिनने तक, और रोगी के जीवित रहने की अवधि की भविष्यवाणी करने तक सब कुछ कवर करते हैं। यह एक वास्तविक "ऑल-राउंड" टेस्ट है।

2. गुप्त नुस्खा: "फ्यू-शॉट" अनुकूलन (The "Few-Shot" Adaptation)

यहाँ चतुराई भरा हिस्सा है। वास्तविक दुनिया में, डॉक्टरों के पास हर नई बीमारी के लिए लाखों लेबल किए गए उदाहरण नहीं होते हैं। उनके पास केवल कुछ ही उदाहरण हो सकते हैं।

इसलिए, UNICORN AI को सब कुछ फिर से सीखने के लिए नहीं कहता। इसके बजाय, यह एक "फ्यू-शॉट" (Few-Shot) दृष्टिकोण का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक मास्टर शेफ (फाउंडेशन मॉडल) हैं जो सब कुछ बनाना जानते हैं। टेस्ट आपसे एक किताब से नई रेसिपी सीखने के लिए नहीं कहता। इसके बजाय, जज आपको एक नए व्यंजन के तीन उदाहरण (फ्यू-शॉट उदाहरण) देते हैं और पूछते हैं, "क्या आप यह बना सकते हैं?"
  • परीक्षण: AI उन कुछ उदाहरणों को देखता है, जल्दी से पैटर्न को समझता है, और फिर समस्या को हल करने की कोशिश करता है। यह परीक्षण करता है कि AI का मस्तिष्क वास्तव में कितना लचीला और स्मार्ट है, न कि यह कि उसने कितना रटा हुआ है।

3. "ब्लैक बॉक्स" टेस्ट (सेक्वेस्टर्ड डेटा)

यह सुनिश्चित करने के लिए कि कोई नकल न कर सके, अंतिम परीक्षण प्रश्नों को एक लॉक्ड वॉल्ट (सेक्वेस्टर्ड टेस्ट सेट्स) में रखा जाता है।

  • वैज्ञानिक सार्वजनिक डेटा (जैसे अभ्यास का मैदान) पर अभ्यास कर सकते हैं, लेकिन वे अपना AI जमा करने तक अंतिम उत्तर कभी नहीं देख सकते।
  • यह सुनिश्चित करता है कि AI केवल उत्तरों को याद नहीं कर रहा है, बल्कि वास्तव में सामान्यीकरण (generalize) करना सीख रहा है।

4. स्कोरबोर्ड: UNICORN स्कोर

चूंकि 20 कार्य बहुत अलग हैं (कुछ गिनने के बारे में हैं, कुछ लिखने के बारे में, कुछ आकृतियों को खोजने के बारे में), तो आप उन्हें जोड़ते कैसे हैं?

  • UNICORN ने एक यूनिवर्सल स्कोरकार्ड बनाया। उन्होंने प्रत्येक परिणाम को एक मानक 0-से-1 स्कोर में बदल दिया।
  • फिर, उन्होंने उन सभी का औसत निकाला ताकि एक एकल संख्या प्राप्त हो सके: UNICORN स्कोर
  • यह मेडिकल AI के लिए एक "GPA" की तरह है। यदि किसी AI का UNICORN स्कोर अधिक है, तो इसका मतलब है कि वह एक बहुमुखी, विश्वसनीय डॉक्टर सहायक है जो लगभग कुछ भी संभाल सकता है।

यह क्यों मायने रखता है?

UNICORN से पहले, यदि कोई कंपनी दावा करती थी कि उनका AI "सर्वश्रेष्ठ" है, तो वे केवल आपको यह दिखा सकते थे कि वह एक विशिष्ट चीज़ में कितना अच्छा है। अब, हमारे पास यह देखने का एक मानकीकृत, निष्पक्ष और पारदर्शी तरीका है कि कौन सा AI वास्तव में सबसे अधिक बहुमुखी है।

यह उस कार के बीच का अंतर है जो केवल रेस ट्रैक पर चल सकती है और उस कार के बीच जो रेस ट्रैक, कीचड़ भरे पहाड़, बर्फीली सड़क और शहर की सड़क—सभी पर चल सकती है। UNICORN हमें वह कार खोजने में मदद करता है जो चिकित्सा के सभी रास्तों को संभाल सकती है।

संक्षेप में: UNICORN पहली बार है जब हमने सभी मेडिकल AI "एथलीटों" को एक ही अखाड़े में, समान नियमों के साथ रखा है, ताकि यह देखा जा सके कि कौन वास्तव में सबसे अधिक अनुकूल और वास्तविक दुनिया के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →