Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports
यह अध्ययन विषम बहु-पृष्ठीय प्रयोगशाला रिपोर्टों से संरचित डेटा निकालने के लिए विजन-लैंग्वेज मॉडलों का मूल्यांकन करता है, जिसमें यह पाया गया कि जबकि संपूर्ण-दस्तावेज़ प्रसंस्करण बेहतर गति प्रदान करता है, Qwen2.5-VL का उपयोग करने वाला पृष्ठ-दर-पृष्ठ वर्कफ़्लो विभिन्न दस्तावेज़ लंबाई के across उच्चतम सटीकता और स्थिरता प्राप्त करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अस्पताल हर दिन कागज और डिजिटल रिकॉर्ड का एक विशाल महासागर उत्पन्न करते हैं, जिसमें डॉक्टरों द्वारा लिखे गए वर्णनात्मक नोट्स से लेकर प्रयोगशाला परीक्षणों के सघन, सारणीबद्ध परिणाम तक सब कुछ शामिल है। यदि कंप्यूटरों को डॉक्टरों को बेहतर निर्णय लेने में मदद करनी है या शोधकर्ताओं को बीमारी के पैटर्न खोजने में मदद करनी है, तो इस जानकारी को छवियों और टेक्स्ट से साफ, व्यवस्थित डेटा में बदलना आवश्यक है जिसे मशीनें पढ़ सकें। यह प्रक्रिया, जिसे सूचना निष्कर्षण (इन्फॉर्मेशन एक्सट्रैक्शन) कहा जाता है, लंबे समय से एक बाधा रही है क्योंकि चिकित्सा दस्तावेज़ अव्यवस्थित होते हैं। वे विभिन्न आकारों, आकारों और प्रारूपों में आते हैं; कुछ एकदम स्पष्ट डिजिटल फाइलें हैं, जबकि अन्य पुराने कागज के धुंधले स्कैन हैं। इसके अलावा, जानकारी अक्सर कई पृष्ठों में बिखरी होती है, जहाँ परीक्षण के नाम, संख्याएँ और इकाइयाँ जटिल तालिकाओं में व्यवस्थित होती हैं जो एक अस्पताल से दूसरे अस्पताल में भिन्न दिख सकती हैं।
हाल के वर्षों में, इस चुनौती से निपटने के लिए 'विज़न-लैंग्वेज मॉडल' नामक एक नए प्रकार का आर्टिफिशियल इंटेलिजेंस उभरा है। पुराने सिस्टम के विपरीत जो केवल टेक्स्ट पढ़ सकते थे या केवल चित्र देख सकते थे, ये मॉडल एक दस्तावेज़ की तस्वीर देख सकते हैं और एक साथ उसके दृश्य लेआउट और शब्दों, दोनों को समझ सकते हैं। वे देख सकते हैं कि कोई संख्या किसी विशिष्ट परीक्षण से संबंधित है क्योंकि वह पृष्ठ पर उस स्थान पर स्थित है, न कि केवल इसलिए कि वह किसी विशिष्ट शब्द के बाद आती है। हालाँकि, जबकि ये मॉडल शक्तिशाली हैं, वैज्ञानिक पूरी तरह से यह नहीं समझ पाए थे कि इन जटिल, बहु-पृष्ठीय दस्तावेजों को उन्हें खिलाने (फीड करने) का सबसे अच्छा तरीका क्या है। क्या कंप्यूटर को एक साथ पूरे दस-पृष्ठ के रिपोर्ट को देखना चाहिए, या उसे एक-एक करके पृष्ठों का परीक्षण करना चाहिए? इस प्रश्न का उत्तर यह निर्धारित करता है कि क्या कंप्यूटर महत्वपूर्ण विवरणों को छोड़ देता है या अपना समय बर्बाद करता है, जो कि एक ऐसा अंतर है जिसका रोगी की देखभाल के मार्गदर्शन में गहरा महत्व है।
शोधकर्ताओं की एक टीम ने वास्तविक दुनिया की प्रयोगशाला रिपोर्टों के साथ एक नियंत्रित प्रयोग चलाकर इसका उत्तर खोजने का प्रयास किया। उन्होंने दो प्रमुख प्रदाताओं, लाल पैथलैब्स (Lal PathLabs) और थायरोकेयर (Thyrocare) से अज्ञात (de-identified) परीक्षण परिणाम एकत्र किए, और इन रिपोर्टों के डिजिटल और स्कैन किए गए दोनों प्रारूप बनाए। एक निष्पक्ष परीक्षण सुनिश्चित करने के लिए, उन्होंने तीन अलग-अलग लंबाई के दस्तावेज़ तैयार किए: एक छोटा एकल-पृष्ठ रिपोर्ट, एक मध्यम पाँच से छह पृष्ठों की रिपोर्ट, और एक दस पृष्ठों तक लंबी रिपोर्ट। फिर उन्होंने दो अग्रणी आर्टिफिशियल इंटेलिजेंस मॉडल, Qwen2.5-VL और Llama 3.2 Vision का उपयोग करके इन दस्तावेजों को संसाधित करने के तीन अलग-अलग तरीकों का परीक्षण किया। पहले दृष्टिकोण में मॉडल को पूरी रिपोर्ट को एक एकल छवि के रूप में देखने के लिए कहा गया। दूसरे दृष्टिकोण में मॉडल को प्रत्येक पृष्ठ को व्यक्तिगत रूप से देखने और फिर परिणामों को संयोजित करने के लिए कहा गया। तीसरे दृष्टिकोण में एक अलग मॉडल का उपयोग पृष्ठों को व्यक्तिगत रूप से देखने के लिए किया गया।
परिणामों से पता चला कि दस्तावेज़ को प्रस्तुत करने की रणनीति स्वयं मॉडल जितनी ही महत्वपूर्ण थी। जब शोधकर्ताओं ने Qwen2.5-VL मॉडल को रिपोर्ट को पृष्ठ-दर-पृष्ठ संसाधित करने के लिए कहा, तो इसने उच्चतम स्तर की सटीकता प्राप्त की, और लगभग 99 प्रतिशत अपेक्षित परीक्षण परिणामों को सही ढंग से पहचाना और दर्ज किया। यह विधि विशेष रूप से लंबी रिपोर्टों के लिए मजबूत साबित हुई; दस पृष्ठों के डेटा के साथ भी, पृष्ठ-दर-पृष्ठ दृष्टिकोण ने 98 प्रतिशत से अधिक की सटीकता बनाए रखी। इसके विपरीत, जब उसी मॉडल को एक साथ पूरी दस-पृष्ठ की रिपोर्ट देखने के लिए कहा गया, तो इसकी सटीकता काफी गिरकर लगभग 91 प्रतिशत हो गई। जब दस्तावेज़ बहुत लंबा होता था, तो मॉडल उन परीक्षणों को चूक जाता था जो बाद के पृष्ठों पर दिखाई देते थे।
इस उच्च सटीकता के बदले में समय का समझौता (trade-off) था। पूरे दस्तावेज़ को देखने वाले तरीके की तुलना में पृष्ठ-दर-पृष्ठ विधि को एक रिपोर्ट को संसाधित करने में लगभग दोगुना समय लगा। पूर्ण-दस्तावेज़ दृष्टिकोण तेज़ था और जब इसने कोई परीक्षण ढूँढ लिया तो अत्यंत सटीक भी था, लेकिन यह लंबी रिपोर्टों में छिपे कई परीक्षणों को देखने में विफल रहा। तीसरे वर्कफ़्लो में, जिसने पृष्ठों को एक-एक करके देखने के लिए Llama 3.2 Vision मॉडल का उपयोग किया, सबसे खराब प्रदर्शन किया। इसे पूरा होने में सबसे अधिक समय लगा, औसतन प्रति रिपोर्ट 108 सेकंड से अधिक, और इसने अक्सर गलत रिकॉर्ड बनाए या डेटा मिस कर दिया, जिससे कुल सटीकता 88 प्रतिशत से कम रही। इससे यह संकेत मिला कि दस्तावेज़ को टुकड़ों में तोड़ना ही पर्याप्त नहीं था; प्रस्तुति के तरीके के साथ-साथ मॉडल की विशिष्ट बुद्धिमत्ता भी उतनी ही महत्वपूर्ण थी।
अध्ययन ने यह भी जांचा कि दस्तावेज़ की गुणवत्ता ने परिणामों को कैसे प्रभावित किया। चाहे रिपोर्ट एक साफ डिजिटल फ़ाइल थी या कागज के दस्तावेज़ का स्कैन किया गया चित्र, इसने सर्वश्रेष्ठ प्रदर्शन करने वाले वर्कफ़्लो के प्रदर्शन में बहुत कम अंतर पैदा किया। Qwen2.5-VL मॉडल के साथ पृष्ठ-दर-पृष्ठ दृष्टिकोण ने मूल्यांकित स्कैन की गई स्थितियों के तहत भी पूर्ण सटीकता बनाए रखी, जिसमें लघु और मध्यम लंबाई की रिपोर्ट शामिल थीं। यह निष्कर्ष बताता है कि स्कैन की भौतिक गुणवत्ता उस रणनीति की तुलना में कम महत्वपूर्ण है जिसका उपयोग कंप्यूटर को जानकारी खिलाने के लिए किया जाता है। शोधकर्ताओं ने नोट किया कि अस्पताल की रिपोर्ट का विशिष्ट लेआउट भी भूमिका निभाता है, जिसमें एक प्रदाता की रिपोर्ट दूसरे की तुलना में थोड़ी आसान थी, लेकिन समग्र रुझान दोनों स्रोतों में समान रहा।
अंततः, यह शोध प्रदर्शित करता है कि चिकित्सा रिपोर्टों से डेटा निकालने का कोई एक "सर्वश्रेष्ठ" तरीका नहीं है। चुनाव पूरी तरह से उपयोगकर्ता की आवश्यकता पर निर्भर करता है। यदि किसी अस्पताल प्रणाली को हजारों रिपोर्टों को तेज़ी से संसाधित करने की आवश्यकता है और वह कुछ विवरणों को छूट देने को सहन कर सकती है जिन्हें बाद में पकड़ा जा सके, तो तेज़, पूर्ण-दस्तांत दृष्टिकोण उपयुक्त हो सकता है। हालाँकि, यदि लक्ष्य प्रत्येक एकल परीक्षण परिणाम का एक पूर्ण और विश्वसनीय रिकॉर्ड बनाना है, विशेष रूप से लंबी और जटिल दस्तावेजों से, तो धीमा, पृष्ठ-दर-पृष्ठ वाला तरीका बेहतर विकल्प है। अध्ययन इस निष्कर्ष पर पहुँचता है कि एक दस्तावेज़ को आर्टिफिशियल इंटेलिजेंस सिस्टम के सामने प्रस्तुत करने का तरीका एक महत्वपूर्ण डिज़ाइन निर्णय है जो चिकित्सा डेटा की विश्वसनीयता को सीधे प्रभावित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।