NEST: Nested Event Stream Transformer for Sequences of Multisets
यह शोध पत्र NEST, एक नेस्टेड इवेंट स्ट्रीम ट्रांसफॉर्मर को प्रस्तुत करता है जो मौजूदा फ्लैट मॉडल की कम्प्यूटेशनल अक्षमताओं और प्रतिनिधित्व सीमाओं को दूर करने के लिए इवेंट अनुक्रमों (मल्टीसेट्स के अनुक्रमों) की पदानुक्रमित संरचना को संरक्षित करता है, और प्रीट्रेनिंग दक्षता एवं डाउनस्ट्रीम प्रदर्शन दोनों को बढ़ाने के लिए एक नवीन मास्क्ड सेट मॉडलिंग प्रतिमान का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किसी मरीज के मेडिकल इतिहास को समझने की कोशिश कर रहे हैं, या शायद किसी ग्राहक की खरीदारी की आदतों को। वास्तविक दुनिया में, ये घटनाएँ एक-एक करके एक आदर्श सीधी रेखा में नहीं होती हैं जैसे मोतियों की एक माला। इसके बजाय, वे समूहों (groups) में होती हैं।
- अस्पताल में: एक डॉक्टर एक मरीज को देखता है (एक "एन्काउंटर" या मुलाकात)। उस मुलाकात के दौरान, मरीज का ब्लड टेस्ट, एक प्रिस्क्रिप्शन और एक निदान (diagnosis) एक साथ हो सकता है। उन तीनों चीजों का सटीक क्रम महत्वपूर्ण नहीं हो सकता, या रिकॉर्ड अस्त-व्यस्त हो सकते हैं। लेकिन उन घटनाओं का वह समूह उस विशिष्ट मुलाकात से संबंधित है।
- किराने की दुकान में: एक ग्राहक खरीदारी करने जाता है। वे दूध, ब्रेड और अंडे अपनी टोकरी में रखते हैं। वह "टोकरी" एक समूह है। उन्होंने सामान उठाने का क्रम मायने नहीं रखता; पूरी टोकरी एक इकाई के रूप में मायने रखती है।
वर्तमान के अधिकांश AI मॉडल (जिन्हें ट्रांसफॉर्मर कहा जाता है) इन समूहों को एक लंबी एकल घटना की रेखा में समतल (flatten) करने की कोशिश करते हैं। वे दूध, ब्रेड और अंडों के साथ ऐसा व्यवहार करते हैं जैसे वे एक के बाद एक घटित हुए हों, यह नजरअंदाज करते हुए कि वे एक ही खरीदारी यात्रा का हिस्सा थे। यह एक फिल्म को उसके हर एक फ्रेम की सूची देखकर समझने की कोशिश करने जैसा है बिना यह जाने कि कौन सा दृश्य किस सीन का हिस्सा है। यह गणनात्मक रूप से महंगा है और अक्सर बड़ी तस्वीर को समझने में चूक जाता है।
पेश है NEST (नेस्टेड इवेंट स्ट्रीम ट्रांसफॉर्मर)।
इस शोध पत्र के लेखकों ने एक नया AI मॉडल बनाया है जिसे NEST कहा जाता है जो इन प्राकृतिक समूहों का सम्मान करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. दो-चरणीय नृत्य (द आर्किटेक्चर)
डेटा को समतल करने के बजाय, NEST "समूहों" (जैसे अस्पताल की मुलाकातें या खरीदारी की टोकरियाँ) को बरकरार रखता है। यह अपने मस्तिष्क के प्रत्येक स्तर के भीतर एक चतुर दो-चरणीय प्रक्रिया का उपयोग करता है:
- चरण A: समूह की घेराबंदी (सेट-वाइज एनकोडर): सबसे पहले, मॉडल एक समूह (जैसे एक अस्पताल की मुलाकात) को देखता है और उस समूह की सभी घटनाओं को एक-दूसरे से बात करने देता है। यह समझता है कि उस मुलाकात के अंदर क्या हुआ। इसे एक टीम मीटिंग की तरह समझें जहाँ हर कोई अपने विशिष्ट कार्यों पर चर्चा करता है।
- चरण B: वैश्विक गोलमेज सम्मेलन (क्रॉस-सेट एनकोडर): इसके बाद, मॉडल प्रत्येक समूह के "कैप्टनों" (विशेष टोकन जिन्हें
[CLS]कहा जाता है) को देखता है। ये कप्तान अपने संबंधित समूहों में क्या हुआ, यह साझा करने के लिए मिलते हैं। यह मॉडल को यह समझने में मदद करता है कि मुलाकात A, मुलाकात B से कैसे संबंधित है।
जादुई ट्रिक: अधिकांश मॉडल सभी समूहों के लिए चरण A करते हैं, फिर सभी समूहों के लिए चरण B करते हैं। NEST इन्हें इंटरलीव्ड (interleaved - बारी-बारी से) करता है। यह चरण A का थोड़ा सा हिस्सा करता है, फिर चरण B का थोड़ा सा हिस्सा, और फिर वापस चरण A पर आता है।
- यह क्यों मायने रखता है: कल्पना कीजिए कि एक रिले रेस है। यदि आप बैटन पास करने से पहले पूरी पहली लेग (दौड़) पूरी कर लेते हैं, तो आप रास्ते में कुछ जानकारी खो सकते हैं। NEST लगातार बैटन को आगे-पीछे पास करता रहता है। यह सुनिश्चित करता है कि जब मॉडल बड़ी तस्वीर को समझने की कोशिश करता है, तो किसी विशिष्ट घटना का कोई भी विवरण नष्ट न हो। शोध पत्र गणितीय रूप से सिद्ध करता है कि यह "बायपास" पुराने तरीके की तुलना में अधिक जानकारी को जीवित रखता है।
2. "कैप्टन की रिपोर्ट" (मास्क्ड सेट मॉडलिंग)
पुराने तरीके में, AI द्वारा सारा डेटा प्रोसेस करने के बाद, उसे एक पूरी मुलाकात को एक एकल स्कोर में कैसे सारांशित किया जाए, इसका अनुमान लगाना पड़ता था। यह एक छात्र को पूरी किताब का अध्याय पढ़ने के बाद उसका सारांश लिखने के लिए कहने जैसा था, लेकिन केवल एक अस्पष्ट संकेत देने के बाद।
NEST एक नया प्रशिक्षण खेल पेश करता है जिसे मास्क्ड सेट मॉडलिंग (MSM) कहा जाता है।
- यह कैसे काम करता है: मॉडल को घटनाओं का एक समूह (जैसे खरीदारी की टोकरी) दिखाया जाता है, लेकिन उसे "कैप्टन" टोकन के आधार पर उस समूह की सामग्री का अनुमान लगाना होता है, जबकि वास्तविक वस्तुएं छिपी होती हैं।
- परिणाम: यह "कैप्टन" टोकन को पूरे समूह का एक सटीक सारांश बनने के लिए मजबूर करता है। बाद में किसी भी कार्य के लिए एक अव्यवस्थित, अनुमानित सारांश की आवश्यकता के बजाय, मॉडल के पास पहले से ही एक उच्च-गुणवत्ता वाला सारांश तैयार होता है।
3. यह बेहतर क्यों है (परिणाम)
लेखकों ने वास्तविक दुनिया के डेटा पर NEST का परीक्षण किया:
- मेडिकल रिकॉर्ड (EHR): उन्होंने अस्पतालों (MIMIC-IV) और एक निजी बाल चिकित्सा डेटाबेस का उपयोग किया।
- खरीदारी: उन्होंने किराने के डेटा (Instacart) का उपयोग किया।
निष्कर्ष:
- तेज़ और हल्का: क्योंकि NEST समूहों का सम्मान करता है, इसे हर एक घटना के बीच संबंध की गणना नहीं करनी पड़ती। यह केवल एक समूह के भीतर और समूह के कैप्टनों के बीच संबंध की गणना करता है। यह इसे पुराने मॉडलों की तुलना में तेज़ बनाता है और कम कंप्यूटर मेमोरी का उपयोग करता है, भले ही इसमें अधिक "मस्तिष्क शक्ति" (पैरामीटर्स) हो।
- बेहतर भविष्यवाणियाँ: NEST निम्नलिखित चीजों की भविष्यवाणी करने में बेहतर था:
- क्या मरीज की अस्पताल में रहने के दौरान मृत्यु हो जाएगी?
- क्या मरीज 30 दिनों के भीतर दोबारा भर्ती होगा?
- ग्राहक अगली बार क्या खरीदेगा?
- "पोस्ट-प्रोसेसिंग" की आवश्यकता नहीं: क्योंकि मॉडल ने प्रशिक्षण के दौरान समूहों को सारांशित करना सीख लिया था, इसलिए उसे डेटा को समझने के लिए प्रशिक्षण के बाद भ्रामक, अनुमानित तरीकों (heuristics) की आवश्यकता नहीं पड़ी। सारांश तैयार थे।
सारांश
NEST को एक ऐसे मॉडल के रूप में देखें जो अंततः समझता है कि संदर्भ (context) मायने रखता है। वह जानता है कि एक ही अस्पताल की मुलाकात के दौरान दी गई ब्लड टेस्ट और प्रिस्क्रिप्शन एक टीम हैं, और वह टीम मरीज के जीवन की एक बड़ी कहानी का हिस्सा है। इन समूहों को एक साथ रखकर और उन्हें कुशलतापूर्वक संवाद करने देकर, NEST उन मॉडलों की तुलना में तेज़ी से सीखता है, कम ऊर्जा का उपयोग करता है और बेहतर भविष्यवाणियाँ करता है जो सब कुछ एक लंबी एकल रेखा में बदलने की कोशिश करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।