← नवीनतम पेपर
⚛️ high-energy experiments

Scaling Collider Event Generation with Residual-Quantized Tokens

यह शोध पत्र रेसिडुअल-क्वांटाइज्ड टोकन्स का उपयोग करके पूर्ण कोलाइडर इवेंट्स उत्पन्न करने के लिए एक स्केलेबल, ऑटोरेग्रेसिव ट्रांसफार्मर-आधारित ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि टोकन-स्तरीय लॉस भौतिक निष्ठा (फिजिकल फिडेलिटी) का प्रभावी ढंग से पूर्वानुमान लगाता है और हाई-ल्यूमिनोसिटी LHC सिमुलेशन में बाधाओं को दूर करने के लिए तेज़, एमएल-आधारित सरोगेट्स को सक्षम बनाता है।

मूल लेखक: Dan Godi, Dmitrii Kobylianskii, Eilam Gross

प्रकाशित 2026-10-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dan Godi, Dmitrii Kobylianskii, Eilam Gross

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यूरोप के हृदय स्थल में, जहाँ लार्ज हैड्रोन कोलाइडर (Large Hadron Collider) प्रोटॉन को लगभग प्रकाश की गति से आपस में टकराता है, वैज्ञानिक भारी मात्रा के डेटा की समस्या का सामना कर रहे हैं। जब आने वाले वर्षों में यह मशीन अपनी पूरी शक्ति पर पहुँचेगी, तो यह इतना अधिक डेटा उत्पन्न करेगी कि डिटेक्टर के भीतर क्या होता है, इसका अनुकरण (सिमुलेशन) करने के लिए आवश्यक कंप्यूटरों के पास समय और मेमोरी की कमी हो जाएगी। इन टक्करों को समझने के लिए, शोधकर्ता पारंपरिक रूप से विशाल, चरण-दर-चरण कंप्यूटर प्रोग्रामों पर निर्भर करते हैं जो डिटेक्टर के माध्यम से उड़ने वाले प्रत्येक कण के व्यवहार की नकल करते हैं। ये प्रोग्राम अविश्वसनीय रूप से सटीक हैं लेकिन भी अविश्वसनीय रूप से धीमे भी हैं, जिन्हें नए सिद्धांतों का परीक्षण करने के लिए आवश्यक सिंथेटिक डेटा बनाने के लिए भारी मात्रा में कंप्यूटिंग शक्ति की आवश्यकता होती है। वैज्ञानिक समुदाय को इन सिमुलेशन को उत्पन्न करने के लिए एक तेज़ तरीके की आवश्यकता है, जो परिणामों की भौतिक वास्तविकता से समझौता किए बिना मशीन की गति के साथ तालमेल बिठा सके।

इजराइल के वीज़मैन इंस्टीट्यूट ऑफ साइंस के शोधकर्ताओं की एक टीम ने भाषा मॉडल (language models) की दुनिया से एक तकनीक उधार लेकर एक समाधान प्रस्तावित किया है। जिस तरह आधुनिक आर्टिफिशियल इंटेलिजेंस (AI) एक वाक्य में अगले शब्द की भविष्यवाणी करके सुसंगत कहानियाँ लिख सकता है, ठीक उसी तरह इन वैज्ञानिकों ने एक समान प्रणाली को कणों की टक्कर के अगले "टुकड़े" (piece) की भविष्यवाणी करने के लिए प्रशिक्षित किया है। कण की गति और स्थिति का वर्णन करने वाली अव्यवस्थित, निरंतर संख्याओं के साथ निपटने के बजाय, उन्होंने पहले प्रत्येक कण को प्रतीकों के एक संक्षिप्त, असतत अनुक्रम (discrete sequence) में अनुवादित किया, बिल्कुल वैसे ही जैसे एक वाक्य को अक्षरों की एक श्रृंखला में बदलना। इसके बाद वे इन प्रतीक अनुक्रमों के पैटर्न को सीखने के लिए एक शक्तिशाली कंप्यूटर मॉडल का उपयोग करते हैं, जिससे यह अगले प्रतीक की भविष्यवाणी करके नए, वास्तविक टक्कर कार्यक्रमों को उत्पन्न करने में सक्षम होता है। यह दृष्टिकोण कण डिटेक्टर की जटिल भौतिकी को एक भाषा की समस्या में बदल देता है, जहाँ कंप्यूटर उप-परमाणु अंतःक्रियाओं के व्याकरण को सीखता है।

शोधकर्ताओं ने इस पद्धति का परीक्षण CMS डिटेक्टर के डेटा पर किया, जो प्रोटॉन टक्करों के मलबे को रिकॉर्ड करने वाला एक विशाल उपकरण है। उन्होंने वास्तविक टक्कर घटनाओं को लेकर उन्हें अपने मौलिक घटकों में विभाजित किया: वे कण जो टक्कर से निकलते हैं और वे संकेत जो वे डिटेक्टर में छोड़ते हैं। इस डेटा को अपने मॉडल के लिए प्रबंधनीय बनाने के लिए, उन्होंने प्रत्येक कण के निरंतर भौतिक गुणों—जैसे कि उसका संवेग (momentum) और दिशा—को डिजिटल कोडों के एक निश्चित सेट में संकुचित करने के लिए एक विशेष उपकरण का उपयोग किया। यह प्रक्रिया एक उच्च-रिज़ॉल्यूशन वाली तस्वीर को पिक्सेल मानों की एक श्रृंखला में अनुवाद करने के समान है जिसे एक कंप्यूटर आसानी से संग्रहीत और हेरफेर कर सकता है। इन अनुवादित लाखों घटनाओं पर अपने मॉडल को प्रशिक्षित करके, सिस्टम ने कोड के नए अनुक्रमों को उत्पन्न करना सीखा, जो भौतिक संख्याओं में वापस परिवर्तित होने पर वास्तविक डिटेक्टर डेटा की तरह दिखते और व्यवहार करते थे।

जो इस कार्य को विशेष रूप से महत्वपूर्ण बनाता है वह यह है कि शोधकर्ताओं ने कैसे सत्यापित किया कि उत्पन्न डेटा न केवल सांख्यिकीय रूप से समान था, बल्कि भौतिक रूप से भी विश्वसनीय था। उन्होंने केवल यह नहीं देखा कि कणों की औसत गति मेल खाती है या नहीं; उन्होंने व्यक्तिगत कणों से लेकर मलबे के जटिल स्प्रे (jets) तक, घटनाओं की पूरी संरचना की जांच की। उन्होंने पाया कि मॉडल सफलतापूर्वक उन सूक्ष्म, यादृच्छिक उतार-चढ़ाव को फिर से बनाने में सक्षम था जो डिटेक्टर सामग्री के साथ कणों की अंतःक्रिया करते समय होते हैं। महत्वपूर्ण रूप से, सिस्टम उन भौतिक प्रक्रियाओं के लिए घटनाएं उत्पन्न करने में सक्षम था जिन्हें उसने पहले कभी नहीं देखा था, जैसे कि दुर्लभ कण क्षय (decays) के विशिष्ट प्रकार, प्रारंभिक टक्कर मापदंडों पर अपनी भविष्यवाणियों को अनुकूलित (condition) करके। यह सुझाव देता है कि मॉडल ने केवल प्रशिक्षण डेटा को याद करने के बजाय डिटेक्टर की प्रतिक्रिया के अंतर्निहित नियमों को सीख लिया है, जो एक ऐसे उपकरण के लिए एक अनिवार्य आवश्यकता है जिसे भविष्य की खोजों के अज्ञात भौतिकी को संभालना होगा।

टीम ने यह भी जांचा कि मॉडल का आकार और उसके द्वारा देखे गए डेटा की मात्रा उसके प्रदर्शन को कैसे प्रभावित करती है। उन्होंने दस मिलियन से लेकर एक अरब से अधिक पैरामीटर वाले संस्करणों को प्रशिक्षित किया, और विभिन्न आकारों के डेटासेट पर उनका परीक्षण किया। उन्होंने एक स्पष्ट और अनुमानित संबंध पाया: जैसे-जैसे मॉडल बड़े होते गए और उन्होंने अधिक डेटा देखा, उनकी भविष्यवाणियों में त्रुटि एक सुसंगत, गणितीय तरीके से कम होती गई। शायद सबसे महत्वपूर्ण बात यह है कि उन्होंने पाया कि मॉडल द्वारा अनुक्रम में अगले प्रतीक की कितनी अच्छी तरह भविष्यवाणी की जाती है, यह एक विश्वसनीय संकेतक था कि अंतिम भौतिक परिणाम कितने सटीक होंगे। इसका अर्थ है कि वैज्ञानिक अंतिम आउटपुट की जाँच करने के लिए महंगे, पूर्ण-स्तरीय सिमुलेशन चलाने की आवश्यकता के बिना, मॉडल की आंतरिक त्रुटि दर का उपयोग उत्पन्न भौतिकी की गुणवत्ता का आकलन करने के लिए कर सकते हैं।

यह प्रदर्शित करके कि ये असतत, भाषा-आधारित मॉडल एक कण डिटेक्टर के जटिल आउटपुट को सफलतापूर्वक पुनरुत्पादित कर सकते हैं, शोधकर्ताओं ने कोलाइडर सिमुलेशन को बढ़ाने के लिए एक नया मार्ग प्रदान किया है। उनका कार्य दिखाता है कि भविष्य की खोजों को धीमा करने वाले कंप्यूटिंग बाधाओं को पार करना संभव है। यह विधि एक सरल सिद्धांत पर आधारित है: यदि आप भौतिकी की भाषा को एक ऐसे प्रारूप में अनुवादित कर सकते हैं जिसे कंप्यूटर प्रतीकों के अनुक्रम के रूप में पढ़ सके, तो आप आर्टिफिशियल इंटेलिजेंस के सबसे शक्तिशाली उपकरणों का उपयोग उस भाषा को आपको वापस बोलने के लिए कर सकते हैं। परिणाम बताते हैं कि हाई-ल्यूमिनोसिटी लार्ज हैड्रोन कोलाइडर के युग में, सिमुलेशन का भविष्य केवल संख्याओं को संसाधित करने के लिए बड़े कंप्यूटर बनाने के बारे में नहीं है, बल्कि मशीनों को ब्रह्मांड के व्याकरण को समझने के लिए शिक्षित करने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →