Prompting Particle Physics: Tokenized Multi-modal Foundation Models for Combinatorially Many Tasks
تقدم هذه الورقة نموذجاً تأسيسياً متعدد الوسائط ومجزأً إلى رموز (tokenized) يوحد مختلف مهام إعادة بناء ومحاكاة المصادم في إطار عمل واحد، مما يتيح توليد أجسام فيزيائية وسيطة متنوعة من خلال رسم خرائط وسائط مرنة قائمة على الأوامر النصية (prompt-based) مع تحقيق أداء رائد ومستوى دقة يضاهي محاكي Geant4.
المؤلفون الأصليون:Nilotpal Kakati, Daniel Murnane, Baran Hashemi, Samuel Klein, Jeffrey Krupa, Eilam Gross, Lukas Heinrich, Michael Kagan
في قلب مصادم الهادرات الكبير، تلك الآلة المدفونة في أعماق الحدود السويسرية الفرنسية، يقوم العلماء بتحطيم البروتونات مع بعضها البعض بسرعة تقارب سرعة الضوء. وعندما تصطدم هذه الجسيمات، فإنها تتفتت إلى وابل من الجسيمات دون الذرية الجديدة، والتي غالباً ما تكون عابرة. ولفهم القوانين الأساسية للكون، يجب على علماء الفيزياء إعادة بناء ما حدث في تلك اللحظة الخاطفة. يبدأون بالبيانات الخام: إشارات كهربائية ضئيلة من المستشعرات وترسبات طاقة في كواشف ضخمة. ومن هذه القرائن المتناثرة، يتعين عليهم بناء صورة كاملة للاصطدام، وتحديد مسارات الجسيمات المشحونة، وتجميع الطاقة في عناقيد، وأخيراً تجميع الجسيمات الأصلية التي انطلقت من التصادم. ولعقود من الزمن، كان هذا الإعادة للبناء عبارة عن سلسلة طويلة ومتعرجة من البرامج الحاسوبية المتخصصة. كل برنامج في هذه السلسلة هو خبير في مهمة واحدة، تم ضبطه يدوياً للتعامل مع خطوة محددة، بدءاً من تتبع مسار جسيم وصولاً إلى قياس طاقته. ورغم فاعلية هذا النهج، إلا أنه يتسم بالجمود والبطء، وغالباً ما يفقد المعلومات أثناء انتقال البيانات من أداة متخصصة إلى أخرى.
لقد اقترح فريق من الباحثين الآن طريقة مختلفة للنظر إلى هذه المشكلة، حيث يعاملون عملية إعادة البناء بأكملها ليس كسلسلة من الأدوات المنفصلة، بل كحوار واحد مرن. فقد تساءلوا عما إذا كان بإمكان نموذج حاسوبي واحد أن يتعلم القيام بالعديد من هذه الخطوات في آن واحد، متنقلاً بسلاسة بين أنواع مختلفة من البيانات. وبدلاً من بناء خوارزمية جديدة لكل وظيفة، قاموا بتعليم ذكاء اصطناعي واحد ليتحدث لغة عالمية لفيزياء الجسيمات. ومن خلال تحويل كل قطعة من المعلومات — سواء كانت قراءة مستشعر خام، أو مسار جسيم، أو قياس طاقة عالي المستوى — إلى قائمة بسيطة من الرموز المنفصلة، أنشأوا مفردات مشتركة. وفي هذا النظام الجديد، يمكن مطالبة النموذج بأخذ بيانات المستشعر الخام وإنتاج قائمة من الجسيمات، أو أخذ قائمة من الجسيمات ومحاكاة ما كانت ستراه المستشعرات. النموذج لا يكتفي بتخمين الإجابة النهائية فحسب؛ بل يولد الخطوات المتوسطة، منتجاً مسارات وعناقيد يمكن لعلماء الفيزياء فحصها والتحقق منها، تماماً كما يفعلون مع الطرق التقليدية.
قام الباحثون بتدريب نسختين من هذا النموذج على مجموعة ضخمة من بيانات اصطدامات الجسيمات المحاكات. النسخة الأولى، التي يسمونها nanoHEP، تعمل مثل "الراوي"، حيث تولد المخرجات رمزاً تلو الآخر، مستخدمة الرمز السابق لتحديد الرمز التالي. أما النسخة الأخرى، HEP4M، فهي تعمل أكثر مثل "الرسام"، حيث تتنبأ بجميع الرموز لكائن معين في آن واحد بنظرة واحدة. وقد اختبروا هذين النموذجين في مجموعة مذهلة من المهام. في المجمل، استكشفوا أكثر من 1300 تركيبة مختلفة من المدخلات والمخرجات. على سبيل المثال، طلبوا من النموذج أخذ المسارات وعناقيد الطاقة للتنبؤ بالجسيمات الحقيقية (وهي مهمة تُعرف باسم تدفق الجسيمات)، أو أخذ الجسيمات الحقيقية والتنبؤ بإشارات المستشعرات الخام (وهي مهمة محاكاة الكاشف). حتى أنهم اختبروا تركيبات لم يسبق للنموذج رؤيتها، مثل تغذيته بأربعة أنواع مختلفة من البيانات في وقت واحد لمعرفة ما إذا كان بإمكانه دمجها لتقديم تنبؤ أفضل.
تظهر النتائج أن هذا النهج الموحد ليس ممكناً فحسب، بل هو فعال للغاية. وقد أثبت النموذج "التتابعي" (autoregressive)، الذي يولد البيانات خطوة بخمع، أنه مثير للإعجاب بشكل خاص. فعند تكليفه بإعادة بناء الجسيمات من بيانات الكاشف، تفوق على الخوارزمية المتخصصة الأكثر تطوراً حالياً في إعادة بناء زخم النفاثة (jet momentum) من حيث الدقة ودرجة التصنيف، بينما حقق نموذج HEP4M أحادي المهمة أفضل استجابة معايرة بمتوسط أقرب إلى الواحد الصحيح. والأهم من ذلك، أن الأجسام التي ولدها — مثل مسارات الجسيمات المشحونة وأشكال عناقيد الطاقة — كانت واقعية للغاية لدرجة أنها كانت أقل قابلية للانفصال عن البيانات الناتجة عن أكثر عمليات محاكاة الفيزياء تفصيلاً المتاحة، رغم أنها ظلت قابلة للتمييز عن الحقيقة. لقد تعلم النموذج العلاقات المعقدة بين أنواع البيانات المختلفة بشكل جيد لدرجة مكنته من التعميم على مهام جديدة. فعند تقديمه بمزيج من أربعة أنواع من المدخلات لم يره أثناء التدريب، أنتج نتائج كانت على الأقل بدقة كل التركيبات التي تدرب عليها، محققاً أو متفوقاً على أداء النماذج المدربة خصيصاً لتلك المهام الفردية. وهذا يشير إلى أن النموذج قد تعلم فهماً عميقاً وجوهرياً لكيفية عمل فيزياء الجسيمات، بدلاً من مجرد حفظ أنماط محددة.
ومع ذلك، تسلط الدراسة الضوء أيضاً على وجود مقايضة. فالنموذج الذي يولد البيانات خطوة بخطوة هو أكثر دقة ولكنه يستغرق وقتاً أطول للتشغيل، بينما النموذج الذي يتنبأ بكل شيء في آن واحد هو أسرع ولكنه أقل دقة قليلاً في التقاط التفاصيل الدقيقة للبيانات. ووجد الباحثون أن النهج الأفضل يعتمد على الاحتياجات المحددة للتجربة. فبالنسبة للمهام التي تتطلب أعلى قدر ممكن من الأمانة للفيزياء الحقيقية، فإن النموذج الأبطأ الذي يعمل خطوة بخطوة هو الأفضل. أما بالنسبة للمهام التي تكون فيها السرعة أمراً حاسماً، فإن النموذج الأسرع يقدم بديلاً مقنعاً. ومن الأهمية بمكان أن الباحثين أثبتوا أن هذا النموذج الواحد يمكنه التعامل مع كامل طيف مهام إعادة البناء والمحاكاة، من أكثر بيانات المستشعرات خاماً إلى أعلى مستويات سمات الفيزياء، دون الحاجة إلى إعادة تدريبه لكل مهمة جديدة.
يمثل هذا العمل تحولاً كبيراً في كيفية معالجة بيانات فيزياء الجسيمات. فمن خلال الانتقال من مجموعة من الأدوات المتخصصة والمعزولة نحو نموذج أساسي واحد متعدد الأغراض، يمكن للعلماء تحسين مسار التحليل بأك entier. إن قدرة النموذج على إنتاج أجسام وسيطة قابلة للتفسير فيزيائياً تعني أنه ليس بالضرورة "صندوقاً أسود"؛ إذ لا يزال بإمكان الفيزيائيين فحص المسارات والعناقيد التي يولدها للتأكد من منطقيتها. وبينما لا يزال النموذج يواجه تحديات، لا سيما في توليد بيانات المستشعرات الخام بدقة مثالية، فإن نجاح هذا النهج يشير إلى مستقبل يمكن فيه لذكاء واحد متعدد الاستخدامات أن يساعد في فك رموز القصص المعقدة المختبئة داخل اصطدامات العالم دون الذري. لقد أتاح الباحثون الكود والبيانات الخاصة بهم، داعين المجتمع العلمي الأوسع للبناء على هذه الطريقة الجديدة لرؤية الكون.
ملخص تقني: توجيه نماذج التأسيس متعددة الوسائط المرمزة لفيزياء الجسيمات
بيان المشكلة تاريخياً، اعتمد استخراج الفيزياء من بيانات المصادمات (مثل تلك الموجودة في مصادم الهادرونات الكبير LHC) على سلاسل طويلة من الخوارزميات المتخصصة القائمة على الاستدلال (Heuristics)، حيث يتم ضبط كل منها لخطوة واحدة (مثل التتبع، أو التجميع، أو المحاكاة). وبينما نجح التعلم الآلي في تحسين الروابط الفردية في هذه السلاسل، يظل السؤال مفتوحاً حول ما إذا كان بإمكان نموذج واحد استبدال روابط متعددة في آن واحد مع الحفاظ على القابلية للتفسير من خلال الكائنات الوسيطة (المسارات، العناقيد، الجسيمات). غالباً ما تتعامل النهج الحالية مع إعادة البناء والمحاكاة كمشكلتين منفصلتين أحاديتي المرحلة، مما يؤدي إلى الفشل في الاستفادة من إمكانات إطار عمل موحد يمكنه التعامل مع وسائط بيانات متنوعة، بدءاً من ميزات المستشعرات منخفضة المستوى وصولاً إلى الكائنات الفيزيائية عالية المستوى.
المنهجية يقترح المؤلفون التعامل مع إعادة بناء فيزياء الجسيمات ومحاكاتها كمسألة واحدة من المدخلات والمخرجات متعددة الوسائط. وتتمثل المنهجية الجوهرية في الترميز (Tokenization) وتدريب نماذج تأسيسية (Foundation Models) قادرة على رسم خرائط لأي مجموعة فرعية من الوسائط إلى أي وسائط أخرى.
استراتيجية الترميز:
يتم تحويل كل كائن في النفاثة (Jet) (المسارات، العناقيد الطوبولوجية، الجسيمات، النفاثات، خلايا الكالوريمتر، إلخ) إلى تسلسل منفصل من "الرموز" (Tokens) من قاموس رموز خاص بكل وسيط.
المحتوى: يتم تكميم الميزات (مثل pT و d0 والطاقة) باستخدام مشفر تلقائي متغير بترميز متجه متبقي (RVQ-VAE)، مما ينتج تسلسلاً من الرموز المتبقية.
الموقع: يتم تقسيم السمات المكانية (η,cosϕ,sinϕ) إلى شبكات ثابتة.
الوسائط: يستخدم إطار العمل سبع وسائط: المسارات (TK)، العناقيد الطوبولوجية (CL)، جسيمات الحقيقة (TP)، الجسيمات المعاد بناؤها (RP)، نفاثات الحقيقة (TJ)، خلايا الكالوريمتر (CE)، والكسر الطاقي المشحون (CF).
تعريف المهمة: تُعرَّف المهمة حصرياً من خلال اختيار وسائط المدخلات (الـ "Prompt") ووسائط المخرجات (الـ "Completion"). وهذا يسمح بوجود 1,302 اتجاه للمهام (مجموعات من ثلاثة مدخلات وثلاثة مخرقات كحد أقصى).
بنيات النماذج: قام المؤلفون بتدريب نموذجين تأسيسيين مختلفين على نفس البيانات المرمزة:
nanoHEP (التوليدي التتابعي - Autoregressive): وهو محول (Transformer) يعتمد فقط على فك التشفير (Decoder-only) من عائلة GPT-2، يقوم بتوليد رموز المخرجات بالتتابع. يستخدم قاموساً مشتركاً لجميع الوسائط وأقنعة هيكلية لفرض قواعد التسلسل (على سبيل المثال، ضمان العدد الصحيح من الكائنات وانتقالات الوسائط). وهو يتعلم التوزيع المشترك كدالة مفككة: qθ(y∣x)=∏qθ(yt∣x,y<t).
HEP4M (المتوازي - Parallel): وهو محول يعتمد على المشفر وفك التشفير (Encoder-Decoder) (مقتبس من بنية 4M) يتنبأ بجميع رموز المخرجات في تمريرة أمامية واحدة. يستخدم رؤوس التعددية (Cardinality heads) لتحديد عدد الكائنات لكل وسيط وآليات الانتباه المتقاطع (Cross-attention) لتوليد الرموز بالتوازي.
نظام التدريب:
تم تدريب النماذج على مجموعة بيانات من أحداث النفاثة الواحدة (88.9 مليون حدث تدريبي) تم إنشاؤها بواسطة COCOA (محاكاة تعتمد على Geant4).
أثناء التدريب، يختار المُنقي (Sampler) بشكل موحد ما يصل إلى ثلاث وسائط مدخلات وما يصل إلى ثلاث وسائط مخرجات لتشكيل مهمة.
يتم الإفراط في أخذ مهمة تدفق الجسيمات (Particle Flow) {TK,CL}→{TP} (بنسبة ~10% من الخطوات) لضمان الاستقرار، رغم أنها لا تشكل سوى ~2% من إجمالي العمليات الحسابية بسبب طول التسلسل.
المساهمات الرئيسية
النماذج التأسيسية المزدوجة: تقديم كل من nanoHEP (التتابعي) و HEP4M (المتوازي)، وكلاهما قادر على العمل من قراءات مستوى المستشعر إلى الميزات الفيزيائية عالية المستوى.
إطار عمل موحد متعدد الوسائط: إثبات أن مجموعة واحدة من الأوزان يمكنها أداء مهام إعادة البناء، والمحاكاة، والمهام المختلطة الوسائط (مثل طرح الطاقة المشحونة، ومحاكاة الوميض) ببساطة عن طريق تغيير "الـ Prompt" الخاص بالمدخلات والمخرجات.
التقييم المنهجي: إجراء تقييم شامل لجميع اتجاهات المهام البالغ عددها 1,302، وتقييم الأداء في المهام النادرة وفي التعميم على مجموعات المدخلات غير المرئية (Zero-shot composition).
تحليل مقايضة الأداء: مقارنة تفصيلية بين التكلفة الحسابية ودقة النتائج بين استراتيجيات فك التشفير التتابعي والمتوازي.
النتائج
إعادة بناء تدفق الجسيمات (Particle Flow Reconstruction):
يتفوق nanoHEP-pflow على خوارزمية HGPflow المتطورة في تصنيف AUC (0.691 مقابل 0.902)، مما يشير إلى أن مخرجاته يصعب تمييزها عن الحقيقة عند اشتراطها بمدخلات الحدث. يشير البحث إلى أن nanoHEP يتفوق على HGPflow في إعادة بناء زخم النفاثة من حيث مستوى الدقة ودرجة المصنف، رغم أن HGPflow أظهر مدى ربعي (IQR) أعلى قليلاً (0.0754) مقارنة بـ nanoHEP-pflow (0.0733) في الجدول 2.
يحقق nanoHEP-multi أداءً أفضل (IQR 0.069) عند تزويده بمدخلات إضافية (مسارات، عناقيد طوبولوجية، جسيمات HGPflow، وخلايا)، مما يوضح فائدة دمج الوسائط المتعددة.
المحاكاة:
يقوم nanoHEP-sim بتوليد مسارات وعناقيد طوبولوجية تطابق توزيعات Geant4 بشكل وثيق (AUC ~0.54 للمسارات، وهو قريب من حد الترميز).
تعيد نماذج HEP4M إنتاج التوزيعات الهامشية بشكل جيد ولكنها تعاني في بنية الحدث، مما يؤدي إلى قيم AUC عالية (~0.98) عند التمييز بين الأحداث المولدة والحقيقة، مما يشير إلى فقدان الارتباط بين الكائنات.
التعميم والنقل:
نقل المهام: تتفوق النماذج المدربة على مصفوفة المهام الكاملة على النماذج المدربة من الصفر لمهام محددة، حتى عندما تُمنح تلك النماذج 10 أضعاف ميزانية الحوسبة لتلك المهمة المحددة.
التركيب الصفري (Zero-Shot Composition): نجح النموذج التتابعي في التعميم على مهمة ذات أربع وسائط مدخلة (مسارات + عناقيد طوبولوجية + جسيمات HGPflow + خلايا)، وهي تركيبة لم يسبق رؤيتها أثناء التدريب (الذي كان حده الأقصى ثلاثة مدخلات). حقق هذا "التركيب الصفري" مدى ربعياً (IQR) قدره 0.0688، وهو ما يطابق أو يحسن الأداء من المجموعات الفرعية المدربة (على سبيل المثال، مهمة "المسارات + العناقيد الطوبولوجية + الخلايا" المدربة حققت IQR قدره 0.0704).
القيود: يظل توليد خلايا الكالوريمتر (CE) من جسيمات الحقيقة أمراً صعباً؛ حيث يسهل تمييز الخلايا المولدة عن الحقيقة (AUC 0.998). كما يعاني فك التشفير المتوازي (HEP4M) في التعامل مع التعددية (Cardinality) والارتباطات على مستوى الحدث مقارنة بالنهج التتابعي.
الأهمية والادعاءات يدعي البحث أن الترميز عالي الدقة يسمح بتدريب نماذج تأسيسية مستقرة ومتعددة الوسائط لفيزياء الجسيمات مع حد أدنى من ضبط المعلمات الفائقة. ويرى المؤلفون ما يلي:
التوحيد: يمكن توحيد إعادة البناء والمحاكاة في إطار عمل توليدي واحد "من أي شيء إلى أي شيء"، مما يقلل من تعقيد صيانة الخوارميات المتخصصة المنفصلة.
الكفاءة: التدريب متعدد المهام أكثر كفاءة حسابياً من تدريب نماذج منفصلة لكل مهمة، حيث يوفر أداءً أفضل بميزانيات حوسبة أقل.
الضرورة التكرارية: يبدو أن فك التشفير التتابعي ضروري لالتقاط الاحتمال الشرطي متعدد الوسائط وبنية الحدث بالكامل، مما يشير إلى أن النماذج التأسيسية المستقبلية يجب تقييمها بناءً على حدود "باريتو" (Pareto frontiers) للدقة مقابل التكلفة الحسابية بدلاً من الأداء الخام وحده.
التعميم: أظهرت النماذج قدرة على التعميم الصفري (Zero-shot) على تركيبات الوسائط غير المرئية، وهي قدرة موثقة جيداً في معالجة اللغات الطبيعية (NLP) ولكنها جديدة في فيزياء الجسيمات.
يخلص العمل إلى أنه رغم وجود قيود (خاصة في التوليد عالي الدقة)، فإن القدرات الواسعة لهذه النماذج تشير إلى مستقبل واعد للنماذج التأسيسية في مجال الطاقة العالية.