ملخص تقني: اكتشاف المعادلات العلمية القائم على النماذج اللغوية الكبيرة عبر تحسين السياسة المنظم بالرموز والموجه بالفيزياء
1. بيان المشكلة
يهدف الانحدار الرمزي (Symbolic Regression - SR) إلى استخلاص معادلات رياضية قابلة للتفسير من البيانات الرصدية، مما يجعله حجر الزاوية في كشف القوانين الفيزيائية. وبينما تستفيد الأساليب الحديثة من النماذج اللغوية الكبيرة (LLMs) لتوليد فرضيات المعادلات عبر استغلال المعارف العلمية المسبقة المدربة مسبقاً، تعاني الأطر الحالية من قصورين حرجين:
- التوليد الساكن: تعامل الأساليب الحالية النماذج اللغية الكبيرة كمولدات ساكنة، حيث تعتمد على التوجيه بمستوى المطالبة (التعلم داخل السياق) لتوجيه البحث التطوري. هذا النموذج يفشل في تحديث التمثيلات الداخلية للنموذج بناءً على تغذية البحث الراجعة، مما يمنع النموذج من استيعاب إشارات التقييم أو تكييف استراتيجية التوليد الخاصة به مع هياكل المشكلات المحددة.
- البحث المفتقر للفيزياء: غالباً ما تعطي الأطر الحالية الأولوية للصحة النحوية (Syntactic Correctness) على حساب الصلاحية الفيزيائية. فبدون قيود صارمة، تنتج النماذج اللغية الكبيرة غالباً معادلات تتوافق عددياً مع البيانات ولكنها تنتهك المبادئ الفيزيائية الأساسية (مثل التجانس البعدي) أو تحتوي على هياكل رياضية زائدة عن الحاجة، مما يؤدي إلى فرط التخصيص (Overfitting) وعدم القدرة على الاستخدام العملي.
التحديد يكمن في تحويل النموذج اللغوي الكبير من مجرد مقترح ساكن إلى مولد تكيفي يمكنه مواءمة توزيعه التوليدي ديناميكياً مع الخصائص الهيكلية والفيزيائية للنظام المستهدف.
2. المنهجية: PiT-PO
يقترح المؤلفون إطار عمل PiT-PO (تحسين السياسة المنظم بالرموز والموجه بالفيزياء)، وهو إطار موحد يربط بين الاستكشاف التطوري المدفوع بالنماذج اللغية الكبيرة والتحقق الصارم. يعمل الإطار من خلال عملية تطورية مغلقة الحلقة مدفوعة بآليتين متكاملتين:
2.1 تطور النموذج اللغوي أثناء البحث
على عكس الأساليب القياسية التي تبقي النموذج اللغي ثابتاً، يستخدم PiT-PO تحسين السياسة النسبي للمجموعة (GRPO) لتحديث بارامترات النموذج اللغي أثناء عملية البحث التطوري.
- الآلية: يُعامل النموذج اللغي كسياسة πθ تولد تسلسلات من الرموز (Tokens). يقوم GRPO بأخذ عينة من مجموعة من المخرجات، وتقييمها، وتحديث بارامترات السياسة لتعظيم خسارة بديلة.
- الميزة: يسمح هذا الضبط الدقيق "أثناء البحث" للنموذج بترسيخ الأنماط الرمزية الفعالة وتوجيه الاستكشاف اللاحق بكفاءة أكبر، محولاً المعارف العلمية العامة إلى خبرات متخصصة في المجال بشكل آني.
2.2 إشارات التعلم ذات القيود المزدوجة
لضمان أن تكون المعادلات المولدة صالحة علمياً وموجزة هيكلياً، يقدم PiT-PO آلية قيود مزدوجة تولد تغذية راجعة دقيقة على مستوى الرمز.
أ. القيود الفيزيائية الهرمية
يفرض نظام مكافأة الصلاحية العلمية من خلال مرشح هرمي:
- قيود المستوى العام: عقوبات على التجانس البعدي (Pdim) والقابلية للاشتقاق (Pdiff) لاستبعاد الهياكل المستحيلة فيزيائياً (مثل عدم توافق الوحدات).
- قيود خاصة بالمجال: يتم حقن المعرفة الخبيرة كتحيزات استقرائية. بالنسبة لنمذجة الاضطراب (Turbulence modeling)، يشمل ذلك قيوداً على الواقعية (القيم الذاتية الموجبة لإجهاد رينولدز)، واتساق الشروط الحدية (تلاشي الإجهاد عند الجدران)، والقياس التقاربي (القياس التكعيبي في الطبقات الفرعية اللزجة)، واتساق الطاقة.
- التنشيط المبوب: يتم تفعيل العقوبات الفيزيائية فقط بعد وصول المعادلة المرشحة إلى حد أدنى من دقة الملاءمة، مما يسمح باستكشاف "مجاني" في المراحل المبكرة قبل فرض الامتثال الصارم.
ب. القيود الرياضية الموجهة بالنظرية
لمعالضاءة التكرار الرياضي، قدم المؤلفون نظرية استبعاد الدعم (Support Exclusion Theorem).
- النظرية: توفر هذه النظرية ضماناً نظرياً لتحديد الاكتشافات الزائفة (الحدود الزائدة) بناءً على مقدار معاملات الملاءمة بالنسبة للتداخل الداخلي والخارجي من الدوال الأساسية الأخرى.
- عقوبة مستوى الرمز: إذا تم تحديد حد ما كحد زائد (كان مقدار معامله أقل من عتبة مشتقة)، يتم تطبيق عقوبة على مستوى الرمز (Ptok) على الرموز المكونة لذلك الحد تحديداً. هذه العقوبة لوغاريتمية، حيث تفرض عقوبات أقوى على الحدود ذات المعاملات الأصغر.
2.3 تحديث السياسة المدرك للرموز
يقوم GRPO القياسي بتعيين ميزة موحدة لجميع الرموز في التسلسل. يقوم PiT-PO بتحسين ذلك عبر دمج المكافأة العالمية مع عقوبة مستوى الرمز.
- الميزة المدركة للرمز (A^i,k): يتم حساب الميزة للرمز رقم k عن طريق توحيد (Standardizing) المكافأة العالمية وطرح عقوبة الرمز المحلية إذا كان الرمز ينتمي إلى حد زائد.
- الأثر: يخلق هذا "مشهد ضغط مزدوج" حيث توجه المكافآت العالمية السياسة نحو معادلات متسقة فيزيائياً، بينما تقوم العقوبات المحلية باستئصال الحدود الزائدة جراحياً، مما يضمن تعلم السياسة كيفية قمع الهياكل الزائدة نظرياً بشكل صريح.
2.4 مسار التدريب
يستخدم إطار العمل توبولوجيا متعددة الجزر لمنع التقارب المبكر:
- الاستكشاف القائم على الجزر: تطور جزر معزولة سلالات متميزة من المعادلات للحفاظ على تنوع البحث.
- التطور أثناء البحث: يتم تجميع المسارات من جميع الجزر لأداء تحسين السياسة باستخدام LoRA (التكيف منخفض الرتبة) من أجل الكفاءة.
- الاختيار الهرمي: تعمل آلية "البقاء للأصلح" على الاحتفاظ بالمرشحين الأعلى أداءً وإعادة ضبط الجزر ذات الأداء الضعيف ببذور عالية اللياقة.
3. النتائج الرئيسية
3.1 أداء الاختبار المعياري
تم تقييم PiT-PO على مجموعة LLM-SR Suite و LLM-SRBench مقابل الخطوط المرجعية المتطورة (بما في ذلك GPlearn و PySR و uDSR و RAG-SR و LLM-SR).
- الدقة: حقق PiT-PO أداءً هو الأفضل في فئته، حيث استعاد أكبر عدد من المعادلات الحقيقية. في LLM-SR Suite، حقق دقة بنسبة 100% في Oscillation 1 و 99.99% في Oscillation 2 (باستخدام نموذج خلفي 8B). كما تفوق بشكل كبير على الخطوط المرجعية في E. coli Growth وحقق نتائج تنافسية في Stress-Strain، رغم أنه لم يتجاوز خط 4o-mini المرجعي في الأخير.
- الدقة الرمزية: في LLM-SRBench (239 مهمة)، حقق PiT-PO أعلى دقة رمزية (SA) عبر جميع الفئات (الكيمياء، البيولوجيا، الفيزياء، علوم المواد)، مما أظهر قدرة فائقة على استعادة الشكل الرمزي الصحيح وليس فقط الملاءمة العددية.
- الكفاءة: أظهر PiT-PO تقارباً أسرع وقدرة على الهروب من حالات الركود حيث توقفت الطرق المرجعية (مثل LLM-SR) عند مستويات MSE منخفضة ولكن بهياكل غير صحيحة.
3.2 تمكين النماذج الصغيرة
من النتائج الهامة هي أن PiT-PO يمكّن النماذج مفتوحة المصدر صغيرة الحجم من مضاهاة أو التفوق على النماذج الكبيرة المغلقة في سياقات محددة.
- باستخدام نموذج Llama-3.2-1B مكمم، حقق PiT-PO أداءً منافساً أو متفوقاً على LLM-SR باستخدام Mixtral 8x7B و 4o-mini في مهام Oscillation و E. coli Growth. ومع ذلك، في مهمة Stress-Strain، حقق نموذج 1B دقة (76.91%) أقل من خط 4o-mini المرجعي (85.33%)، مما يشير إلى أنه بينما يقلص الإطار فجوة القدرات بشكل كبير، فإنه لا يتفوق عالمياً على جميع العمالقة المملوكين في كل مقياس.
- يشير هذا إلى أن تحسين السياسة أثناء البحث يعزز النماذج الصغيرة بفعالية، مما يسهد الوصول إلى أدوات اكتشاف علمي عالية الأداء على أجهزة استهلاكية، خاصة في المهام التي يكون فيها الاكتشاف الهيكلي أمراً بالغ الأهمية.
3.3 التطبيق الواقعي: نمذجة الاضطراب
تم تطبيق الإطار لاكتشاف العلاقات التكوينية غير الخطية لتباين إجهاد رينولدز في تدفق فوق التلال الدورية (Flow over Periodic Hills).
- الأداء: حسن النموذج المكتشف من النهج التقليدية لـ RANS (تحديداً نموذج k−ω SST) عبر إنتاج إجهادات رينولدز متباينة تقترب من مراجع المحاكاة الرقمية المباشرة (DNS).
- الأمانة الفيزيائية: أظهر النموذج المتعلم اتساقاً فيزيائياً محسناً، مما قلل من القيم غير الفيزيائية المتطرفة ووفر تنبؤات أكثر دقة لفقاعات انفصال التدفق ومعاملات احتكاك الجلد مقارنة بـ RANS القياسي والطرق الأخرى القائمة على SR.
3.4 دراسات الاستئصال (Ablation Studies)
أكدت دراسات الاستئصال ضرورة كلا المكونين:
- أدى حذف القيود الفيزيائية (w/o Phy) إلى تدهور كبير في NMSE والقدرة على التعميم.
- أدى حذف تنظيم الرموز (w/o TokenReg) إلى استمرار وجود الحدود الزائدة وفجوة أكبر في التعميم بين بيانات التوزيع الداخل (ID) والتوزيع الخارج (OOD).
4. الأهمية والادعاءات
يزعم البحث أن PiT-PO يغير جذرياً دور النماذج اللغية الكبيرة في الاكتشاف العلمي من مجرد مقترحين ساكنين إلى مولدات تكيفية مدركة للفيزياء.
- الاتساق العلمي: من خلال دمج القيود الفيزيائية الهرمية وتنظيم الرموز الموجه بالنظرية، يربط PiT-PO التوليد بالملاءمة العددية، والاتساق العلمي، والإيجاز في آن واحد.
- الديمقراطية: إن قدرة PiT-PO على تمكين النماذج الصغيرة (مثل 1B بارامتر) من مضاهاة العمالقة المغلقين في مهام الاكتشاف الرئيسية تؤسس لمنهجية عملية للاكتشاف العلمي المؤتمت لا تعتمد على موارد حوسبة ضخمة أو واجهات برمجة تطبيقات مملوكة، وإن تفاوت الأداء حسب تعقيد المهمة.
- المنفعة العملية: يوضح التطبيق الناجح في نمذجة الاضطراب أن التصحيحات الرمزية المكتشفة لها قيمة ملموسة في سير عمل الهندسة الواقعي، حيث تحسن تنبؤات مجال التدفق بما يتجاوز ما يمكن تحقيقه بالنماذج الخطية القياسية.
يخلص المؤلفون إلى أن هذا النهج يضع معياراً جديداً (SOTA) لاختبارات الانحدار الرمزي ويقدم مساراً قوياً لدمج المعرفة الفيزيائية المتخصصة في ديناميكيات التعلم للنماذج اللغية الكبيرة.