InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance
يُعد InsightSR إطار عمل جديد للارتباط الرمزي يعمل على تعزيز محرك البرمجة الجينية PySR من خلال تسخير النماذج اللغوية الكبيرة لتنقيح حيز البحث بشكل تكراري عبر التوجيه الدلالي والهيكلي، محققاً دقة وقدرة على التعميم تضاهف أحدث المعايير من خلال تحويل بناء أشجار التعبير العميقة إلى تجميع لأشجار ضحلة فوق سمات مستنيرة دلالياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما اعتمد العلم على فكرة بسيطة وقوية: وهي أن السلوك المعقد للعالم الطبيعي يمكن وصفه بقوانين رياضية موجزة. فعندما ينظر الفيزيائي إلى تفاحة تسقط أو مدار كوكب، فإنه لا يرى مجرد حركة؛ بل يبحث عن المعادلة الخفية التي تحكمها. ويُسمى هذا البحث عن الصيغة الأساسية بـ "الانحدار الرمزي" (symbolic regression). وبخلاف النماذج الحاسوبية القياسية التي تتعلم الأنماط من خلال ضبط ملايين "المقابض" الداخلية لتناسب البيانات، يحاول الانحدار الرمزي كتابة المعادلة الفعلية نفسها، باستخدام لبنات بناء رياضية مألوفة مثل الجمع، والضرب، والدوال المثلثية. والهدف هو إيجال قاعدة ليست دقيقة فحسب، بل بسيطة بما يكفي ليقرأها الإنسان ويفهمها. ومع ذلك، فإن العثور على هذه القواعد أمر صعب للغاية؛ إذ ينمو عدد التوليفات الرياضية الممكنة بسرعة هائلة مما يجعلها محيطاً شاسعاً وفوضوياً من الاحتمالات. وتضيع معظم عمليات البحث الحاسوبية في هذا المحيط، فتنتج صيغاً تناسب البيانات بشكل مثالي ولكنها لا تملك أي معنى فيزيائي، أو أنها ببساطة تفشل في العثور على القانون الحقيقي لأن مساحة البحث أكبر من أن تُستكشف بالكامل.
لقد طور فريق من الباحثين نهجاً جديداً للتنقل عبر هذه الفوضى، يجمع بين قوة البحث الخام للخوارزميات التطورية والقدرة الاستنتاجية للنماذج اللغوية الكبيرة. نظامهم، الذي أطلق عليه اسم "InsightSR"، لا يطلب من الحاسوب تخمين الإجابة النهائية مباشرة، بل يستخدم النموذج اللغوي كمرشد لإعادة تشكيل عملية البحث نفسها. تخيل فريقاً من المستكشفين يحاولون إيجاد مسار محدد عبر غابة كثيفة وغير مستكشفة؛ في الطريقة القديمة، كان المستكشفون يتجولون عشوائياً، آملين في التعثر بالمسار الصحيح. أما في هذه الطريقة الجديدة، فيعمل النموذج اللغوي كدليل خبير يعرف التضاريس العامة؛ فهو لا يسير في المسار نيابة عنهم، لكنه يخبرهم بالاتجاهات التي يستحيل فيزيائياً اتخاذها، ويقترح عليهم الأدوات التي قد تكون مفيدة لرحلتهم.
يعمل النظام من خلال تقسيم التوجيه إلى مسارين متكاملين. يركز المسار الأول على "هيكل" المعادلة؛ حيث ينظر النموذج اللغوي إلى الوحدات الفيزيائية للبيانات — مثل ما إذا كان المتغير يمثل زمناً، أو مسافة، أو كتلة — ويقترح هياكل أساسية يجب أن تكون متسقة من حيث الأبعاد. وهذا يعني أنه يستبعد أي توليفة رياضية من شأنها أن تنتهك قوانين الفيزياء، مثل جمع قياس زمني مع قياس مسافة. ومن خلال تزويد عملية البحث بنقاط انطلاق معقولة فيزيائياً، يتجنب النظام إضاعة الوقت في مليارات الصيغ المستحيلة. ويركز المسار الثاني على "المكونات" نفسها؛ حيث يقترح النموذج اللغوي طرقاً جديدة لتحويل البيانات الخام، مثل تربيع متغير ما أو أخذ جيب الزاوية (sine) له، بناءً على الأنماط التي رآها في محاولات سابقة. وتُضاف هذه الميزات الجديدة إلى مجموعة المكونات المتاحة لمحرك البحث. ومع مرور الوقت، تصبح مجموعة المكونات أكثر ثراءً، مما يسمح للنظام ببناء علاقات معقدة باستخدام توليفات بسيطة وضحلة بدلاً من محاولة بناء أشجار عميقة ومتشابكة من البيانات الخام.
هذه العملية ليست تخميناً لمرة واحدة، بل هي حلقة مستمرة من الصقل. فبعد أن يقوم الحاسوب بتوليد مجموعة من المعادلات المرشحة، يقوم النموذج اللغوي بتقييمها؛ فهو لا يتحقق فقط من مدى ملاءمتها للأرقام، بل يتحقق أيضاً من مدى فائدة الميزات الجديدة وما إذا كان الهيكل منطقياً. يتم تخزين هذا التعليقات في قاعدة معرفية ديناميكية تُعلم الجولة التالية من البحث. يتعلم النظام من نجاحاته وإخفاقاته، ويضيق نطاق البحث تدريجياً نحو الحلول الأكثر واعدة. وهذا يخلق دورة ذاتية التصحيح حيث يصبح البحث أكثر تركيزاً وكفاءة مع كل تكرار.
اختبر الباحثون هذه الطريقة على ثلاث مجموعات متميزة من التحديات. أولاً، استخدموا معياراً يتكون من 100 معادلة فيزيائية شهيرة، تتراوح من الميكانيكا الكلاسيكية إلى نظرية الكم. وفي هذا الاختبار، نجح النظام في استعادة الصيغة الأصلية بدقة 95% من الوقت، وهو تحسن كبير عن الطرق السابقة. كما قدم أداءً استثنائياً في مجموعة أوسع من المشكلات العلمية التي تشمل الكيمياء، والأحياء، وعلوم المواد، محققاً دقة تزيد عن 80% في المهام التي تتضمن تحويلات معقدة. وأخيراً، اختبر الفريق النظام على بيانات من العالم الحقيقي، مثل اهتزازات المذبذب وأنماط نمو البكتيريا. وفي هذه السيناريوهات، لم يجد النظام صيغاً دقيقة فحسب، بل حافظ أيضاً على أدائه عند اختباره على بيانات لم يسبق له رؤيتها، مما أظهر قدرة قوية على التعميم.
تشير النتائج إلى أنه من خلال دمج نموذج لغوي كطبقة توجيه حول محرك بحث تقليدي، يمكن التغلب على التحديين المتمثلين في مساحة البحث الشاسعة والحاجة إلى الاتساق الفيزيائي. إن النظام لا يحل محل البحث التطوري، بل يهذبه، محولاً الاستكشاف الأعمى والعشوائي إلى اكتشاف هادف وموجه. ومن خلال نقل العبء من بناء أشجار عميقة ومعقدة من المتغيرات الخام إلى تجميع توليفات بسيطة من مجموعة ميزات غنية ومُعززة مسبقاً، تجعل هذه الطريقة اكتشاف القوانين العلمية أكثر كفاءة وموثوقية. يقدم هذا النهج مساراً عملياً للمضي قدماً في الاكتشاف العلمي المؤتمت، موضحاً أن الجمع بين التفكير الشبيه بالبشر والبحث القائم على الآلة يمكن أن يكشف عن القوانين الرياضية الخفية التي تحكم عالمنا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.