LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning
تتناول هذه الورقة نقص دعم الذكاء الاصطناعي للغة التلاعب الرمزي FORM من خلال إثبات فشل النماذج اللغوية الكبيرة الرائدة في مهام FORM بنمط الصفر محاولة (zero-shot)، ثم تقدم مساراً للضبط الدقيق القائم على التحقق باستخدام ملف FORM الثنائي كمرجع (oracle) لتدريب نموذج مدمج بـ 8 مليارات معلمة يتفوق على النماذج الرائدة الأكبر حجماً بكثير في تنفيذ الكود وصحته مع الحفاظ على قدرات الاستنتاج العامة.
في عالم الجسيمات دون الذرية، حيث تتصادم الجسيمات وتتحلل في أجزاء من الثانية، يعتمد علماء الفيزياء النظرية على لغة متخصصة لوصف رياضيات اكتشافاتهم. هذه اللغة، المعروفة باسم "Form"، ليست أداة برمجة عامة الأغراض، بل هي نظام محدد للغاية صُمم للتعامل مع التعبيرات الجبرية ذات التعقيد الهائل. فعندما يحسب العلماء سلوك الجسيمات باستخدام نظرية المجال الكمي، يمكن أن تحتوي الصيائل الناتجة على ملايين أو حتى مليارات الحدود. وغالباً ما تنهار البرامج الحاسوبية عامة الأغراض عند مواجهة مثل هذه الحسابات الضخمة، لكن "Form" بُني لإدارتها عن طريق تخزين الخطوات الوسيطة على القرص الصلب بدلاً من ذاكرة الكمبيوتر. ولعقود من الزمن، ظل هذا الأداة لا غنى عنها لكشف أسرار الكون، ومع ذلك لا يزال تعلمها صعباً؛ فبنيتها اللغوية فريدة، وقواعدها صارمة، وحتى الآن، لم يكن هناك ذكاء اصطناعي قادر على مساعدة البشر في كتابة كود برمجي لها.
قدمت هذه الفجوة التكنولوجية تحدياً فريداً للباحثين في معهد كارلسروه للتكنولوجيا. فقد طرحوا سؤالاً جوهرياً: هل يمكن لذكاء اصطناعي حديث، تدرب على كميات هائلة من بيانات الإنترنت، أن يتعلم كتابة كود للغة تكاد لا توجد في تلك البيانات؟ كانت الإجابة التي وجدوها هي "لا" قاطعة. فعندما اختبروا أقوى نماذج الذكاء الاصطناعي المتطورة المتاحة — والتي يحتوي بعضها على مئات المليارات من المعلمات (parameters) — فشلت هذه العمالقة تماماً. فبدون دليل أو مرشد للنظر إليه، لم تستطع توليد سطر واحد صحيح من كود "Form". بالنسبة للذكاء الاصطناعي، كانت هذه اللغة غير مرئية فعلياً، مجالاً صفري الموارد حيث كان حجم النموذج الضخم أقل أهمية من غياب التدريب المحدد.
ولحل هذه المشكلة، اتبع الباحثون نهجاً مختلفاً. فبدلاً من الاعتماد على نموذج ضخم للتخمين، قاموا ببناء ذكاء اصطناعي متخصص وأصغر حجماً وعلموه باستخدام طريقة صارمة ذاتية التصحيح. لقد أنشأوا مسار عمل (pipeline) حيث يقوم ذكاء اصطناعي قوي بتوليد برامج مرشحة بناءً على تعليمات بسيطة باللغة الإنجليزية، ولكن لم تكن هذه البرامج موثوقة فوراً؛ بل كانت تُغذى في برنامج "Form" الفعلي لمعرفة ما إذا كانت تعمل بشكل صحيح. وإذا أنتج الكود خطأً أو نتيجة خاطئة، فإنه يُستبعد. فقط البرامج التي اجتازت كل الفحوصات — من حيث البنية اللغوية، والتنفيذ، والاتساق المنطقي — هي التي يتم الاحتفاظ بها. أنتجت هذه العملية مكتبة موثقة تضم أكثر من 4600 مثال، تتراوح من الدروس التعليمية البسيطة إلى حسابات الفيزياء المعقدة.
باستخدام هذه البيانات عالية الجودة والموثقة، قام الفريق بضبط نموذج ذكاء اصطناٍ مدمج يمتلك ثمانية مليارات معلمة. وكانت النتيجة متخصصاً تفوق على أكبر وأغلى النماذج في العالم. ففي مجموعة من 664 مهمة حسابية محددة، حل هذا النموذج الصغير والمتخصص 97.7% منها بشكل صحيح. وفي المقابل، فإن أضخم النماذج الرائدة، حتى عند تزويدها بدليل بنيوي لقراءته، تمكنت من توليد كود صحيح برمجياً يعمل دون خطأ في حوالي 75% فقط من تلك المهام نفسها. وكان التفوق أكثر وضوحاً في المهام مفتوحة النهايات حيث يتم وصف الهدف دون تحديد الطريقة؛ إذ نجح النموذج المتخصص في توليد كود قابل للتشغيل بنسبة 83% من المرات، بينما تمكنت أفضل النماذج العملاقة من القيام بذلك في 65% فقط من الحالات.
ولعل الأمر الأكثر إثارة للدهشة هو أن الباحثين وجدوا أن هذا التدريب المتخصص لم يجعل الذكاء الاصطناعي "ينسى" كيفية القيام بأشياء أخرى. فقد احتفظ النموذج بقدراته العامة في الاستنتاج والبرمجة، مظهرًا انخفاضاً طفيفاً جداً في الأداء في الاختبارات القياسية للرياضيات والمنطق. وهذا يشير إلى أن تعليم الذكاء الاصطناعي مهارة جديدة متخصصة لا يتطلب التضحية بذكائه العام. وتثبت هذه الدراسة أنه بالنسبة للغات العلمية شديدة التخصص، فإن المفتاح للنجاح ليس الحجم الهائل للنموذج، بل جودة البيانات التي يتعلم منها والتحقق منها. فمن خلال استخدام البرنامج نفسه كمعلم للتحقق من كل درس، أنشأ الباحثون أداة يمكنها الآن مساعدة الفيزيائيين في كتابة الكود المعقد اللازم لاستكشاف القوانين الأساسية للطبيعة، مما يخفض حاجز الدخول للغة كانت تشكل عائقاً طويلاً في مجال فيزياء الطاقات العالية.
ملخص تقني: توليد كود لغة Form القائم على النماذج اللغوية الكبيرة مع الضبط الدقيق المدفوع بالتحقق
بيان المشكلة تُعد لغة Form لغة رمزية متخصصة في المعالجة، وهي بالغة الأهمية لحسابات فيزياء الجسيمات عالية الدقة، حيث يمكنها التعامل مع التعبيرات الجبرية التي تنشأ من مليارات الحدود الناتجة عن مخططات فاينمان متعددة الحلقات. ورغم أهميتها القصوى، تفتقر Form إلى الأدوات المدعومة بالذكاء الاصطناعي. وتثبت الورقة أن Form هي لغة "صفرية الموارد" في سياق بيانات تدريب النماذج اللغوية الكبيرة (LLM)، حيث تظهر بشكل ضئيل جداً في مجموعات البيانات الضخمة على مستوى الإنترنت. ونتيجة لذلك، تحقق النماذج الرائدة (التي تصل معلماتها إلى 756 مليار معلمة) معدل نجاح في التنفيذ بنسبة 0% في مهام اتباع التعليمات ومهام الدروس التعليمية الخاصة بـ Form دون وجود وثائق، مما يجعل Form لغة "صفرية الاستباق" (zero-shot) حقيقية للنماذج الحالية. ويتمثل التحدي في تحديد ما إذا كان يمكن تخصيص نموذج أصغر لتوليد كود Form صحيح وكيف يقارن بالنماذج الضخمة الرائدة.
المنهجية يقترح المؤلف منهجية ثلاثية الأجزاء تتمحور حول خط إنتاج لتوليد البيانات مدفوع بالتحقق والضبط الدقيق الموفر للمعلمات:
توليد البيانات المدفوع بالتحقق:
خط الإنتاج: يقوم خط إنتاج مكون من أربع مراحل بتوليد بيانات التدريب باستخدام نموذج لغوي رائد (DeepSeek-V4 Flash) لإنتاج برامج مرشحة من تعليمات اللغة الطبيعية.
الأوراكل (المرجع): يعمل ملف Form الثنائي الفعلي (FORM 5.0) كأوراكل للتنفيذ.
مراحل التحقق: تخضع المرشحات لـ: (1) فحص الكلمات الحتمية لضمان مخرجات فريدة؛ (2) التحقق من بناء الجملة (syntax) عبر ملف Form الثنائي؛ ( 3) التأكد من المخرجات غير البديهية؛ (4) تدقيق الاتساق الدلالي بواسطة نموذج لغوي مستقل (GLM-5.2) مزود بملف حقائق خاص بـ Form لمنع الهلوسة.
المتن (Corpus): تنتج هذه العملية 4,633 مثالاً موثقاً للتدريب، تشمل حسابات حتمية، برامج مفتوحة النهايات، أكواد تعليمية، وأزواج أسئلة وأجوبة معرفية، مع عدم وجود أي تداخل بين مجموعات التدريب والاختبار.
النموذج: يقوم المؤلف بضبط نموذج Qwen3-8B المكون من 8 مليارات معلمة باستخدام تقنية QLoRA (التكيف منخفض الرتبة المكمم).
الإعدادات: يتم تدريب النموذج باستخدام تكميم 4-bit NF4، ورتبة LoRA تبلغ 16، وalpha تبلغ 32.
النسخ المتغيرة: تم تدريب نسختين لعزل تأثيرات البيانات: النسخة v3b (للمهام الحتمية فقط) والنسخة v3c (المزيج الكامل الذي يتضمن المهام مفتوحة النهايات، والدروس التعليمية، والبيانات المعرفية). تم تعطيل وضع التفكير الهجين لإعطاء الأولوية لتوليد الكود المباشر.
إطار التقييم:
المعايير المرجعية (Benchmarks): تم استخدام أربعة معايير: B1 (664-حتمي)، B2 (Instruct-100، مفتوح النهايات)، B3 (Tutorial-44)، وB4 (Open-32، متعدد الخطوات ومعقد).
المقاييس: يتضمن التقييم معدلات اجتياز بناء الجملة، والمطابقة الصارمة للمخرجات التي تم التحقق منها عبر Form (مقارنة المخرجات المولدة مقابل الحلول المرجعية باستخدام ملف Form الثنائي)، وتحكيم النموذج اللغوي المرتكز (anchored LLM judging) للمهام مفتوحة النهايات.
النماذج المرجعية (Baselines): تمت مقارنة سبعة نماذج مرجعية، تتراوح من 8 مليارات إلى 756 مليار معلمة. ومن المهم ملاحظة أن النماذج الرائدة تم تقييمها مع سياق الوثائق (دليل بناء جملة بطول 6,000 حرف)، بينما تم تقييم النموذج الذي تم ضبطه بدقة صفرية الاستباق (zero-shot).
النتائج الرئيسية
النموذج المرجعي صفري الاستباق: بدون الوثائق، فشلت جميع النماذج التي تم تقييمها (بما في ذلك نماذج 756 مليار معلمة) في توليد برنامج واحد صحيح من حيث بناء الجملة لـ Form في معيارَي Instruct-100 وTutorial-44.
الأداء في المهام الحتمية: حقق نموذج FORM-8B المضبط بدقة 97.7% في مطابقة المخرجات الدقيقة في معيار 664-Deterministic، متفوقاً بشكل حاسم على نموذج GLM-5.2 (75.5 مليار معلمة) الذي حقق 75.5%، ونموذج DeepSeek-V4 Flash (304 مليار معلمة) الذي حقق 62.3%.
الأداء في المهام مفتوحة النهايات: في معيار Instruct-100، حقق FORM-8B معدل تنفيذ بنسبة 83.0% ومعدل مطابقة صارمة للمخرجات بنسبة 18.0%. وهذا يتجاوز بشكل كبير أفضل نموذج رائد (GLM-5.3) الذي سجل 65.0% في التنفيذ و5.6% في المطابقة الصارمة.
التحقق الصارم: استمر التفوق تحت نظام مطابقة المخرجات الصارم المتحقق منه عبر Form. في الـ 89 مهمة محددة المخرجات في Instruct-100، حلَّ FORM-8B نسبة 18.0% مقابل 5.6% لأفضل نموذج رائد. وأكدت اختبارات McNemar أن هذه الاختلافات ذات دلالة إحصائية (p≤0.007).
الحفاظ على القدرة العامة: تسبب الضبط الدقيق في تدهور طفيف في قدرات الاستدلال العامة: انخفض MMLU بمقدار 2.6 نقطة مئوية، وGSM8K بمقدار 1.5، وHumanEval بمقدار 0.6.
نتائج دراسة الاستبعاد (Ablation): أدى التدريب على البيانات الحتمية وحدها (v3b) إلى تحقيق أداء عالٍ في المهام الحتمية ولكن مع انهيار في القدرة على المهام مفتوحة النهايات (29.0%). وكان تضمين البيانات المتنوعة والمحققة (v3c) هو المحرك الأساسي للنجاح في المهام مفتوحة النهايات.
الأهمية والادعاءات تدعي الورقة أنه بالنسبة للغات النطاق المحدد (DSLs) صفرية الموارد، فإن بيانات المهام المحددة والمحققة أكثر قيمة من عدد المعلمات الخام. وتوضح الدراسة أن نموذجاً مدمجاً ومضبوطاً بدقة يمكن أن يتفوق على النماذج ذات الحجم الرائد بفارق كبير في معدل التنفيذ وصحة المخرقات الصارمة عندما تكون اللغة المستهدفة غائبة عن مجموعات بيانات التدريب المسبق.
يوفر هذا العمل نموذجاً لجلب البرمجة المدعومة بالذكاء الاصطناعي إلى اللغات العلمية المتخصصة:
تحديد أوراكل تنفيذ حتمي (ملف Form الثنائي).
توليد بيانات التدريب والتحقق منها من خلال هذا الأوراكل لضمان الصلاحية النحوية والدلالية دون تدخل بشري.
ضبط نموذج صغير باستخدام طرق موفرة للمعلمات (QLoRA).
يؤكد المؤلف أن نتائجهم خاصة بلغة Form والمعايير المرجعية التي تم إنشاؤها. كما يشير إلى القيود، بما في ذلك صغر حجم مجموعات الاختبار مفتوحة النهايات (مما يؤدي إلى فترات ثقة واسعة في بعض المقاييس)، وعدم وجود تقييم بشري من قبل علماء الفيزياء، واحتمالية وجود تحيز في المعايير التي أنشأها المؤلف. ومع ذلك، فإن إصدار أوزان النموذج ومجموعة المعايير الكاملة (840 مهمة) يهدف إلى إنشاء معيار عام لتقييم توليد كود Form.