← أحدث الأبحاث
🔬 materials science

A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation

تقدم هذه الورقة إطار عمل للمحاذاة قائمًا على المخطط (schema-first) يعمل على توليف معرفة واسعة النطاق في المجال واستغلال سير عمل لتحسين التفضيل المباشر (DPO) مدفوع باسترجاع المعلومات (IR)، وذلك لبناء نماذج لغوية كبيرة مدمجة وقابلة للتنفيذ ومتخصصة في مجال معين، تتفوق على النماذج العامة في المجالات العلمية شحيحة البيانات مثل محاكاة TCAD لأشباه الموصلات ومحاكاة العناصر المحدودة (FEM).

المؤلفون الأصليون: Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

نُشر 2026-09-18
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الإلكترونيات الحديثة غير المرئي، لم تعد الرقائق التي تشغل هواتفنا وحواسيبنا مجرد تصميمات فحمة؛ بل أصبحت تُحاكى. فقبل قطع أي رقاقة سيليكون، يستخدم المهندسون برمجيات قوية لبناء توائم رقمية لهذه الأجهزة المجهرية. هذه المحاكاة، المعروفة باسم "تصميم التكنولوجيا بمساعدة الحاسوب" (TCAD)، تعمل كمختبر افتراضي؛ فهي تتيح للعلماء التنبؤ بكيفية تدفق الكهرباء عبر طبقات من المواد لا يتجاوز سمكها بضع ذرات، واختبار ملايين المتغيرات دون تكلفة أو وقت التصنيع الفعلي. ومع ذلك، فإن تشغيل هذه المحاكاة أمر صعب للغاية؛ إذ يتطلب كتابة نصوص برمجية معقدة قابلة للقراءة حاسوبياً، تخبر البرنامج بدقة كيفية بناء جهاز افتراضي، وأين يضع المواد، وكيف يقيس النتائج. يجب أن تكون هذه النصوص مثالية؛ فكلمة واحدة في غير محلها أو رقم خاطئ يمكن أن يتسبب في فشل المحاكاة بأكملها، مما يترك المهندس ليبدأ من جديد. لسنوات، اعتمدت الصناعة على خبراء بشريين لكتابة هذه النصوص، وهي عملية بطيئة، وعرضة للخطأ، ويصعب أتمتتها.

لقد طور فريق من الباحثين الآن طريقة جديدة لتعليم الذكاء الاصطناعي كتابة هذه النصوص بشكل صحيح، حتى عندما تتوفر بيانات قليلة جداً للتعلم منها. لقد أنشأوا نظاماً يسمى "TcadGPT"، وهو نموذج حاسوبي متخصص مصمم لفهم لغة هندسة أشباه الموصلات. وخلافاً لنماذج الذكاء الاصطناعي العامة التي يمكنها كتابة الشعر أو تلخيص الأخبار ولكنها غالباً ما تفشل في المهام التقنية الدقيقة، تم تدريب هذا النموذج الجديد على توليد أكواد يمكن لبرنامج المحاكاة تشغيلها بالفعل. ووجد الباحثون أنه من خلال الجمع بين كم هائل من الأسئلة والأجوبة الاصطناعية وطريقة فريدة لتصحيح أخطاء النموذج، استطاعوا تعليم الذكاء الاصطناعي إنتاج نصوص برمجية صالحة وموثوقة للغاية. ويشير عملهم إلى أنه في المجالات المتخصصة للغاية حيث تكون البيانات شحيحة والأخطاء مكلفة، يمكن لنموذج ذكاء اصطناعي أصغر ومعدل بعناية أن يتفوق حتى على الأنظمة الأكثر تقدماً وعمومية، بشرما تم تعليمه بالطريقة الصحيحة.

كان التحدي الذي واجهه الباحثون فريداً من نوعه. ففي العديد من المجالات، يتعلم الذكاء الاصطناعي من خلال قراءة مكتبات ضخمة من النصوص والأكواد الموجودة. ولكن في تصميم أشباه الموصلات، غالباً ما تكون النصوص الحقيقية المستخدمة في المصانع سرية، والأدلة العامة المتاحة للتعلم ليست مكتوبة ليقرأها الحاسوب. وقد خلق هذا نقصاً في البيانات. ولحل هذه المشكلة، لم ينتظر الفريق ظهور المزيد من البيانات؛ بل صنعوا بياناتهم الخاصة. فقد أخذوا أدلة المستخدم والكتب الدراسية واستخدموا ذكاءً اصطناعياً قوياً لتوليد أكثر من 1.5 مليون زوج من الأسئلة والأجوبة الجديدة. وصمموا طريقتين مختلفتين لهذا التوليد؛ حيث قرأت إحدى الطريقتين الوثائق بشكل عام لالتقاط المفاهيم العامة، بينما ركزت الأخرى على كلمات رئيسية محددة مثل أسماء المواد أو القوانين الفيزيائية لضمان الدقة العميقة. منحت هذه العملية النموذج أساساً قوياً من المعرفة، مما سمح له بالإجابة على الأسئلة المتعلقة بكيفية عمل عمليات المحاكاة بدقة بلغت 85.6 بالمائة، متفوقاً بشكل كبير على نماذج الذكاء الاصطناعي العامة التي سجلت أقل من 50 بالمائة في الاختبارات نفسها.

ومع ذلك، فإن معرفة الحقائق لا تعني بالضرورة القدرة على كتابة الكود. فقد اكتشف الباحثون أن مجرد تعليم النموذج الإجابة على الأسئلة لم يكن كافياً لجعله يكتب نصوصاً برمجية يمكن للبرنامج تنفيذها؛ إذ كان النموذج غالباً ما يصيب في الفيزياء ولكنه يخطئ في بناء الجملة (syntax)، فيضع الأوامر في ترتيب خاطئ أو يغفل خطوة حاسمة. ولإصلاح ذلك، قدموا مرحلة تدريب ثانية أكثر صرامة. فقد أخذوا نصوصاً برمجية عاملة ومحققة وقاموا بتفكيكها إلى تنسيق هيكلي ومنطقي جردها من الصياغة المحددة لكنه حافظ على المعنى الجوهري. ثم أنشأوا آلاف المتغيرات من هذه النصوص، بعضها مثالي وبعضها يحتوي على أخطاء صغيرة متعمدة. ثم عُرضت هذه الأزواج على النموذج وطُلب منه اختيار الصحيح منها، ليتعلم كيفية التعرف على أصغر الأخطاء وتجنبها. هذه العملية، التي يسميها الباحثون "IR-to-DPO"، علمت النموذج أن يكون صارماً في اتباع التعليمات.

كانت نتائج هذا التدريب المكون من خطوتين مذهلة. فعند اختباره على مجموعة من عشرين تعليمات جديدة لم يسبق للنموذج رؤيتها، نجح الإصدار النهائي من "TcadGPT" في توليد نصوص برمجية قبلها برنامج المحاكاة دون خطأ بنسبة 80 بالمائ المائة. وفي المقابل، فشل نموذج ذكاء اصطناعي عام رفيع المستوى في جميع المحاولات العشرين، منتجاً أكواداً تبدو صحيحة للبشر ولكنها مرفوضة من قبل الآلة. كما كشفت الدراسة عن رؤية مفاجئة حول كيفية تعلم الذكاء الاصطناً في هذه المجالات المتخصصة؛ فقد اختبر الباحثون ما إذا كان منح النموذج إمكانية الوصول إلى مكتبة من الوثائق أثناء الاختبار سيساعد، وهي تقنية تُعرف باسم "الاسترجاع" (retrieval). وبينما ساعد هذا التقنية نماذج الذكاء الاصطناعي العامة، إلا أنها أدت في الواقع إلى تراجع أداء نموذجهم المتخصص. ووجد الباحثون أن إضافة معلومات خارجية أثناء الاختبار لنموذج مدرب بعمق على موضوع معين تسببت في إرباكه، مما جعله يفقد التركيز على القواعد الدقيقة التي تعلمها.

ولإثبات أن نهجهم لم يكن مجرد صدفة سعيدة خاصة بنوع واحد من البرامج، طبق الفريق نفس وصفة التدريب على أداة محاكاة أخرى تسمى "Elmer"، تُستخدم لحل المشكلات الفيزيائية المعقدة في الهندسة. ورغم أن هذه الأداة مختلفة تماماً عن برنامج أشباه الموصلات، إلا أن النموذج الذي تم تدريبه بمنهجيتهم لا يزال يتفوق على نماذج الذكاء الاصطناعي العامة في كل من الإجابة على الأسئلة وكتابة كود يعمل. وهذا يشير إلى أن الإطار الذي بنوه هو وسيلة قوية يمكن تكييفها مع مجالات علمية أخرى تعاني من نقص البيانات. إن هذا العمل يثبت أنه في عالم الهندسة عالي المخاطر، حيث يمكن لخطأ واحد أن يكلف ملايين الدولارات، فإن الطريق نحو المستقبل ليس بالضرورة عبر نماذج أكبر وأكثر عمومية، بل عبر نماذج أصغر ومتخصصة للغاية، يتم تعليمها بدقة وانضباط شديدين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →