← أحدث الأبحاث
⚡ electrical engineering

A Benchmark on LLM-Based Power Flow Computation: Do More Structured Prompts Help?

تقدم هذه الورقة معياراً مرجعياً يوضح أنه بينما يتفوق نموذج Gemini 2.5 Pro على النماذج الأخرى في حساب تدفق القدرة بطريقة "غاوس-سايدل" القائم على النماذج اللغوية الكبيرة، إلا أنه لا يوجد أي تكوين يحقق الموثوقية المطلوبة للحل العددي المباشر، ومن المثير للدهشة أن المطالبات الأكثر هيكلية يمكن أن تؤدي إلى تدهور الدقة مقارنة بالتنسيقات السردية البسيطة.

المؤلفون الأصليون: Tingwei Chen, Kaiyang Huang, Kai Sun

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tingwei Chen, Kaiyang Huang, Kai Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك ثلاثة "طلاب" مختلفين من الذكاء الاصطناği (لنسمهم Gemini، وClaude، وGPT-3.5) وتريد معرفة ما إذا كان بإمكانهم العمل كآلة حاسبة لشبكة طاقة. على وجه التحديد، أنت تطلب منهم حل مسألة رياضية كلاسيكية تتكون من خطوات متتالية تسمى "تدفق الطاقة" (Power Flow)، والتي يستخدمها المهندسون للتأكد من أن الكهرباء تنتقل بأمان عبر الشبكة.

لقد صمم الباحثون تجربة محكومة لمعرفة شيئين:

  1. هل يستطيع هؤلاء الطلاب من الذكاء الاصطناعي القيام بالرياضيات فعلياً؟
  2. هل تغير الطريقة التي تطرح بها السؤال (الأمر/البرومبت) مدى جودة أدائهم؟

إليك تفصيل لنتائجهم باستخدام تشبيهات بسيطة:

الإعداد: طريق ذو ثلاث حارات

أنشأ الباحثون شبكة طاقة مصغرة ومبسطة تتكون من ثلاث "مدن" (حافلات/Buses) متصلة بطرق (خطوط نقل). قاموا بتوليد 50 سيناريو مرور مختلف (أحمال عشوائية وظروف طرق مختلفة) وطلبوا من الذكاء الاصطناعي حساب كمية الكهرباء التي يحتاج محطة توليد الطاقة الرئيسية (الحافلة الرئيسية/Slack Bus) لتوليدها لإبقاء كل شيء يعمل.

اختبروا الذكاء الاصطناعي بـ أربع طرق مختلفة لطرح السؤال:

  1. القصة: فقرة بسيطة تصف المشكلة (مثل سؤال في كتاب مدرسي).
  2. القصة + المثال: نفس القصة، ولكن مع مثال محلول من كتاب مدرسي قبلها مباشرة.
  3. قائمة التحقق: قائمة مرقمة من الخطوات التي يجب اتباعها، تطلب من الذكاء الاصطناعي توضيح خطوات عمله.
  4. الجدول الحسابي: تنسيق صارم قابل للقراءة آلياً (JSON) مع شرط صارم بضرورة إظهار كل خطوة من خطوات الحساب.

النتائج: من نجح ومن رسب؟

1. "المُفرط في التفكير" (Gemini 2.5 Pro)

  • المفاجأة: قد تعتقد أن إعطاء ذكاء اصطناعي جدولاً صارماً وطلب منه إظهار كل خطوة سيجعله أكثر دقة. لكنه فعل العكس.
  • التشبيه: تخيل أنك تطلب من طالب عبقري في الرياضيات حل مسألة ما. عندما تقول له فقط: "إليك المسألة، أعطني الإجابة"، فإنه يصيب في 54% من المرات. ولكن عندما تسلمه نموذجاً معقداً وتقول له: "املأ كل خانة وأظهر عملك سطراً بسطر"، فإنه يرتبك، ويفرط في التعقيد، وتتضاعف أخطاؤه ثلاث مرات.
  • الحكم: Gemini هو الأذكى من بين الثلاثة، لكنه حساس جداً لكيفية التحدث إليه. البساطة هي الأفضل؛ فالتعليمات المعقدة تضر أداءه في الواقع.

2. "إيدي المستقر" (Claude Sonnet 4.5)

  • السلوك: لم يهتم Claude كثيراً بكيفية طرح السؤال. سواء كان قصة، أو قائمة تحقق، أو جدولاً حسابياً، فقد أصاب الإجابة الصحيحة حوالي 38% من الوقت بغض النظر عن ذلك.
  • التشبيه: فكر في Claude كطالب لديه طريقة خاصة في الدراسة. تغيير تنسيق الاختبار لا يساعده، لكنه لا يضره أيضاً. إنه يبقى دائماً في منطقة "المتوسط".
  • الحكم: إضافة مثال محلول (إظهار مسألة محلولة لهم) ساعد Claude قليلاً، لكنه لم يكن كافياً لجعله حاسبة موثوقة.

3. "الطالب المتعثر" (GPT-3.5 Turbo)

  • السلوك: فشل هذا النموذج في كل مرة تقريباً، بغض النظر عن كيفية طرح السؤال.
  • التشبيه: تخيل أنك تطلب من طالب لم يتعلم المادة بعد حل مسألة في التفاضل والتكامل. سواء أعطيته تلميحاً، أو كتاباً مدرسياً، أو آلة حاسبة، فإنه سيخطئ في 90% إلى 96% من المرات.
  • الحكم: هو ببساطة غير قادر على القيام بهذا النوع المحدد من الرياضيات المعقدة متعددة الخطوات في الوقت الحالي.

الخلاصة الكبرى: "المزيد من التعليمات" ≠ "نتائج أفضل"

أهم نتيجة توصل إليها هذا البحث هي تحذير لأي شخص يحاول استخدام الذكاء الاصطناعي في الرياضيات أو الهندسة: إعطاء الذكاء الاصطناعي تعليمات أكثر تفصيلاً، أو بيانات مهيكلة، أو مطالبته بـ "إظهار عمله" لا يضمن دقة أفضل.

في الواقع، بالنسبة لأذكى نموذج تم اختباره، جعل الأمر (البرومبت) أكثر تعقيداً جعل الأداء أسوأ. الأمر يشبه إخبار نظام تحديد المواقع (GPS) بـ "أعد حساب المسار باستخدام خوارزمية محددة" بينما كان يحتاج فقط لقول "اذهب إلى هناك". القواعد الإضافية أربكت النظام.

الاستنتاج النهائي: ليس جاهزاً للاستخدام الفعلي

خلص الباحثون إلى أن لا أحد من نماذج الذكاء الاصطناعي هذه جاهز لاستبدال الآلة الحاسبة الهندسية الحقيقية.

  • حتى أفضل نتيجة (Gemini مع أمر بسيط) كانت تصيب الإجابة ضمن هامش خطأ 5% حوالي نصف الوقت.
  • في العالم الحقيقي، إذا كنت تدير شبكة طاقة، فإن خطأ بنسبة 5% قد يعني انقطاع التيار الكهربائي أو نشوب حريق. أنت بحاجة إلى دقة بنسبة 100%.

الملخص: نماذج الذكاء الاصطناعي هذه رائعة في شرح ما هو تدفق الطاقة أو مساعدة المهندسين في طرح الأفكار، لكنها ليست جاهزة لتكون الحاسبات الفعلية التي تدير الشبكة. إذا طلبت منها القيام بالعمليات الحسابية، فلا تزال بحاجة إلى إنسان (أو برنامج كمبيوتر تقليدي) للتحقق من الأرقام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →