← أحدث الأبحاث
🤖 machine learning

Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

تجادل هذه الورقة بأن تحسين النماذج اللغوية الكبيرة من أجل معايير برمجية ضيقة مثل SWE-bench يفشل في تحسين قدرات البرمجة العامة أو الانتقال إلى مهام أخرى، مما يستوجب التحول نحو أساليب تقييم متنوعة وشاملة وصيانة مستمرة للمعايير لضمان التقييم الموثوق.

المؤلفون الأصليون: Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov

نُشر 2026-08-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الإعداد: عالم من الأكواد وفخ "بطاقة النتائج"

تخيل عالماً تتعلم فيه الحواسيب كتابة برمجياتها الخاصة، وهو مجال يُعرف باسم "التعلم العميق للأكواد" (Deep Learning for Code). في هذا العالم، يبني الباحثون أدمغة رقمية ضخمة تُسمى "النماذج التأسيسية" (foundation models) التي يمكنها فهم لغات البرمجة. ولتحديد مدى ذكاء هذه الأدمغة، يستخدم العلماء "المعايير المرجعية" (benchmarks) — وهي في الأساس اختبارات معيارية، مثل اختبارات الـ SAT أو الألعاب الأولمبية للذكاء الاصطناعي. وأشهر هذه الاختبارات حالياً هو SWE-bench. وهو تحدٍ محدد حيث يُعطى الذكاء الاصطناعي خطأً برمجياً (bug) من واقع الحياة ويُطلب منه إصلاحه.

لفترة طويلة، عمل المجتمع التقني بناءً على افتراض بسيط: إذا حصل الذكاء الاصطناعي على درجة عالية في SWE-bench، فلا بد أنه مبرمج عبقري بشكل عام. الأمر يشبه افتراض أنه نظرًا لأن طالباً تفوق في قسم الرياضيات في اختبار معياري، فهو بالضرورة عبقري في الفيزياء والتاريخ والفن. يسأل هذا البحث سؤالاً مهماً للغاية: هل هذا الافتراض صحيح حقاً؟ يخشى المؤلفون من أننا قد نخدع أنفسنا؛ فهم يشتبهون في أن نماذج الذكاء الاصطناعي تتحول إلى "مؤدية للاختبارات" بدلاً من كونها "مفكرة" — فهي تتعلم بالضبط كيف تجتاز امتحان SWE-bench المحدد دون أن تصبح أفضل فعلياً في وظيفة البرمجة الواسعة والمعقدة في العالم الحقيقي.

الورقة البحثية: لماذا قد تكذب علينا بطاقة النتائج؟

قرر مؤلفو هذه الورقة، وهم فريق من الباحثين من شركة JetBrains وجامعات مختلفة، وضع هذا الافتراض قيد الاختبار. ويجادلون بأن هناك "فجوة معنى" بين ما تقيسه هذه المعايير المرجعية فعلياً وما نزعم إثباته. وللعثور على الحقيقة، لم يكتفوا بمجرد النظر إلى الدرجات الموجودة؛ بل بنوا ميدان اختبار جديد خاص بهم.

التجربة: ملعب جديد
أنشأ الباحثون مجموعة معايير مرجعية مخصصة تعتمد على Django، وهو إطار عمل ويب شهير. لماذا Django؟ لأنه يشكل ما يقرب من نصف أسئلة SWE-bench. إذا كان الذكاء الاصطناعي عبقرياً في البرمجة حقاً، فيجب أن يكون قادراً على إصلاح الأخطاء في Django بنفس الكفاءة التي يحل بها مشكلات SWE-bench.

لقد صمموا ثلاثة أنواع محددة من التحديات لمعرفة ما إذا كان بإمكان الذكاء الاصطناعي التعامل مع أنواع مختلفة من العمل:

  1. توليد الدوال (Method Generation): كتابة دالة جديدة تماماً من الصفر بناءً على وصف.
  2. إكمال الدوال (Method Completion): إنهاء دالة تم البدء فيها بالفعل.
  3. إصلاح البرامج (Program Repair): العثัง على جزء مكسور من الكود وإصلاحه باستخدام رسائل الخطأ.

ثم أخذوا مجموعة من نماذج الذكاء الاصطناعي التي تم "تدريبها" بكثافة لتفوق في SWE-bench واختبروها على تحديات Django الجديدة الخاصة بهم. كما اختبروا نماذج قاموا بتدريبها بأنفسهم على مهمة واحدة محددة فقط ليروا ما إذا كانت تلك المهارة ستنتقل إلى مهام أخرى.

الاكتشاف الكبير: مشكلة "المتخصص"
كانت النتائج صادمة نوعاً ما. تشير الورقة إلى أن تحسين الذكما الاصطناعي من أجل SWE-bench لا يجعله مبرمجاً عاماً أفضل. في الواقع، غالباً ما يجعله أسوأ في أشياء أخرى.

  • عدم انتقال المهارات: عندما أخذوا نماذج كانت بمثابة "نجوم" في SWE-bench وسألوها القيام بمهام Django الجديدة، فشلت النماذج غالباً. لم يصبحوا أفضل في إصلاح الأخطاء أو كتابة أكواد جديدة؛ بل أصبحوا فقط أفضل في حل نوع اللغز المحدد الذي يستخدمه SWE-bench. الأمر يشبه تدريب كلب على جلب نوع معين من الكرات، ثم الشعور بالمفاجأة عندما لا يستطيع الإمساك بقرص طائر (frisbee).
  • فخ "التنسيق" (Format Trap): العديد من النماذج التي فشلت لم تفشل لأنها لم تستطع كتابة الكود. بل فشلت لأنها ارتبكت بسبب تنسيق الإجابة. لقد علمهم التدريب على SWE-bench إخراج الكود مغلفاً بعلامات أو أنماط محددة لم تتوقعها الاختبارات الجديدة. أصبحت النماذج بارعة جداً في اتباع "تعليمات الامتحان" لدرجة أنها نسيت كيف تقوم بالعمل الفعلي فحسب.
  • وهم "المهمة الواحدة": عندما درب الباحثون نماذج على مهمة واحدة فقط (مثل إصلاح الأخطاء فقط)، أصبحت تلك النماذج بارعة جداً في إصلاح الأخطاء ولكنها لم تصبح أفضل في كتابة أكواد جديدة أو إكمال الأكواد الجزئية. وهذا يثبت أن "التحسن" كان ضيقاً ومحدداً، وليس دفعة ذكاء عامة.

الحكم النهائي: لا تثق بلوحة المتصدرين
تخلص الورقة إلى أن الاعتماد على معيار مرجعي واحد مثل SWE-bench للادعاء بأن النموذج يمتلك "قدرة برمجة عامة" هو أمر مضلل. ويقترح المؤلفون أن المجال قد وقع في فخ حيث يتم تحسين الأداء من أجل "درجة الاختبار" بدلاً من "المهارة الفعلية".

إنهم يقترحون طريقة جديدة للتفكير:

  • بالنسبة للنماذج الأكبر والأكثر تقدماً: نحن بحاجة إلى تقييمات "شمولية"، مثل مراقبتها وهي تعمل على مشاريع حقيقية مفتوحة النهايات، بدلاً من مجرد إعطائها اختبارات متعددة الخيارات.
  • بالنسبة للبحث العلمي: نحن بحاجة إلى مجموعات متنوعة من الاختبارات التي تغطي أنواعاً مختلفة من مهام البرمجة، وليس مجرد مهمة واحدة.
  • بالنسبة للاستخدام في العالم الحقيقي: نحن بحاجة إلى اختبار النماذج على المهام المحددة التي تهمنا فعلياً، وربما مع وجود عنصر بشري للمراجعة والتحقق من العمل.

باختصار، تحذرنا الورقة من أن الحصول على درجة عالية في لوحة متصدري البرمجة لا يعني أن الذكاء الاصطناعي هو باني ماهر؛ بل قد يعني فقط أنه بارع في أداء الاختبارات. لمعرفة ما إذا كان الذكاء الاصطناعي ذكياً حقاً، نحتاج إلى التوقف عن النظر إلى رقم واحد والبدء في النظر إلى الصورة الكاملة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →