← أحدث الأبحاث
🤖 AI

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

تجادل هذه الورقة بأن أطر تقييم النماذج اللغوية الكبيرة الحالية التي تعتمد على مطالبات ثابتة هي مضللة لأن تحسين المطالبات يغير ترتيب النماذج بشكل كبير، مما يستلزم تحسين المطالبات لكل نموذج على حدة لتحديد أفضل نموذج لمهمة معينة بدقة.

المؤلفون الأصليون: Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "التحسين قبل التقييم: التقييم باستخدام مطالبات غير محسنة قد يكون مضللاً"، باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الفكرة الكبرى: فخ "المقاس الواحد الذي يناسب الجميع"

تخيل أنك مدير توظيف يحاول العثور على أفضل طباخ لمطعمك. لديك خمسة طهاة مختلفين (لنسمهم الطراز أ، ب، ج، د، وهـ). لاختبارهم، تعطي جميعاً نفس بطاقة الوصفة تماماً: "اصنع حساءً. استخدم الملح، والفلفل، والبصل."

تراقبهم وهم يطبخون، وتتذوق الحساء، ثم ترتبهم. الطاهي (ب) هو الفائز. تقوم بتوظيف الطاهي (ب).

المشكلة: الطاهي (ب) بارع في اتباع تلك الوصفة المحددة، ولكن ربما يكون الطاهي (د) عبقرياً لكنه يحتاج فقط إلى كتابة الوصفة بشكل مختلف قليلاً ليتألق. ربما يحتاج الطاهي (د) إلى تعليمات تقول: "قم بتسبيك البصل أولاً، ثم أضف الملح" ليقدم أفضل ما لديه.

تجادل هذه الورقة البحثية بأن الطرق الحالية لاختبار نماذج الذكاء الاصطناعي (النماذج اللغوية الكبيرة) تشبه حال مدير التوظيف هذا. فهي تعطي كل ذكاء اصطناعي نفس المطالبة الثابتة (بطاقة الوصفة) وترتبهم بناءً على من أدى بشكل أفضل مع تلك البطاقة المحددة.

يقول المؤلفون إن هذا أمر مضلل. في العالم الحقيقي، إذا وظفت ذكاءً اصطناعياً، فلن تعطيه مطالبة عامة فحسب؛ بل ستقوم بتعديل التعليمات للحصول على أفضل أداء من ذلك الذكاء الاصطناعي تحديداً. تطلق هذه الورقة على هذه العملية اسم تحسين المطالبة (Prompt Optimization - PO).

التجربة: عدّل الوصفة، يتغير الفائز

قام الباحثون باختبار خمسة نماذج ذكاء اصطناعي شهيرة على مهام متنوعة (مثل حل المسائل الرياضية، أو الإجابة على أسئلة تجارية، أو استخراج البيانات).

  1. الجولة الأولى (الطريقة القديمة): أعطوا كل نموذج نفس المطالبة "الأساسية". ثم قاموا بترتيبهم.
  2. الجولة الثانية (الطريقة الجديدة): استخدموا أداة آلية لـ "ضبط" المطالبة لكل نموذج على حدة. سألوا الذكاء الاصطناعي: "كيف يمكننا إعادة كتابة التعليمات لكي تفهمها أنت بأفضل شكل؟" ثم أعادوا إجراء الاختبارات.

النتيجة: تغيرت التصنيفات تماماً.

  • في بعض الحالات، النموذج الذي جاء في المركز الأخير في الجولة الأولى قفز إلى المركز الأول في الجولة الثانية.
  • النموذج الذي كان "الأفضل" في الاختبار القدم لم يكن بالضرورة هو الأفضل عند إعطائه تعليمات مصممة خصيصاً لعقله الخاص.

التشبيه: الأمر يشبه اختبار العدائين على مضمار السباق.

  • الطريقة القديمة: تجعل الجميع يركضون بأحذية ثقيلة. العداء (أ) يفوز لأنه معتاد على الأحذية الثقيلة.
  • الطريقة الجديدة: تعطي العداء (أ) أحذية رياضية خفيفة والعداء (ب) دعامات طبية مخصصة. فجأة، يفوز العداء (ب).
  • الاستنتاج: لو اختبرتهم فقط بالأحذية الثقيلة، لكنت وظفت العداء الخطأ لسباق الماراثون.

النقاط الرئيسية المستخلصة من الدراسة

1. النموذج "الأفضل" يعتمد على المطالبة
وجدت الورقة أن "الفائز" في أي مسابقة يتغير بناءً على كيفية كتابة التعليمات. إذا كنت تريد اختيار أفضل ذكاء اصطناعي لمهمة معينة، يجب عليك أولاً تحسين التعليمات لتناسب ذلك الذكاء الاصطناعي تحديداً. إذا لم تفعل ذلك، فقد تختار نموذجاً متوسط الأداء في الواقع.

2. النماذج المختلفة تتفاعل بشكل مختلف
تماماً مثل البشر، للنماذج المختلفة "شخصيات" أو حساسيات مختلفة.

  • بعض النماذج (مثل النموذج ب في الدراسة) كانت حساسة جداً لتغييرات المطالبة. تعديل بسيط جعل أداءها يتحسن كثيراً.
  • نماذج أخرى كانت جيدة جداً بالفعل في مهمة معينة (مثل التوجيه البسيط) لدرجة أن تحسين المطالبة لم يساعدها كثيراً، أو ربما أربكها.

3. "الناقد" قد يصاب بالارتباك
استخدم الباحثون نموذج ذكاء اصطناعي "ناقد" (GPT-4o) للمساعدة في إعادة كتابة المطالبات للنماذج الأخرى. عادةً ما نجح هذا الأمر بشكل رائع. ومع ذلك، في بعض الأحيان أصبح "الناقد" ذكياً أكثر من اللازم أو أصبحت التعليمات معقدة للغاية، مما تسبب في فشل النموذج.

  • مثال: في إحدى الحالات، أخبرت المطالبة المحسّنة الذكاء الاصطناعي أن "يفكر خطوة بخطوة" لدرجة أنه بدأ بالإجابة على الأسئلة الأمثلة الموجودة في المطالبة بدلاً من الإجابة على سؤال الاختبار الفعلي. كان الأمر أشبه بطالب يقرأ إجابات الاختبار التجريبي بصوت عالٍ بدلاً من خوض الامتحان.

ماذا يعني هذا بالنسبة لك (الممارس/المستخدم)

إذا كنت شركة تحاول اختيار ذكاء اصطناعي للقيام بمهمة ما (مثل الرد على رسائل العملاء أو تحليل المستندات)، فلا تكتفِ بمجرد تشغيل اختبار قياسي (Benchmark).

تخلص الورقة إلى أنه لكي تجد أفضل نموذج حقاً لمهمتك المحددة، يجب عليك:

  1. أخذ مهمتك.
  2. تجربة نماذج مختلفة.
  3. تحسين المطالبة لكل نموذج على حدة لمعرفة ما يمكنهم فعله حقاً.
  4. ثم اختيار الفائز.

إذا تخطيت الخطوة الثالثة واستخدمت مطالبة عامة، فمن المرجح أنك تتخذ قرار توظيف سيئاً بناءً على اختبار مضلل.

الملخص

الورقة هي تحذير: لا تحكم على السمكة بقدرتها على تسلق الشجرة، ولا تحكم على الذكاء الاصطناعي بقدرته على اتباع مطالبة عامة. لتعرف من هو الأفضل حقاً، يجب أن تتحدث لغته. إذا لم تقم بتحسين المطالبة لكل نموذج، فإن نتائج تقييمك ستكون خاطئة على الأرجح، وقد ينتهي بك الأمر بالأداة الخاطئة للمهمة المطلوبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →