← أحدث الأبحاث
💬 NLP

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

تقدم هذه الورقة البحثية SWE-QA-Pro، وهو معيار مرجعي صارم لفهم الأكواد البرمجية على مستوى المستودعات (repository-level) مصمم لمنع حفظ النماذج اللغوية الكبيرة (LLM) من خلال بيانات متنوعة وذات ذيول طويلة ومعايرة للصعوبة، إلى جانب وصفة تدريب قابلة للتوسع تتكون من مرحلتين (SFT وRLAIF) تمكن النماذج المفتوحة الصغيرة من تجاوز GPT-4o في الاستكشاف الوكيل للمجموعات البرمجية (agentic codebase exploration).

المؤلفون الأصليون: Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu C
نُشر 2026-03-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث SWE-QA-Pro، مترجماً إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

المشكلة الكبيرة: "الكتاب المدرسي" مقابل "العالم الحقيقي"

تخيل أنك تدرب طالباً ليكون محققاً بارعاً.

الطريقة القديمة (الاختبارات المرجعية الحالية):
كانت معظم الاختبارات السابقة تشبه إعطاء الطالب كتاباً مدرسياً وسؤاله: "من قتل السيد بودي في المكتبة؟". قد يجيب الطالب بشكل صحيح لأنه حفظ الكتاب (المستودعات البرمجية "الشائعة" التي يعرفها الجميع). ولكن في العالم الحقيقي، لا يملك المحقق كتاباً مدرسياً؛ بل عليه الدخول إلى قصر غريب وغير مألوف، يفتح الأدراج، يبحث تحت السجاد، ويتحدث إلى الشهود لحل اللغز.

المشكلة هي أن نماذج الذكاء الاصط�ناটি الحالية بارعة في استرجاع الحقائق من ذاكرتها، لكنها سيئة جداً في "استكشاف" قاعدة بيانات برمجية جديدة ومعقدة للعثور على الإجابة. إنهم "عارفون بكل شيء" لكنهم لا يستطيعون "فعل كل شيء".

الحل: SWE-QA-Pro

بنى المؤلفون ساحة تدريب جديدة تسمى SWE-QA-Pro. فكر في هذا كبرنامج "تلفزيون واقع للبقاء على قيد الحياة" لوكلاء الذكاء الاصطناعي.

1. الحلبة: المستودعات "ذات الذيل الطويل" (غير الشائعة)

بدلاً من اختبار الذكاء الاصطناعي على المشاريع الشهيرة والمعروفة (مثل "المكتبة" في تشبيهنا)، اختاروا 26 مشروعاً برمجياً غريباً، معقداً، وغير مشهور (مثل "القصور الغريبة والمبعثرة").

  • لماذا؟ لأنه إذا استطاع الذكاء الاصطناعي حل لغز في قصر غريب وغير معروف، فهذا يثبت أنه يعرف حقاً كيف يحقق، وليس فقط كيف يسترجع الحقوق.
  • اللمسة المميزة: تأكدوا من أن كل "قصر" مبني بالكامل ويعمل وظيفياً. يمكن للذكاء الاصطناعي تشغيل الكود فعلياً، وليس مجرد قراءته.

2. الفلتر: استبعاد الغشاشين

أدرك المؤلفون أن بعض الأسئلة سهلة للغاية. إذا سألت: "ماذا تفعل دالة print؟"، يمكن لذكاء اصطناعي ذكي الإجابة دون النظر إلى الكود. وهذا يعتبر غشاً في اختبار المحقق.

لذا، أنشأوا فلتر الصعوبة:

  • طلبوا من الذكاء الاصطناعي الإجابة على سؤال دون النظر إلى الكود.
  • إذا أجاب الذكاء الاصطناعي بشكل صحيح بمجرد التخمين أو التذكر، فإنهم يستبعدون السؤال.
  • احتفظوا فقط بالأسئلة التي كان على الذكاء الاصطناست فيها فتح الملفات، والبحث عبر المجلدات، وتتبع المنطق للوصول إلى الإجابة. هذا يضمن أن الاختبار يقيس مهارات الاستكشاف، وليس مجرد الذاكرة.

3. وصفة التدريب: من "طالب" إلى "محقق"

تقدم الورقة أيضاً طريقة جديدة لتدريب نماذج الذكاء الاصطناعي الصغيرة لتصبح محققين خبراء. استخدموا روتيناً تدريبياً من خطوتين:

  • الخطوة 1: الضبط الدقيق تحت الإشراف (SFT) - "الفصل الدراسي"
    لقد علموا النموذج قواعد اللعبة. أظهروا له أمثلة حول كيفية استخدام الأدوات (مثل "البحث"، "عرض الملف"، و"تشغيل الأمر") لحل المشكلات. الأمر يشبه تعليم طالب كيفية استخدام العدسة المكبرة ودفتر الملاحظات.

  • الخطوة 2: التعلم المعزز من التعليقات الراجعة للذكاء الاصطناعي (RLAIF) - "رقيب التدريب"
    هذا هو السر الخفي. بعد الفصل الدراسي، تركوا النموذج يحاول حل المشكلات بمفرده.

    • إذا خمن النموذج الإجابة دون النظر، يحصل على درجة منخفضة.
    • إذا فتح الملفات الصحيحة، ووجد السطر المحدد من الكود، واستشهد بأدلته، يحصل على درجة عالية.
    • قام "قاضٍ ذكاء اصطناعي" (ذكاء اصطناعي فائق الذكاء) بتقييم عمل النموذج، ومكافأته على كونه دقيقاً وواقعياً.

النتائج: انتصار الطرف الأضعف

كانت النتائج مفاجئة. لقد أخذوا نموذجاً مفتوح المصدر وصغيراً نسبياً (Qwen3-8B) ودربوه باستخدام طريقة "تلفزيون الواقع" هذه.

  • النتيجة: تفوق هذا النموذج الصغير المدرب على GPT-4o (نموذج ضخم، باهظ الثمن، ومملوك لجهة خاصة) في اختبارهم الخاص.
  • الدرس المستفكاد: لا تحتاج إلى عقل عملاق إذا كنت تملك التدريب الصحيح. تعليم الذكاء الاصطناعي كيف يستكشف أهم من مجرد جعل الذكاء الاصطناعي أكبر حجماً.

ملخص التشبيه

  • المراجع القديمة: سؤال طالب عن حبكة فيلم مشهور شاهده آلاف المرات.
  • SWE-QA-Pro: وضع الطالب في غرفة مظلمة مع صندوق ألغاز جديد ومعقد، ورؤية ما إذا كان بإمكه معرفة كيفية فتحه عن طريق تحسس الأزرار وتدوير المقابض.
  • التدريب: بدلاً من إعطاء الطالب مفتاح الإجابة، يتم مكافأته في كل مرة ينجح فيها في تدوير مقبض أو العثور على حجرة مخفية.

باختصار: تقول الورقة: "توقفوا عن اختبار الذكاء الاصطناعي فيما يعرفه بالفعل. ابدأوا باختبار مدى قدرته على التعلم والاستكشاف. وإذا دربتموه على ذلك، يمكن حتى للنماذج الصغيرة أن تهزم العمالقة".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →