← أحدث الأبحاث
💬 NLP

SciCoQA: Quality Assurance for Scientific Paper--Code Alignment

تقدم الورقة البحثية SciCoQA، وهي مجموعة بيانات تضم 635 تباينًا بين الورقة العلمية والكود البرمجي مستمدة من مشكلات واقعية وتوليد اصطناعي لتقييم وتسليط الضوء على أوجه القصور في النماذج اللغوية الكبيرة في ضمان التنفيذ الأمين للمنشورات العلمية.

المؤلفون الأصليون: Tim Baumgärtner, Iryna Gurevych

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tim Baumgärtner, Iryna Gurevych

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك طاهٍ (شيف) نشرت للتو كتاب طهي مشهورًا. في كتابك، تصف وصفة "كعكة الشوكولاتة السرية" بالتفصيل: "اخلط الدقيق، والسكر، والكاكاو. اخبزها على درجة حرارة 350 فهرنهايت لمدة 30 دقيقة".

الآن، تخيل أن أحد المعجبين حاول خبز الكعكة باستخدام تعليماتك، لكنه شاهد أيضًا الفيديو الذي نشرته عبر الإنترنت يوضح كيف صنعتها. لاحظ في الفيديو أنك أضفت سرًا كوبًا من الإسبريسو وخبزتها لمدة 45 دقيقة، رغم أن الكتاب لم يذكر ذلك.

إذا خرجت الكعكة مذهلة، فقد يعتقد المعجب: "رائع، الكتاب يعمل!". ولكن إذا خرجت الكعة سيئة، أو إذا حاول خباز آخر اتباع الكتاب بدقة وفشل لأنه افتقد الإسبريسو السري، فستواجه مشكلة في قابلية التكرار (reproducibility problem). "الكتاب" (الورقة العلمية) و"الفيديو" (كود الكمبيوتر) لا يتطابقان.

هذا هو بالضبط ما يحاول بحث SCICOQA حله.

المشكلة الكبرى: "أزمة قابلية التكرار"

في عالم العلوم (خاصة الذكاء الاصطناعي وعلوم الكمبيوتر)، ينشر الباحثون أوراقًا تصف اكتشافاتهم. ولإثبات أنهم لا يكذبون، يشاركون أيضًا كود الكمبيوتر الخاص بهم. الهدف هو أن يتمكن أي شخص آخر من قراءة الورقة، وتشغيل الكود، والحصول على نفس النتيجة تمامًا.

لكن غالبًا ما يكون الكود غير مطابق لما تقوله الورقة.

  • ربما تقول الورقة "استخدم صيغة رياضية معينة"، لكن الكود يستخدم صيغة مختلفة قليلاً.
  • ربما نسيت الورقة ذكر خطوة حاسمة، لكن الكود يتضمنها.
  • ربما يحتوي الكود على "غش" خفي يجعل النتائج تبدو أفضل مما هي عليه في الواقع.

لسنوات، كان على البشر التحقق يدويًا من الكود مقابل الورقة للعثور على هذه التناقضات. ولكن مع وجود ملايين الأوراق ومستودعات الكود، لا يستطيع البشر مواكبة ذلك. الأمر يشبه محاولة تدقيق مكتبة من مليون كتاب عن طريق قراءة كل كلمة بنفسك.

الحل: SCICOQA (المحقق بين الكود والكتاب)

ابتكر المؤلفون أداة جديدة تسمى SCICOQA. فكر فيها كأنها محقق ذكي للغاية مصمم خصصًا للمقارنة بين ورقة علمية (كتاب الوصفة) وبين الكود الخاص بها (فيديو تعليمي) للعثور على الاختلافات.

لتدريب هذا المحقق، احتاجوا إلى "دليل تدريب" ضخم مليء بأمثلة على التناقضات. لقد بنوا هذا الدليل بطريقتين:

  1. الحالات الواقعية (ملفات "الجريمة الحقيقية"): بحثوا في مشكلات GitHub الحقيقية (حيث يشتكي الناس من وجود أخطاء برمجية) وتقارير قابلية التكرار (حيث يحاول الناس نسخ دراسة ما ويفشلون). ووجدوا حوالي 92 مثالاً حقيقيًا حيث لم يتطابق الكود مع الورقة.
  2. الحالات الاصطناعية (ملفات "المحاكاة"): نظرًا لأن التناقضات الحقيقية نادرة ويصعب العثور عليها، استخدموا ذكاءً اصطناعيًا لـ اختراع تناقضات جديدة. أخذوا كودًا حقيقيًا، وأجروا عليه تغييرات طفيفة وواقعية (مثل استبدال صيغة رياضية)، وصنعوا 543 تناقضًا وهميًا. هذا يشبه استخدام مدرسة تعليم القيادة لجهاز محاكاة لتعليم الطلاب كيفية التعامل مع الحوادث التي لم يختبروها فعليًا بعد.

كيف اختبروا المحققين؟

أخذ المؤلفون 22 من أكثر نماذج الذكاء الاصطناعي تقدمًا في العالم (مثل GPT-5 و Gemini وغيرها) وطلبوا منهم القيام بدور "المحقق بين الكود والكتاب". أعطوا الذكاء الاصطناعي ورقة وكودها وسألوه: "ما هو المختلف بين هذين الاثنين؟"

النتائج: الذكاء الاصطناعي جيد، لكنه ليس جيدًا بما يكفي
كانت النتائج بمثابة جرس إنذار:

  • أفضل ذكاء اصطناعي: تمكنت النماذج الأعلى أداءً (Gemini 3.1 Pro و GPT-5 Mini) من العثور على حوالي 47% فقط من التناقضات الحقيقية.
  • الأدلة المفقودة: كان الذكاء الاصطناعي بارعًا في رصد الاختلافات الواضحة (مثل "الكود يستخدم زرًا أحمر، بينما الورقة تقول أزرق"). ومع ذلك، كان سيئًا للغاية في رصد المعلومات المفقودة. إذا نسيت الورقة ذكر خطوة ما، بينما تضمنها الكود، فإن الذكاء الاصطناعي غالبًا ما يفشل في ملاحظة ذلك.
  • مشكلة "القصة الطويلة": الأوراق العلمية والأكواد يمكن أن تكون ضخمة (آلاف الصفحات من النصوص). عندما كان على الذكاء الاصطناعي قراءة مستند طويل جدًا، انخفض أداؤه بشكل كبير. إنه مثل محاولة تذكر كل تفاصيل فيلم مدته 10 ساعات بعد مشاهدته مرة واحدة؛ ستبدأ في نسيان الأجزاء الوسطى.

لماذا هذا مهم؟

يجادل المؤلفون بأنه مع تسارع العلم وأتمتته (مع وجود "علماء ذكاء اصطناعي" يكتبون أوراقهم وأكوادهم الخاصة)، فإننا بحاجة إلى طريقة للتحقق تلقائيًا مما إذا كان الذكاء الاصطناعي صادقًا أم لا.

حاليًا، لا يمكننا الوثوق تمامًا بالذكاء الاصطناعي ليكون الحكم النهائي على الحقيقة العلمية. إذا كتب الذكاء الاصطناعي ورقة وكودًا، ولم يكن لدينا أداة يمكنها تحديد الاختلافات بشكل موثوق، فقد ينتهي بنا الأمر بالكثير من العلوم "المزيفة" التي تبدو حقيقية ولكنها لا تعمل.

الخلاصة

SCICOQA هو معيار جديد (اختبار) يوضح لنا مدى المسافة التي يجب قطعها. إنه يثبت أنه بينما يصبح الذكاء الاصطناعي أكثر ذكاءً، فإنه لا يزال يكافح ليكون "مدقق حقائق" مثاليًا للعلوم. إنه ليس مستعدًا لاستبدال المراجعين البشريين بعد، ولكنه خطوة أولى حاسمة نحو بناء مستقبل يكون فيه العلم شفافًا، وموثوقًا، وقابلاً للتكرار.

باختصار: لقد بنينا اختبارًا لنرى ما إذا كان بإمكان الذكاء الاصطناعي كشف العلماء (أو غيرهم من الذكاء الاصطناعي) عندما لا يتطابق الكود الخاص بهم مع قصتهم. الذكاء الاصطناعي يحاول جاهدًا، لكنه لا يزال يفتقد حوالي نصف الأدلة. نحن بحاجة إلى تعليمه بشكل أفضل قبل أن نتركه يدير مختبر العلوم بأكمله.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →