← أحدث الأبحاث
💬 NLP

CoDiQ: Test-Time Scaling for Controllable Difficult Question Generation

تقدم هذه الورقة إطار عمل CoDiQ، الذي يستفيد من توسيع نطاق وقت الاختبار لتمكين التحكم الدقيق في صعوبة وقابلية حل الأسئلة المولدة بمستوى المسابقات، مما ينتج عنه مجموعة بيانات CoDiQ-Corpus التي تعزز بشكل كبير أداء نماذج الاستدلال الكبيرة عند استخدامها للتدريب.

المؤلفون الأصليون: Zhongyuan Peng, Caijun Xu, Changyi Xiao, Shibo Hong, Eli Zhang, Stephen Huang, Yixin Cao

نُشر 2026-02-03
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zhongyuan Peng, Caijun Xu, Changyi Xiao, Shibo Hong, Eli Zhang, Stephen Huang, Yixin Cao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث CoDiQ، مترجم إلى لغة بسيطة ويومية مع استخدام تشبيهات إبداعية.

الصورة الكبيرة: مشكلة "السؤال الصعب"

تخيل أنك تقوم بتدريب طالب (ذكاء اصطناعي) ليصبح "جراند ماستر" في حل الألغاز المعقدة، مثل الرياضيات المتقدمة أو تحديات البرمجة. لكي يصبح بارعاً حقاً، يحتاج الطالب إلى التدرب على أصعب المسائل المتاحة.

لكن هناك عقبة: المسائل الصعبة الحقيقية نادرة. البشر لا يستطيعون كتابة الكثير منها، ويستغرق الأمر وقتاً طويلاً للتحقق مما إذا كانت قابلة للحل أصلاً أم لا.

تحاول طرق الذكاء الاصطناعي الحالية ابتكار مسائل صعبة خاصة بها، لكنها عادة ما تفشل بطريقتين:

  1. تجعل الأمور تبدو صعبة ولكنها في الواقع "معطلة" (مثل لغز بقطع ناقصة).
  2. تتعثر لأن الذكاء الاصطناعي الذي يبتكر الأسئلة ليس ذكياً بما يكفي لابتكار شيء أصعب من نفسه.

CoDiQ هو إطار عمل جديد مصمم لحل هذه المشكلة. إنه يشبه "مصنع أسئلة فائق الذكاء" يمكنه تلقائياً إنتاج مكتبة ضخمة من مسائل الرياضيات والبرمجة بمستوى المسابقات، والتي تكون صعبة للغاية وفي نفس الوقت مضمونة القابلية للحل.


كيف يعمل CoDiQ: "قرص الصعوبة"

الفكرة الجوهرية لـ CoDiQ هي "توسيع نطاق وقت الاختبار" (Test-Time Scaling). فكر في هذا كأنه "قرص صعوبة" في لعبة فيديو.

عادةً، إذا طلبت من ذكاء اصطناعي "اجعل هذا أصعب"، فقد يكتفي بإضافة كلمات مربكة عشوائية. لكن CoDiQ يفعل شيئاً مختلفاً؛ فهو يستخدم عملية محددة حيث يتم تشجيع الذكاء الاصطناعي على استهلاك المزيد من "وقت التفكير" (قوة الحوسبة) لجعل السؤال أكثر صعوبة.

التشبيه: "ميزانية التفكير"
تخيل أن لديك ميزانية من "عملات التفكير" (مثل القطع النقدية).

  • ميزانية منخفضة: يكتب الذكاء الاصطناعي سؤالاً بسيطاً بسرعة.
  • ميزانية عالية: يُجبر الذكاء الاصطناعي على التفكير لفترة أطول، مما يضيف المزيد من طبقات المنطق، والقيود، والحيل.

لقد اكتشفت الورقة البحثية قاعدة رائعة: كلما أعطيت الذكاء الاصطناعي المزيد من "عملات التفكير" لإنفاقها، أصبحت الأسئلة أكثر صعوبة. ومع ذلك، هناك مقايضة؛ إذا دفعت بالميزانية عالياً جداً، فقد يرتبك الذكاء الاصطناعي لدرجة تجعله يبتكر سؤالاً معطلاً لا يمكن لأحد حله. مهمة CoDiQ هي إيجاد "النقطة المثالية" حيث يكون السؤال في أقصى درجات الصعوبة ولكنه لا يزال قابلاً للحل.


المكونات السحرية الثلاثة

لجعل هذا المصنع يعمل، بنى المؤلفون ثلاثة مكونات رئيسية:

1. "معززات الصعوبة" (الاستراتيجيات)

بدلاً من مجرد قول "اجعل هذا أصعب"، يتم إعطاء الذكاء الاصطناعي ست "وصفات" محددة لاتباعها. فكر في هذه كأدوات في مطبخ الشيف:

  • إضافة القيود: "يجب حل هذا باستخدام 3 خطوات فقط".
  • التجريد الرياضي: تحويل مسألة قصصية بسيطة إلى معادلة معقدة.
  • الهندسة العكسية: اطلب من الذكاء الاصطناعي إنشاء مسألة تكون الإجابة فيها معروفة، لكن الطريق للوصول إليها مخفي.
  • الحالات الحدية (Edge Cases): إجبار الذكاء الاصطناعي على مراعاة السيناريوهات الأكثر غرابة وعدم احتمال وقوعها.

تضمن هذه الاستراتيجيات أن تكون الأسئلة صعبة بسبب المنطق، وليس فقط بسبب كثرة الكلام.

2. "فريق مراقبة الجودة" (خط أنابيب التحقق)

هذا هو الجزء الأكثر أهمية. بينما يقوم الذكاء الاصطناعي بإنشاء سؤال أصعب، يقوم ذكاء اصطناعي ثانٍ ("المُحقّق") بالتحقق من شيئين فوراً:

  • هل تزداد الصعوبة؟ (هل رفعنا قرص الصعوبة فعلاً؟)
  • هل هي قابلة للحل؟ (هل لها إجابة صحيحة؟)

إذا حاول الذكاء الاصطناعي جعل السؤال صعباً لدرجة تجعله غير مفهوم، فإن فريق مراقبة الجودة يوقف العملية ويرمي ذلك السؤال بعيداً. هذا يمنع مشكلة "الصعوبة المزيفة".

3. "مدرب المكافآت" (التعلم التعزيزي)

قام المؤلفون بتدريب نموذج ذكاء اصطناعي محدد (CoDiQ-Generator) باستخدام "مدرب".

  • قاعدة المدرب: "إذا صنعت سؤالاً صعباً وقابلاً للحل، ستحصل على نجمة ذهبية. إذا صنعت سؤالاً معطلاً، ستحصل على بطاقة حمراء".
  • مع مرور الوقت، يتعلم الذكاء الاصطناعي بالضبط كيف يمشي على الحبل المشدود بين "الصعوبة البالغة" وبين "التعطل".

النتيجة: مجموعة بيانات CoDIQ-Corpus

باستخدام هذا النظام، بنى الفريق CoDIQ-Corpus، وهي مجموعة بيانات تضم 44,000 مسألة رياضيات وبرمجة رفيعة المستوى.

  • ما مدى صعوبتها؟ تدعي الورقة أنها أصعب بكثير من المعايير الشهيرة الموجودة حالياً مثل AIME (مسابقة رياضيات رفيعة المستوى) أو LiveCodeBench (مسابقة برمجة رفيعة المستوى).
  • هل هي حقيقية؟ قام خبراء بشريون بفحص عينة ووجدوا أن 82% من الأسئلة كانت قابلة للحل ومكتوبة بشكل جيد.

لماذا هذا مهم (وفقاً للورقة البحثية)

تثبت الورقة أنه إذا قمت بتدريب نماذج ذكاء اصطناعي أخرى على هذه المجموعة المحددة من الأسئلة "الصعبة المثالية"، فإن تلك النماذج تصبح أفضل بك much في التفكير المنطقي.

التشبيه النهائي:
تخيل أنك تدرب عداء ماراثون.

  • الطريقة القديمة: تجعله يركض على مضمار مسطح، أو ترميه في مستنقع عميق جداً لا يمكن عبوره (أسئلة معطلة).
  • طريقة CoDIQ: تبني له مسار عقبات مخصصاً يزداد صعوبة قليلاً كل يوم، ولكن مع وجود شبكة أمان تضمن عدم سقوطه في حفرة لا يستطيع تسلقها.
  • النتيجة: يصبح العداء (الذكاء الاصطناعي) بطلاً بشكل أسرع لأن تدريبه تمت معايرته بدقة لتناسب قوته المتنامية.

القيود المذكورة

المؤلفون صريحون بشأن الحدود:

  • النظام يعمل حالياً فقط للرياضيات والبرمجة باللغة الإنجليزية.
  • هناك "مفارقة المُحقّق": إذا صنع الذكاء الاصطناعي سؤالاً صعباً جداً لدرجة أن حتى الذكاء الاصطناعي الذي يفحص السؤال لا يستطيع حله، فقد يرمي النظام هذا السؤال بالخطأ ظناً منه أنه معطل. وهذا يضع سقفاً لمدى الصعوبة التي يمكن أن تصل إليها الأسئلة.

باخت-اختصار، CoDIQ هو طريقة جديدة لإنشاء "مسائل التدريب المثالية" للذكاء الاصطناعي، مما يسمح لهم بالتعلم بشكل أسرع وأذكى دون الحاجة إلى كتابة البشر لكل سؤال.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →