← أحدث الأبحاث
💬 NLP

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning

تقدم الورقة البحثية "المستنتج المتوازي الأصلي" (NPR)، وهو إطار عمل خالٍ من المعلم يُمكّن النماذج اللغوية الكبيرة من تطوير قدرات استنتاج متوازية حقيقية ذاتياً من خلال التدريب التقدمي المستخلص ذاتياً، وتحسين السياسة المدرك للتوازي، ومحرك تنفيذ مُعاد هيكلته، محققاً مكاسب كبيرة في الأداء وتسريعات في الاستنتاج تصل إلى 4.6 ضعف دون العودة إلى فك التشفير التوليدي المتسلسل.

المؤلفون الأصليون: Tong Wu, Yang Liu, Jun Bai, Zixia Jia, Shuyi Zhang, Ziyong Lin, Yanting Wang, Song-Chun Zhu, Zilong Zheng

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tong Wu, Yang Liu, Jun Bai, Zixia Jia, Shuyi Zhang, Ziyong Lin, Yanting Wang, Song-Chun Zhu, Zilong Zheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً ولكنه تقليدي للغاية. هذا الطالب بارع في حل المشكلات، لكنه يفعل ذلك خطوة بخطوة، مثل قراءة كتاب من اليسار إلى اليمين. لا يتخطى أبداً، ولا يحاول تجربة حلين مختلفين في وقت واحد. هذه هي الطريقة التي تعمل بها معظم نماذج الذكاء الاصطناعي الحالية: إنها تفكر في خط مستقيم.

تقدم الورقة البحثية نظاماً جديداً يسمى المُستنتج المتوازي الأصيل (Native Parallel Reasoner - NPR). فكر في NPR ليس كطالب يقرأ كتاباً، بل كـ فريق من المحققين يعملون في غرفة واحدة. بدلاً من انتظار المحقق (أ) لينهي دليله قبل أن يبدأ المحقق (ب)، يعمل الجميع على أجزاء مختلفة من اللغز في وقت واحد، ثم يجتمعون معاً لحل القضية.

إليك كيف تشرح الورقة كيف علموا هذا "الفريق" العمل معاً، باستخدام ثلاث خطوات:

1. مشكلة الذكاء الاصطناعي الحالي

يقول المؤلفون إن لدى الذكاء الاصطناعي الحالي ثلاث مشكلات كبيرة عند محاولة التفكير بشكل متوازٍ:

  • الأدوات الخاطئة: محركات البرمجيات المستخدمة لتشغيل الذكاء الاصطناعي مبنية للخطوط المستقيمة. محاولة إجبارها على التفرع تشبه محاولة قيادة سيارة على قضبان قطار؛ فهي ستتعطل أو تعلق.
  • الجهد الضائع: كانت المحاولات الأولى للتفكير المتوازي غير متقنة. كان الأمر يشبه طلب حل مسألة رياضية من خمسة أشخاص، ولكن بدلاً من مشاركة أوراق المسودة الخاصة بهم، اضطر كل منهم لإعادة كتابة المسألة بالكامل من البداية. هذا جعلهم أبطأ وليس أسرع.
  • فخ "المعلم": اعتمدت الأساليب السابقة على "معلم" ذكاء اصطناعي فائق الذكاء ليري الطالب كيفية التفكير بشكل متوازٍ. لكن الطالب اكتفى بنسخ تفكير المعلم الخطي وحاول حشره في قالب متوازٍ. كان الأمر يشبه طلب الجري في ماراثون من شخص لا يعرف سوى المشي عبر إخباره بـ "امشِ بشكل أسرع". لم يستطع ابتكار طريقة جديدة للحركة.

2. الحل: معسكر تدريبي من ثلاث مراحل

يعلم نظام NPR الذكاء الاصطناعي كيف يصبح مفكراً متوازياً حقيقياً دون الحاجة إلى معلم. هم يستخدمون نهج "التقطير الذاتي"، مما يعني أن الذكاء الاصطعي يعلم نفسه بنفسه.

  • المرحلة 1: تعلم القواعد (مرحلة "التنسيق")
    تخيل أن الذكاء الاصطناعي فنان فوضوي. في هذه المرحلة، يعطيه الباحثون نظام مكافآت: "إذا رسمت لوحتك في شبكة محددة ومنظمة، ستحصل على نجمة ذهبية. إذا خربشت عشوائياً، فستحصل على عقوبة". الذكاء الاصطناعي لا يعرف كيف يحل المشكلة بعد؛ هو فقط يتعلم تنظيم أفكاره في تنسيق "خريطة-عملية-اختزال" (تخطيط -> تنفيذ -> تلخيص). إنه يتعلم شكل التفكير المتوازي.

  • المرحلة 2: الإحماء (مرحلة "الممارسة")
    الآن بعد أن عرف الذكاء الاصطناعي القواعد، يبدأ في الممارسة. يسمح الباحثون للذكاء الاصطناعي بتوليد آلاف الإجابات، لكنهم يستبعدون الإجابات السيئة (التي تكون خاطئة أو لا تتبع القواعد). يحتفظون فقط بالإجابات المثالية والمنظمة ويستخدمونها لـ "ضبط دقيق" للذكاء الاصطناعي. هذا يشبه مدرباً يظهر للفريق أفضل اللعب من حصة التدريب حتى يتمكنوا من حفظ التشكيل المثالي.

  • المرحلة 3: اللعبة الحقيقية (مرحلة "التعزيز")
    هذه هي القفزة الكبيرة. يتم وضع الذكاء الاصطناعي الآن في لعبة حقيقية حيث يتعين عليه حل مشكلات صعبة. يجرب استراتيجيات متوازية مختلفة. إذا وجد حلاً بسرعة، يحصل على مكافأة. إذا تعثر، يتعلم تجربة مسار مختلف. والأهم من ذلك، قام الباحثون ببناء "محرك NPR" خاص (نوع جديد من البرمجيات) يعمل كحكم. يضمن هذا المحرك عدم غش الذكاء الاصطناعي عبر العودة إلى التفكير "واحد تلو الآخر"، ويدير الذاكرة حتى لا ينفد من المساحة.

3. النتائج: أسرع وأذكى

اختبرت الورقة هذا "الفريق من المحققين" في ثمانية أنواع مختلفة من اختبارات الاستنتاج الصعبة (مثل مسابقات الرياضيات وألغاز المنطق).

  • التوازي الحقيقي: على عكس النماذج الأخرى التي تتظاهر أحياناً بالتوازي بينما هي في الواقع تفكر في خط مستقيم (خدعة)، قام NPR بـ تفكير متوازٍ حقيقي بنسبة 100%. لم يغش أبداً.
  • السرعة: لأن التفكير كان متوازياً بالفعل، كان أسرع بكثير. في المشكلات الأكثر صعوبة، كان أسرع بـ 4.6 مرة من النماذج الخطية القديمة. إنه يشبه الفرق بين شخص واحد يمشي نحو وجهة ما وبين قافلة من السيارات تسير إلى هناك في نفس الوقت.
  • الدقة: حل مشكلات صحيحة أكثر من النماذج التي دربها معلمون بشريون أو طرق متوازية أخرى.

الخلاصة الكبرى

تدعي الورقة أنه من خلال ترك الذكاء الاصطناعي يعلم نفسه كيفية تقسيم انتباهه والعمل على مسارات متعددة في وقت واحد، يمكننا إنشاء ذكاء اصطناعي ليس فقط أكثر ذكاءً في حل الألغاز المعقدة، بل أيضاً أسرع بشكل ملحوظ. هم لم يكتفوا بإجبار الذكاء الاصطناعي على الظهور بمظهر المتوازي؛ بل ساعدوه على تطوير قدرة أصيلة على التفكير المتوازي، كعضلة تم تمرينها أخيراً بشكل صحيح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →