← أحدث الأبحاث
🤖 AI

Free Lunch for Pass@kk? Low Cost Diverse Sampling for Diffusion Language Models

تقترح هذه الورقة تدخلاً منخفض التكلفة ولا يتطلب تدريباً لنماذج اللغات الانتشارية (Diffusion Language Models)، يقوم بتنفير العينات الوسيطة في الدفعة بشكل متسلسل لتعزيز التنوع التوليدي وتحسين أداء Pass@kk في مهام الاستدلال دون عبء حسابي كبير.

المؤلفون الأصليون: Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

نُشر 2026-03-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز صعب للغاية، مثل كتابة كود برمجي يعمل أو حل مسألة رياضية معقدة. تطلب من الذكاء الاصطناعي المساعدة.

إذا سألت الذكاء الاصطناعي مرة واحدة، فسيمنحك إجابة واحدة. ولكن ماذا لو كانت تلك الإجابة خاطئة؟ في عالم الذكاء الاصطناعي، غالبًا ما نطلب منه المحاولة مرات عديدة في آن واحد (على سبيل المثال 16 مرة) لمعرفة ما إذا كانت أي من تلك المحاولات ستصل إلى الحل الصحيح. وهذا ما يسمى Pass@k (النجاح عند k من المحاولات).

المشكلة هي أن نماذج الذكاء الاصطناعي الحالية تشبه طالبًا عنيدًا، فعندما يُطلب منه المحاولة 16 مرة، يكتب نفس الإجابة الخاطئة 16 مرة، ولكن بخط يد مختلف قليلاً فقط. إنه يعلق في "حلقة مفرغة" من الفشل. وهذا ما يسمى انهيار النمط (mode collapse).

تقدم هذه الورقة البحثية حيلة ذكية ومجانية تسمى ODD (الانتشار المتنوع المتعامد - Orthogonal Diverse Diffusion) لإصلاح ذلك. إليك كيف تعمل، مشروحة بتشبيهات بسيطة:

1. المشكلة: "غرفة الصدى"

تخيل أنك في غرفة بها 16 شخصًا (عينات الذكاء الاصطناعي) يحاولون إيجاد المخرج.

  • الطريقة القديمة (العينات القياسية): الجميع يستمع إلى نفس المحطة الإذاعية. جميعهم يسمعون نفس الاتجاه الخاطئ. على الرغم من وجود 16 شخصًا، إلا أنهم جميعًا يصطدمون بنفس الجدار. لديك 16 شخصًا، ولكن لديك فكرة فريدة واحدة فقط. هذا هدر للطاقة.

2. الحل: "حقل التنافر"

يقترح المؤلفون قاعدة جديدة للعبة. فبينما يقوم الذكاء الاصطناعي بإنشاء هذه المحاولات الـ 16، فإنه لا يعاملها كأحداث منفصلة ومعزولة، بل يعاملها كفريق يحتاج إلى التوسع والانتشار.

  • التشبيه: تخيل أن الشخص الأول يبدأ بالسير في ممر. يُقال للشخص الثاني: "لا تسير حيث يسير الشخص الأول؛ اذهب إلى اليسار". ويُقال للشخص الثالث: "لا تسير حيث يسلك الأول أو الثاني؛ ابحث عن مسار جديد".
  • السحر: يستخدم الذكاء الاصطناعي "قوة تنافر" رياضية. بينما يقوم بإنشاء الإجابة الثانية والثالثة والرابعة، فإنه يعمل بنشاط على دفعها بعيدًا عن سمات الإجابات السابقة. إنه يجبرها على استكشاف زوايا مختلفة من مساحة الحل.

3. كيف يعمل (الغداء المجاني)

الجزء الأروع في هذه الورقة هو أنها لا تتطلب إعادة تدريب.

  • التشبيه: تخيل أنك تخبز كعكة (النموذج الذكي). عادةً، لجعل طعم الكعكة مختلفًا، عليك تغيير الوصفة أو خبز دفعة جديدة بالكامل من البداية (إعادة التدريب).
  • حيلة ODD: بدلًا من تغيير الوصفة، يقوم الخباز بإعادة ترتيب المكونات أثناء خلط الكعكة. يأخذ العجين الذي يشبه الكعكة الأولى ويدفعه بلطف في اتجاه مختلف قبل أن يتماسك.
  • النتيجة: تحصل على 16 كعكة (حلول) متميزة من نفس العجين، دون وقت أو تكلفة إضافية تقريبًا.

4. لماذا هذا مهم؟

  • بالنسبة للرياضيات والبرمجة: في هذه المجالات، غالبًا ما تكون الإجابة "الصحيحة" نادرة. إذا استمر الذكاء الاصطناعي في تخمين الشيء الخاطئ نفسه، فلن يصل أبدًا إلى الإجابة الصحيحة. من خلال إجبار الذكاء الاصطناعي على تجربة 16 نهجًا مختلفًا، فإن فرص الحصول على "التذكرة الذهبية" (الحل الصحيح) ترتفع بشكل هائل.
  • المقايضة: أحيانًا، قد يؤدي إجبار الذكاء الاصطناعي على أن يكون مختلفًا إلى جعل الإجابة الفردية أسوأ قليلاً (لأنه يجرب مسارًا محفوفًا بالمخاطر). ولكن، تصبح مجموعة الـ 16 إجابة أكثر احتمالاً لاحتواء حل واحد مثالي على الأقل.

الملخص

فكر في ODD كـ "مدرب تنوع" للذكاء الاصطناعي.

  • قبل: كان الذكاء الاصطناعي عبارة عن جوقة موسيقية حيث يغني الجميع نفس النوتة، حتى لو كانت خارج اللحن.
  • بعد: تهمس المدربة لكل مغني: "أنت، جرب نوتة عالية. أنت، جرب نوتة منخفضة. أنت، جرب إيقاعًا مختلفًا".
  • النتيجة: حتى لو كانت الجوقة تغني أغنية صعبة، فإن احتمال أن يصيب شخص ما النوتة المثالية أكبر بكثير، وهم يفعلون ذلك دون الحاجة إلى استئجار مغنين جدد أو شراء آلات موسيقية جديدة.

تثبت الورقة البحثية أن هذا يعمل على المسائل الرياضية الصعبة (GSM8K) وتحديات البرمجة (HumanEval)، مما يظهر أنه مع هذه التعديلات البسيطة ومنخفضة التكلفة، يمكن للذكاء الاصطناعي حل مشكلات لم يكن قادرًا على حلها سابقًا، ببساطة من خلال كونه أكثر إبداعًا وأقل تكرارًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →