← أحدث الأبحاث
🤖 machine learning

On Adaptivity in Zeroth-Order Optimization

تُثبت هذه الورقة أن المحسنات التكيفية من الدرجة الصفرية القياسية مثل ZO-Adam لا تقدم أي ميزة تقارب مقارنة بـ ZO-SGD في عمليات الضبط الدقيق للنماذج اللغوية الكبيرة (LLM) ذات الذاكرة المحدودة بسبب غياب عدم التجانس في تدرج الإحداثيات في الأبعاد العالية، مما أدى إلى اقتراح MEAZO، وهو بديل فعال من حيث استهلاك الذاكرة يتتبع فقط قيمة عددية واحدة لتكيف حجم الخطوة العالمي مع مطابقة الأداء وتحسين المتانة.

المؤلفون الأصليون: Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser, Christos Louizos

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser, Christos Louizos

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "حول التكيف في التحسين من الدرجة صفر" (On Adaptability in Zeroth-Order Optimization) باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الصورة الكبيرة: ضبط راديو ضخم بدون دليل استخدام

تخيل أن لديك راديو ضخماً ومعقداً يحتوي على ملايين الأزرار (هذه هي "المعلمات" أو الـ parameters الخاصة بنموذج لغوي كبير، أو LLM). أنت تريد ضبط هذا الراديو ليعزف أغنية محددة بشكل مثالي (عملية الضبط الدقيق للنموذج أو Fine-tuning).

عادةً، لضبط الراديو، تحتاج إلى دليل استخدام يخبرك بالضبط أي اتجاه يجب أن تدير فيه كل زر وبأي مقدار. في عالم الذكاء الاصطناعي، يسمى هذا الدليل "التدرج" (Gradient). حساب هذا الدليل يتطلب الكثير من الذاكرة وقوة حوسبة هائلة، وهو أمر مكلف وبطيء.

التحسين من الدرجة صفر (Zeroth-Order Optimization - ZO) هو خدعة ذكية: بدلاً من قراءة الدليل، تقوم فقط بتحريك الأزرار عشوائياً، وتستمع للنتيجة، لترى ما إذا كانت الموسيقى قد تحسنت أم ساءت. تفعل ذلك عبر دفع الأزران للأمام والخلف لتخمين الاتجاه. هذه الطريقة أقل تكلفة بكثير من حيث الذاكرة، لكنها "صاخبة" (Noisy) لأنك تعتمد على التخمين.

المشكلة: البوصلة "المبالغ في هندستها"

لفترة طويلة، اعتقد الباحثون أنه نظرًا لأن لعبة التخمين هذه مليئة بالضجيج، فأنت بحاجة إلى بوصلة ذكية جداً وتستهلك الكثير من الذاكرة لمساعدتك. هذا ما تفعله المحسنات التكيفية (Adaptive Optimizers) (مثل ZO-Adam). فهي تحاول تذكر تاريخ كل زر على حدة لتقرر مدى سرعة تدويره. إنها تحتفظ بـ "سجل ذاكرة" منفصل لكل زر من ملايين الأزرار.

الاكتشاف الكبير للورقة البحثية:
وجد المؤلفون أنه في البيئات ذات الأبعاد العالية (مثل نماذج الذكاء الاصطعي العملاقة)، تكون هذه البوصلة الذكية للغاية عديمة الفائدة.

  • التشبيه: تخيل أنك في حقل ضبابي تحاول العثور على أسفل الوادي.
    • الدرجة الأولى (الذكاء الاصطناعي القياسي): لديك خريطة واضحة تظهر أن الأرض تنحدر بشدة نحو اليسكن ولكنها مسطحة جهة اليمين. أنت بحاجة إلى استراتيجية مختلفة لكل اتجاه.
    • الدرجة صفر (لعبة التخمين): لأنك تخمن عبر تحريك الأزرار عشوائياً في مساحة ضخمة وضبابية، فإن "الضجيج" الناتج عن تخمينك يكون عالياً جداً لدرجة أنه يطغى على التفاصيل الدقيقة للتضاريس. الإشارة تبدو متشابهة في كل الاتجاهات. الأمر يشبه وجود ضباب كثيف جداً يجعل الأرض تبدو مسطحة ومنتظمة تماماً في كل مكان.
  • النتيجة: بما أن "التضاريس" تبدو متشابهة في كل الاتجاهات، فإن الاحتفاظ بسجل ذاكرة منفصل لكل زر هو مضيعة للوقت والذاكرة. فالطرق "التكيفية" المتطورة (مثل ZO-Adam) لا تساعدك فعلياً على الوصول إلى أسفل الوادي بشكل أسرع من الطريقة البسيطة (ZO-SGD). في الواقع، هي تجعل حقيبة ظهرك أثقل فحسب.

الحل: MEAZO (البوصلة البسيطة)

بما أن البوصلة المتطورة غير ضرورية، فقد بنى المؤلفون أداة جديدة تسمى MEAZO.

  • كيف تعمل: بدلاً من تتبع ملايين السجلات الفردية لكل زر، يتتبع MEAZO رقماً واحداً فقط للمجموعة بأكملها. هو يسأل: "في المتوسط، ما مقدار التغيير الذي طرأ على الموسيقى عندما حركنا كل شيء؟"
  • الفائدة: إنه يحتفظ بالجزء "الذكي" من الطريقة التكيفية (وهو تعديل سرعة الحركة بناءً على مدى وعورة التضاريس) ولكنه يتخلص من الأعباء الثقيلة.
  • التشبيه: تخيل أنك تمارس رياضة المشي لمسافات طويلة.
    • ZO-Adam: تحمل جهاز GPS، ومقياس ضغط جوي، وبوصلة، وخريطة مفصلة لكل خطوة تخطوها. هذا ثقيل، ويجعلك تشعر بالتعب.
    • ZO-SGD: أنت تمشي للأمام فقط. أنت خفيف، ولكن إذا أصبح الطريق صخرياً، فقد تتعثر.
    • MEAZO: تحمل جهاز عد خطوات بسيط يخبرك بمتوسط مدى وعورة الطريق. إذا أصبح الطريق صخرياً، فإنك تبطئ سرعتك. وإذا كان الطريق ناعماً، فإنك تزيد سرعتك. أنت لا تحتاج إلى خريطة لكل صخرة؛ بل تحتاج فقط لمعرفة "جو" المسار العام.

ما أظهرته التجارب

اختبر الفريق هذه الطريقة على نماذج لغوية كبيرة حقيقية (مثل Llama و Qwen) وعلى مسائل رياضية اصطناعية.

  1. الأداء: عندما يتم ضبط الإعدادات بشكل صحيح، أدت الطريقة البسيطة (ZO-SGD) بشكل جيد تماماً مثل الطريقة المتطورة (ZO-Adam).
  2. الذاكرة: استخدم MEAZO نفس كمية الذالة الصغيرة التي تستخدمها الطريقة البسيطة، بينما استخدمت الطريقة المتطرفة ذاكرة أكبر بكثير.
  3. المتانة (شبكة الأمان): هذا هو الاكتشاف الأكثر أهمية. بينما تعمل الطريقة البسيطة بشكل رائع إذا اخترت سرعة المشي "المثالية"، إلا أنها تنهار إذا اخترت سرعة سريعة جداً أو بطيئة جداً. الطرق المتطورة (وMEAZO) أكثر تسامحاً. إذا اخترت سرعة "سيئة"، فإن MEAZO سيظل يوصلك إلى وجهتك دون أن يصطدم. الأمر يشبه سيارة مزودة بنظام مثبت السرعة (Cruise Control) يعدل نفسه تلقائياً مع التلال، بينما السيارة البسيطة تستمر في السير بسرعة ثابتة وقد تصطدم بعقبة.

الملخص

  • الأسطورة: "نحن بحاجة إلى أدوات تكيفية معقدة وثقيلة الذاكرة لجعل تدريب الذكاء الاصطنا_من الدرجة صفر يعمل بشكل جيد".
  • الواقع: في نماذج الذكاء الاصطناعي عالية الأبعاد، يجعل الضجيج التضاريس تبدو موحدة، لذا فإن الأدوات المعقدة هي مجرد هدر للذاكرة.
  • الحل: MEAZO هو أداة جديدة تتتبع رقماً واحداً عالمياً بدلاً من ملايين الأرقام. إنه يستخدم ذاكرة قليلة جداً (مثل الطريقة البسيطة) ولكنه أكثر استقراراً وتسامحاً مع الإعدادات (مثل الطريقة المعقدة).

يسمح هذا للباحثين بضبط النماذج اللغوية الضخمة على أجهزة ذات ذاكرة محدودة (مثل الأجهزة الطرفية/Edge Devices) دون الحاجة إلى حواسيب فائقة، مع الحصول في الوقت نفسه على نتائج مستقرة وعالية الجودة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →