← أحدث الأبحاث
📊 statistics

DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks

تقدم الورقة البحثية DUET، وهي خوارزمية جديدة من المستوى العالمي إلى المحلي تجمع بين دوال التأثير والتحسين البايزي لتحسين مجموعات بيانات تدريب النماذج اللغوية الكبيرة (LLMs) نظرياً وتجريبياً لمهام تقييم غير مرئية باستخدام التغذية الراجعة فقط، دون الحاجة إلى معرفة مسبقة ببيانات المهمة.

المؤلفون الأصليون: Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

نُشر 2026-05-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "DUET: تحسين خلطات بيانات تدريب النماذج اللغوية الكبيرة عبر التغذية الراجعة المشوشة من مهام تقييم غير مرئية"، باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: الطبخ في الظلام

تخيل أنك طاهٍ (مطور الذكاء الاصطناي) تحاول إعداد الحساء المثالي (النموذج اللغوي الكبير، أو LLM). لديك مخزن مليء بمكونات مختلفة: مقالات ويكيبيديا، كتب رياضيات مدرسية، مجلات طبية، وأسئلة عامة.

عادةً، لصنع أفضل حساء، تحتاج إلى معرفة ما يريده زبائنك بالضبط. إذا كانوا يحبون الطعام الحار، فأنت تضيف المزيد من الفلفل. إذا أرادوا شيئاً صحياً، فأنت تضيف المزيد من الخضروات.

لكن هنا تكمكم المشكلة: في العالم الحقيقي، غالباً لا تعرف ما يريده زبائنك قبل أن تقدم لهم الطعام.

  • ربما يتحدث زبائنك مع الذكاء الاصطنا الخاص بك في غرفة خاصة ومشفرة. لا يمكنك رؤية ما يقولونه ("مهمة التقييم غير المرئية").
  • تحصل فقط على تغذية راجعة مشوشة وغير دقيقة بعد تناولهم الطعام: تقييم بالنجوم، أو إعجاب/عدم إعجاب، أو مدى بقائهم في الدردشة. لا تحصل على نقد مفصل للوصفة؛ بل تحصل فقط على تعليق غامض مثل "كان جيداً" أو "كان رائعاً".

تسأل الورقة البحثية: كيف تحدد المزيج المثالي من المكونات (بيانات التدريب) عندما لا يمكنك رؤية أطباق الزبائن، بل تحصل فقط على تقييماتهم الغامضة؟

الطريقة القديمة: التخمين والتحقق

سابقاً، كانت الطرق المستخدمة لإصلاح هذا الأمر تشبه محاولة إيجاد أفضل وصفة للحساء عن طريق:

  1. التخمين الأعمى: تجربة كل التركيبات الممكنة من المكونات (أمر مكلف وبطيء للغاية).
  2. افتراض أنك تعرف الزبائن: استخدام رياضيات معقدة تتطلب منك رؤية طلبات الزبائن الفعلية (وهو ما لا يمكنك فعله بسبب الخصوصية).
  3. اختيار مكونات "جيدة" عشوائياً: اختيار نقاط بيانات عالية الجودة دون معرفة ما إذا كانت تناسب ذوق الزبون المحدد.

فشلت هذه الطرق في هذا السيناريو "الأعمى" تحديداً لأنها كانت تتطلب معلومات أكثر مما يُسمح للطاهي بالحصول عليه.

الحل: DUET (حلقة التذوق الذكية)

يقدم المؤلفون DUET، وهي طريقة جديدة تعمل كـ حلقة تذوق ذكية ومتكررة. وهي تجمع بين تقنيتين قويتين:

1. المتذوق "العالمي" (التحسين البايزي - Bayesian Optimization)

فكر في هذا كأنه بوصلة ذكية. بدلاً من التخمين العشوائي، تنظر البوصلة إلى تقييماتك السابقة (التغذية الراجعة) وتقول: "مهلاً، في المرة الأخيرة التي أضفنا فيها المزيد من كتب الرياضيات، ارتفع التقييم. لنحاول إضافة المزيد من الرياضيات وتقليل Trivia (المعلومات العامة)".

  • هي لا تعرف الوصفة الدقيقة، لكنها تتعلم الاتجاه الذي يجب التحرك نحوه بناءً على التغذية الراجعة المشوشة (تقييمات النجوم).
  • هي تقوم بتحديث خريطتها لـ "ما الذي ينجح" باستمرار بناءً على حلقة التغذية الراجعة.

2. سكين الشيف "المحلية" (اختيار البيانات - Data Selection)

بمجرد أن تقول البوصلة: "لنحاول استخدام 60% رياضيات و40% علوم"، لا تزال بحاجة إلى اختيار صفحات الرياضيات والعلوم المحددة لاستخدامها. فأنت لا تريد استخدام صفحات تحتوي على أخطاء مطبعية أو محتوى ممل.

  • يستخدم DUET تقنية تسمى دوال التأثير (Influence Functions - IF). تخيل هذا كأنه فلتر للجودة.
  • قبل أن تبدأ الطبخ حتى، يقوم الفلتر بمسح مخزن الرياضيات والعلوم لديك ويحدد الصفحات "الأفضل" (التي تساعد النموذج على التعلم أكثر) والصفحات "الأسوأ" (الضوضاء أو الهراء).
  • عندما تخبرك البوصلة باستخدام 60% من الرياضيات، يقوم السكين باقتطاع أفضل 60% من صفحات الرياضيات، متجاهلاً المحتوى الرديء.

كيف يعمل DUET معاً

DUET هو خوارزمية من العالمي إلى المحلي (Global-to-Local). وهي تعمل في دورة:

  1. الخطوة العالمية: "البوصلة الذكية" (التحسين البايزي) تنظر إلى التغذية الراجعة من الجولة السابقة وتقترح نسبة جديدة للمكونات (مثلاً: "جرب 50% ويكيبيديا، 50% أخبار").
  2. الخطوة المحلية: "فلتر الجودة" (اختيار البيانات) يأخذ أفضل الصفحات المطلقة من ويكيبيديا والأخبار لتناسب تلك النسبة.
  3. الطبخ: يتم تدريب الذكاء الاصطناعي على هذا المزيج الجديد عالي الجودة.
  4. التغذية الراجعة: يتم نشر الذكاء الاصطناعي. يتفاعل المستخدمون معه (في الظلام/بشكل مشفر). يجمع النظام التقييمات المشوشة.
  5. التكرار: تستخدم البوصلة تلك التقييمات الجديدة لاقتراح نسبة أفضل للجولة التالية.

لماذا هو مميز؟

  • يعمل في الظلام: لا يحتاج لرؤية محادثات المستخدمين الفعلية. يحتاج فقط إلى "تقييمات النجوم".
  • يتعامل مع الضجيج: تقييمات المستخدمين غالباً ما تكون غير متسقة (شخص يعطي 5 نجوم، وآخر يعطي 3 نجوم لنفس الإجابة). تم تصميم DUET لتجاهل الضجيج وإيجاد الإشارة الحقيقية.
  • فعال: بدلاً من تجربة كل الوصفات، فإنه يضيق النطاق بسرعة للوصول إلى الأفضل.

النتائج

اختبر المؤلفون DUET في مهام متنوعة، بما في ذلك:

  • داخل النطاق (In-Domain): المهام التي تتطابق فيها بيانات التدريب مع الاختبار (مثل التدريب على TruthfulQA والاختبار على TruthfulQA).
  • خارج النطاق (Out-of-Domain): المهام التي تختلف فيها بيانات التدريب عن الاختبار (مثل التدريب على ويكيبيديا والرياضيات، ولكن الاختبار على أسئلة طبية).

النتيجة: حتى عندما كانت مهمة الاختبار مختلفة تماماً عن بيانات التدريب (خارج النطاق)، اكتشف DUET أن دمج بعض البيانات "غير المرتبطة" (مثل نصوص ويكيبيديا العامة) ساعد في الواقع الذكاء الاصطناعي على الإجابة على الأسئلة الطبية بشكل أفضل. لقد تفوق على جميع الطرق الأخرى التي حاولت خلط البيانات بدون حلقة التغذية الراجعة هذه.

الخلاصة

DUET يشبه طاهياً لا يستطيع رؤية الزبائن، لكنه يستطيع سماع تصفيقهم. من خلال الاستماع إلى التصفيق واستخدام فلتر ذكي لاختيار أفضل المكونات، يمكن للطاهي في النهاية طبخ الحساء المثالي، حتى دون أن يرى قائمة الطعام أبداً.

ملاحظة حول القيود: تركز الورقة البحثية تحديداً على الضبط الدقيق (Fine-tuning) (تعليم ذكاء اصطناعي موجود مهارات جديدة) ولا تدعي أن هذه الطريقة تعمل في مرحلة "التدريب المسبق" (Pre-training) (تعليم ذكاء اصطناعي من الصفر) أو للاستخدامات الطبية السريرية، رغم أن المؤلفين يشيرون إلى أنه يمكن تكييفها للتدريب المسبق في المستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →