Large Language Model Selection with Limited Annotations
تقدم الورقة البحثية SELECT-LLM، وهو إطار عمل مبتكر يستفيد من كسب المعلومات المتوقع المستمد من تشابه مخرجات النماذج الثنائية للاختيار النشط لمجموعة دنيا من الاستعلامات لغرض التوسيم، مما يقلل تكاليف التقييم بشكل كبير مع تحديد أفضل نموذج لغوي كبير لمهمة معينة بفعالية دون الحاجة إلى الوصول إلى أوزان النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك مدير توظيف يحاول العثور على الموظف المثالي لوظيفة محددة للغاية. لديك مجموعة ضخمة من 156 مرشحاً (هذه هي النماذج اللغوية الكبيرة، أو LLMs). أنت تعلم أنهم جميعاً أذكياء، لكنك لا تعرف أيهم الأفضل فعلياً لمهمتك الخاصة.
عادةً، لمعرفة ذلك، ستقوم بطلب إجراء اختبار كامل مكون من 100 سؤال من كل مرشح، ثم تستأجر فريقاً من الخبراء البشر المكلفين لتصحيح كل إجابة. هذا الأمر بطيء، ومكلف، ومرهق.
يقدم البحث طريقة جديدة تسمى SELECT-LLM. فكر في SELECT-LLM كمساعد توظيف فائق الذكاء يمكنه العثور على أفضل مرشح من خلال الطلب منه خوض جزء ضئيل جداً من الاختبار فقط—ربما 5 أو 10 أسئلة بدلاً من 100.
إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:
المشكلة: "اختبار التذوق الأعمى"
تخيل أن لديك 156 طباخاً مختلفاً (النماذج الذكية) وتريد العثور على من يصنع أفضل بيتزا.
- الطريقة القديمة: تطلب من كل طباخ طهي 100 بيتزا. ثم تستأجر 100 ناقد طعام لتذوق كل بيتزا وكتابة تقرير عنها. هذا يكلف ثروة من الوقت والمال.
- الطريقة العشوائية: تطلب من الطباخين طهي 5 بيتزا فقط، ولكنك تختار هذه الأسئلة الخمسة عشوائياً. ربد أن جميع الطباخين الخمسة بارعون في صنع بيتزا الجبن ولكنهم سيئون جداً في صنع بيتزا الببروني. قد تختار الفائز الخاطئ لمجرد سوء الحظ.
الحل: SELECT-LLM ("الاختبار الذكي")
إن SELECT-LLM يشبه المحقق الذي يعرف بالضبط أي الأسئلة ستكشف الحقيقة. هو لا يختار الأسئلة عشوائياً؛ بل يختار الأسئلة الأكثر إفادة.
إليك العملية خطوة بخوة:
- الإعداد: لديك "مخزن" من الأسئلة المحتملة (بنك الأسئلة) وقائمة بالنماذج المرشحة.
- لعبة التخمين: ينظر النظام إلى ما قد يقوله جميع النماذج إذا أجابوا على سؤال ما (دون الحاجة إلى تصحيحه من قبل إنسان بعد).
- كاشف "الاختلاف": يسأل النظام نفسه: "إذا طرحت هذا السؤال، هل ستعطي أفضل المرشحين إجابات مختلفة تماماً؟"
- إذا أعطى أفضل الطهاة نفس الإجابة تماماً، فإن السؤال ليس مفيداً جداً للتمييز بينهم.
- إذا أعطى أفضل الطهاة إجابات مختلفة تماماً، فهذا السؤال هو كنز. إنه السؤال الذي سيساعدك في معرفة من هو الأفضل حقاً.
- الاختيار: يختار النظام هذا السؤال "الكنز" ويطلب من خبير بشري (الـ Oracle) تقييم تلك الإجابة الواحدة فقط.
- التحديث: بناءً على تلك الدرجة الواحدة، يقوم النظام بتحديث ترتيب الطهاة. قد يقول: "أوه، الطباخ (أ) أجاب بشكل صحيح، لكن الطباخ (ب) أخطأ. الطباخ (أ) الآن أكثر احتمالاً لأن يكون هو الفائز".
- التكرار: يكرر هذه العملية، باختيار السؤال التالي الذي سيؤدي إلى أكبر قدر من "الاختلاف" بين أفضل المتنافسين المتبقين، حتى يصبح واثقاً بما يكفي لاختيار الفائز.
لماذا يعد هذا أمراً هاماً؟
اختبرت الورقة البحثية هذه الطريقة على 23 نوعاً مختلفاً من المهام (مثل الرياضيات، تلخيص الأخبار، ترجمة اللغات، والإجابة على الأسئلة العلمية) وعلى 156 نموذج ذكاء اصطناعي مختلفاً.
- النتيجة: وجدت SELECT-LLM أفضل نموذج باستخدام عدد أقل بنسبة تصل إلى 84% من درجات البشر مقارنة بالطريقة التالية الأفضل.
- التشبيه: بدلاً من استئجار 100 ناقد لتذوق 100 بيتزا، قد تحتاج هذه الطريقة إلى 15 ناقداً فقط لتذوق 15 بيتزا للعثور على نفس الفائز تماماً.
الميزات الرئيسية
- صديق لـ "الصندوق الأسود" (Black-Box): لست بحاجة لمعرفة كيفية بناء نماذج الذكاء الاصطناعي من الداخل (مثل الكود الخاص بها أو أوزانها). أنت فقط بحاجة لرؤية ما تقول. وهذا يعمل مع كل من النماذج مفتوحة المصدر والنماذج التجارية المغلقة والمكلفة (مثل تلك التي تدفع مقابلها عبر واجهة برمجة التطبيقات API).
- مستقل عن النموذج (Model-Agnostic): لا يهتم إذا كانت النماذج كبيرة أو صغيرة، أو ما هي اللغة التي يتحدثونها. هو فقط ينظر إلى تشابه إجاباتهم.
- آمن: حتى لو لم يختر النموذج رقم 1 مطلقاً، فإنه غالباً ما يختار نموذجاً قريباً جداً من الأفضل، لذا لن تنتهي بنتيجة سيئة.
باختصار
إن SELECT-LLM هو استراتيجية ذكية لإيقاف هدر الأموال في الاختبارات غير الضرورية. فبدلاً من مطالبة كل ذكاء اصطناعي بخوض امتحان كامل وترك البشر يصححون كل شيء، فإنه يطرح فقط الأسئلة الصحيحة القليلة لتحديد النموذج النجم بسرعة وكفاءة. إنه يحول عملية بحث ضخمة ومكلفة إلى رحلة صيد سريعة وفعالة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.