LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints
تقدم هذه الورقة RealInstruct، وهو معيار لتقييم النماذج اللغوية الكبيرة على التعليمات الواقعية متعددة القيود، وتقترح DeCRIM، وهو مسار تصحيح ذاتي يُمكّن النماذج مفتوحة المصدر من التفوق على GPT-4 من خلال تفكيك التعليمات، ونقد الاستجابات، وتحسين المخرجات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: التصحيح الذاتي للنماذج اللغوية الكبيرة (LLM) باستخدام DECRIM
بيان المشكلة
بينما أظهرت النماذج اللغوية الكبيرة (LLMs) قدرات مثيرة للإعجاب في اتباع التعليمات، تشير الدراسات الحديثة إلى أنها تواجه صعوبة كبيرة في التعامل مع التعليمات التي تحتوي على قيود متعددة ومتزامنة (مثل: نبرة محددة، طول معين، وقيود سلبية مثل "لا تستخدم الوسوم/hashtags"). تعتمد المعايير المرجعية الحالية لتقييم هذه القدرة بشكل كبير على البيانات الاصطناعية، والتي قد تفشل في استيعاب التعقيد واللمسات الدقيقة والصعوبة المصطنعة لطلبات المستخدمين في العالم الحقيقي. علاوة على ذلك، غالبًا ما تفترض أساليب التصحيح الذاتي الحالية استقلالية القيود أو تركز على أنواع محددة من القيود، مما يحد من قابليتها للتطبيق في السيناريوهات مفتوحة النهايات ومتعددة القيود. كما توجد فجوة في طرق التقييم الموثوقة وفعالة التكلفة لهذه التعليمات المعقدة، حيث يكون التقييم القائم على القواعد غير ممكن غالبًا للمهام مفتوحة النهايات.
المنهجية
1. معيار REALINSTRUCT
لمعالجة الاعتماد على البيانات الاصطناعية، قدم المؤلفون REALINSTRUCT، وهو أول معيار مرجعي مصمم لتقييم النماذج اللغوية الكبيرة بناءً على تعليمات حقيقية متعددة القيود.
- مصدر البيانات: مستمدة من استفسارات المستخدمين الحقيقية للمساعدين الذكيين (من مصدر ShareGPT)، وتمت تصفيتها للاحتفاظ فقط بالتعليمات الإنجليزية التي تحتوي على قيود.
- الهيكل: يتم تفكيك كل تعليمات إلى مهمة (الهدف الرئيسي)، سياق، وقائمة من القيود التفصيلية.
- النطاق: تحتوي مجموعة الاختبار على 302 تعليمات بـ 1,055 قيدًا؛ وتحتوي مجموعة التحقق على 842 تعليمات بـ 2,500 قيد.
- بروتوكول التقييم: نظرًا للطبيعة مفتوحة النهايات للبيانات، يستخدم المعيار نهج "النموذج اللغوي كحكم" (LLM-as-a-Judge). يتم تقييم القيود بشكل فردي، وتُجمع النتائج في مقياس دقة على مستوى التعليمات.
2. التحقق عبر "النموذج اللغوي كحكم" (LLM-as-a-Judge)
بحث المؤلفون في موثوقية استخدام النماذج اللغوية الكبيرة لتقييم مدى الالتزام بالقيود، من خلال مقارنة النماذج المملوكة (GPT-4، GPT-4-Turbo، GPT-3.5-Turbo) والنماذج مفتوحة المصدر (Mistral، Vicuna، Zephyr) مقابل التدوينات البشرية.
- مجموعة بيانات EvalJudge: مجموعة اختبار تضم 1,000 ثلاثية (تعليمات-قيد-استجابة) مع تسميات الحقيقة الأرضية (ground truth) التي تم التحقق منها بشريًا.
- الاستراتيجيات: تم اختبار استراتيجيات تكييف متنوعة، بما في ذلك التعلم في السياق (ICL) مع التلقين بسلسلة الأفكاء (CoT)، والضبط الدقيق الخاضع للإشراف الضعيف للنماذج مفتوحة المصدر.
- النتيجة: برز نموذج GPT-4-Turbo مع التلقين بسلسلة الأفكار (CoT) كأكثر المقيمين فعالية من حيث التكلفة وموثوقية، حيث تفوق بشكل كبير على النماذج مفتوحة المصدر في اكتشاف القيود غير المستوفاة.
3. مسار DECRIM (التفكيك، النقد، والتنقيح)
لسد الفجوة في الأداء بين النماذج مفتوحة المصدر والمملوكة، اقترح المؤلفون مسار DECRIM، وهو مسار تصحيح ذاتي يعتمد على نهج "النظام 2" (System 2). يعمل هذا المسار دون افتراضات حول استقلالية القيود ويتكون من أربع خطوات تكرارية:
- الاستجابة الأولية: يولد النموذج اللغوي استجابة للتعليمات الأصلية.
- التفكيك (Decompose): يقوم نموذج "المفكك" بتفكيك التعليمات الأصلية إلى قائمة من القيود التفصيلية التي يجب اتباعها.
- النقد (Critique): يقوم نموذج "الناقد" بتقييم الاستجابة مقابل كل قيد. إذا تم استيفاء جميع القيود، تنتهي العملية. إذا لم يتم ذلك، يقدم الناقد ملاحظات بلغة طبيعية تحدد القيود التي تم انتهاكها.
- التنقيح (Refine): يستخدم النموذج اللغوي الأساسي الملاحظات، والتعليمات الأصلية، والاستجابة السابقة لتوليد مخرج محسّن.
تتكرر هذه الدورة حتى يتم استيفاء القيود أو الوصول إلى الحد الأقصى من عدد التكرارات ().
المساهمات الرئيسية
- REALINSTRUCT: معيار مرجعي جديد يتكون من طلبات مستخدمين حقيقية للمساعدين الذكيين، مما يوفر تقييمًا أكثر واقعية لاتباع التعليمات متعددة القيود مقارنة بمجموعات البيانات الاصطناعية.
- مسار DECRIM: إطار عمل للتصحيح الذاتي يقوم بتفكيك التعليمات، ونقد الاستجابات عبر نموذج ناقد مخصص، وتنقيح المخرجات. وهو أول نهج "نظام 2" للتعليمات المقيدة يعمل دون افتراض استقلالية القيود.
- التحليل المنهجي لـ "النموذج اللغوي كحكم": أول تقييم منهجي للنماذج مفتوحة المصدر والمملوكة كأحكام لمدى الالتزام بالقيود، مع تحديد GPT-4-Turbo مع CoT كبديل موثوق وفعال من حيث التكلفة للتدوين البشري.
النتائج
أداء المعيار المرجعي (REALINSTRUCT & IFEval)
- محدودية الخط الأساسي: حتى نموذج GPT-4 المملوك يفشل في استيفاء قيد واحد على الأقل في أكثر من 21% من التعليمات في REALINSTRUCT. وتؤدي النماذج مفتوحة المصدر (مثل Mistral 7B) عمومًا أداءً أقل مقارنة بـ GPT-4، رغم أنها تتفوق على GPT-3.5.
- فعالية DECRIM:
- التغذية الراجعة الضعيفة: باستخدام نموذج Mistral خاضع للإشراف الضعيف كنموذج ناقد (بدون بيانات خارجية)، أدى DECRIM إلى تحسين أداء Mistle في مستوى التعليمات بنسبة 7.3% في REALINSTRUCT و 8.0% في IFEval مقارنة بخط الأساس "Make sure".
- التغذية الراجعة القوية: عندما تم تزويدها بتغذية راجعة قوية (Oracle Critic أو GPT-4)، تجاوزت النماذج اللغوية مفتوحة المصدر مع DECRIM نموذج GPT-4 في كلا المعيارين. وتحديدًا، مع وجود Oracle Critic، حقق Mistral دقة بنسبة 93.7% في مستوى التعليمات في REALINSTRUCT (مقابل 78.8% لـ GPT-4) و 80.4% في IFEval (مقابل 79.3% لـ GPT-4).
- حدود التصحيح الذاتي: أدى "التحسين الذاتي القياسي" (باستخدام النموذج نفسه كناقد) إلى مكاسب ضئيلة أو انخفاض في الأداء، مما يسلط الضوء على ضرورة وجود نموذج ناقد خارجي أو متميز.
موثوقية التقييم
- GPT-4-Turbo: مع التلقين بسلسلة الأفكار (CoT)، قلل من تكاليف التقييم بنسبة 57% مقارنة بـ GPT-4 مع تحسين Macro F1 بنسبة 7.0% و F1 Negative (اكتشاف الانتهاكات) بنسبة 19.0%.
- الأحكام مفتوحة المصدر: كانت النماذج مفتوحة المصدر العادية أحكامًا غير موثوقة، حيث أظهرت غالبًا سلوكًا متساهلًا أو عشوائيًا. ومع ذلك، فإن الضبط الدقيق الخاضع للإشراف الضعيف على مسارات استدلال GPT-4 حسن بشكل كبير قدرتها على اكتشاف القيود غير المستوفاة.
الأهمية والادعاءات
يزعم البحث أن اتباع التعليمات الحقيقية متعددة القيود لا يزال يمثل تحديًا كبيرًا للنماذج المتطورة، حيث يفشل حتى GPT-4 بشكل متكرر. ويفترض المؤلفون أن مسار DECRIM يعالج ذلك بفعالية من خلال فصل عملية توليد الاستجابة عن عملية التقييم والتنقيح.
يُظهر العمل أن:
- بيانات العالم الحقيقي متميزة: المعايير الاصطناعية لا تستوعب تمامًا تحديات قيود المستخدمين الحقيقية، مما يستوجب وجود معايير مثل REALINSTRUCT.
- جودة التغذية الراجعة أمر بالغ الأهمية: يعتمد نجاح التصحيح الذاتي بشكل كبير على جودة ملاحظات الناقد. وبينما تكافح النماذج مفتوحة المصدر في التصحيح الذاتي، يمكنها تحقيق أداء يتجاوز النماذج المملوكة عند تزويدها بتغذية راجعة خارجية عالية الجودة.
- صلاحية "النظام 2": يثبت نهج DECRIM جدوى تقنيات "النظام 2" (التفكيك والتنقيح التكراري) لاتباع التعليمات المعقدة، مما يشير إلى أن النماذج مفتوحة المصدر يمكن أن تكون منافسة للنماذج المملوكة إذا تم تجهيزها بمسارات تصحيح قوية.
يخلص المؤلفون إلى أنه بينما يفرض DECRIM عبئًا حسابيًا إضافيًا، فإنه يوفر مسارًا قابلاً للتطبيق لتعزيز قدرات اتباع التعليمات، خاصة عند توفر آليات تغذية راجعة قوية. ويُقترح العمل المستقبلي لتحسين مكونات المسار ودمج DECRIM مع أساليب "النظام 2" الأخرى مثل الاتساق الذاتي (self-consistency).
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.