Interactive Critique-Revision Training for Reliable Structured LLM Generation
تقترح هذه الورقة طريقة DPA-GRPO، وهي طريقة تدريب للأفعال المزدوجة المقترنة للعبة المولد والمتحقق التي تستخدم حالات ضمان السلامة ومجموعات الأفعال المضادة لتحسين مخرجات النماذج اللغوية الكبيرة المهيكلة، مما يظهر تحسناً في الدقة، وكشف الأخطاء، وسلوك المراجعة المعاير على معيار TaxCalcBench TY24.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول ملء نموذج ضريبي معقد للغاية وعالي المخاطر. لديك مساعد ذكي (المولد - Generator) يكتب الأرقام، ومدقق صارم (المتحقق - Verifier) يراجع العمل.
في الماضي، إذا طلبت من الذكاء الاصطناعي القيام بذلك، فإنه كان يكتفي بكتابة الأرقام ويأمل في الأفضل. أحياناً كان يصيب، وأحياناً أخرى كان يرتكب خطأً سخيفاً ولا يلاحظه أحد. حاولت طرق أخرى جعل الذكاء الاصطناعي "يتجادل" مع نفسه، لكن ذلك أدى غالباً إلى إقناع الذكاء الاصطناعي لنفسه بإجابات خاطئة باستخدام حجج تبدو براقة ولكنها زائفة.
تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى DPA-GRPO. فكر في الأمر كعملية "بروفة" صارمة حيث يتعلم المساعد والمتحقق العمل معاً كفريق واحد، وليس مجرد شخصين يصرخان على بعضهما البعض.
إليك كيف يعمل النظام، مقسماً إلى مفاهيم بسيطة:
1. اللاعبان: المخطط والمفتش
- المولد (المخطط - The Draftsman): ينظر هذا الذكاء الاصطناعي إلى النموذج الضريبي ويقترح إجابة (مثلاً: "خصم القرض الطلابي الخاص بك هو 3,000 دولار").
- المتحقق (المفتش - The Inspector): ينظر هذا الذكاء الاصطناعي إلى إجابة المخطط. ولديه خياران:
- البقاء صامتاً: "تبدو جيدة، أنا أوافق عليها."
- رفع علم (SAC): "انتظر لحظة! لقد وجدت خطأً." ومن الأهمية بمكان أنه عندما يرفع علماً، لا يمكنه الاكتفاء بالقول "أنت مخطئ"، بل يجب عليه تقديم حالة ضمان سلامة (SAC). وهذا يشبه مذكرة رسمية تتضمن:
- الادعاء: "الرقم مرتفع جداً."
- الحجة: "القانون ينص على أن الحد الأقصى هو 2,500 دولار."
- الدليل: "إليك الإيصال الذي يظهر أنك دفعت 3,000 دولار."
2. حلقة "الفرصة الثانية"
إذا رفع المفتش علماً، يحصل المخطط على فرصة ثانية. يمكنه حينها:
- الإبقاء: "أنا متمسك بإجابتي الأصلية؛ علمك كان خطأً."
- المراجعة: "أنت محق، لقد ارتكبت خطأً حسابياً. إليك الرقم المصحح."
3. لعبة التدريب (المدرب)
إن سحر هذه الورقة البحثية يكمن في كيفية تعليم الذكاء الاصطناعي. هم لا يكتفون بقول "عمل جيد" أو "عمل سيء"، بل يلعبون لعبة حيث يتعلم الذكاء الاصطناعي من ما كان يمكن أن يحدث (السيناريوهات المقابلة للواقع).
تخيل مدرباً يشاهد مباراة تدريبية:
- السيناريو أ: المخطط أصاب الإجابة، والمفتش بقي صامتاً. (مثالي!) يكافئ المدرب كلاهما.
- السيناريو ب: المخطط أخطأ، والمفتش تجاهل الخطأ. (سيء!) يخبر المدرب المفتش: "كان يجب عليك رفع العلم!"
- السيناريو ج: المخطط أصاب الإجابة، لكن المفتش رفع علماً بشكل خاطئ. (سيء!) يخبر المدرب المفتش: "توقف عن كونك مهووساً؛ تلك الإجابة كانت صحيحة."
- السيناريو د: المفتش رفع علماً، والمخطط قام بتصحيح الخطأ. (جيد!) يحصل كلاهما على مكافأة لعملهما الجماعي.
- السيناريو هـ: المفتش رفع علماً، لكن "تصحيح" المخطط جعل الأمر أسوأ. (سيء!) يخبر المدرب المخطط: "لا تغير الأشياء لمجرد أن أحدهم صرخ عليك؛ تحقق مما إذا كان التغيير أفضل بالفعل."
يستخدم النظام صيغة رياضية (GRPO) لتعديل "دماغ" الذكاء الاصطناعي بحيث يتعلم:
- الحصول على الإجابة الصحيحة من المرة الأولى.
- رفع الأعلام فقط عندما تكون هناك حاجة فعلية لذلك.
- تغيير الإجابة فقط إذا كان التغيير تحسناً حقيقياً.
4. النتائج: فريق أفضل
اختبر الباحثون هذه الطريقة على معيار يسمى TaxCalcBench، والذي يحاكي ملء النماذج الضريبية الأمريكية. وقارنوا طريقتهم بـ:
- Zero-shot: الذكاء الاصطناعي يخمن فقط دون تدريب.
- الطرق القديمة: تدريب المخطط فقط ليصبح أفضل، دون وجود مفتش مخصص.
كانت النتائج واضحة:
- حقق "الفريق" الجديد (DPA-GRPO) إجابات صحيحة أكثر بكثير من المخطط المنفرد أو الذكاء الاصطناعي غير المدرب.
- تعلم المفتش التوقف عن "التبليغ الكاذب" (رفع إنذارات خاطئة) وبدأ في رصد الأخطاء الحقيقية التي كان يفوتها سابقاً.
- تعلم المخطط أن يكون أكثر ذكاءً بشأن متى يغير إجابته، بدلاً من الطاعة العمياء لكل تصحيح.
الخلاصة
تقترح هذه الورقة البحثية طريقة لتدريب الذكاء الاصطناعي ليكون أكثر موثوقية في المهام المنظمة (مثل ملء النماذج) من خلال تحويل العملية إلى لعبة تعاونية بين مبتكر وناقد. بدلاً من مجرد الأمل في أن يصيب الذكاء الاصطنا est، فهم يعلمونه كيف يجادل، ويفحص الأدلة، ويراجع عمله بطريقة منظمة ومنضبطة، مما يؤدي إلى أخطاء أقل ومخرجات أكثر موثوقية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.