🤖 AI
Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning
تقدم هذه الورقة البحثية "تكرار السياسة مع التغذية الراجعة البشرية" (PIHF)، وهو إطار عمل يستفيد من ناقد يعتمد على نموذج لغوي وإشراف خبير سريري لتحسين السياسات ذات اللغة الطبيعية لتشخيص الأمراض النادرة بشكل تكراري، مما يظهر مكاسب كبيرة في الأداء عبر أحجام نماذج متنوعة دون تغيير أوزانها الأساسية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.