TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
تقترح الورقة البحثية TRN-R1-Zero، وهو إطار عمل لما بعد التدريب يتيح الاستنتاج صفري المعرفة (zero-shot reasoning) على الشبكات الغنية بالنصوص من خلال التحسين المباشر للنماذج اللغوية الكبيرة الأساسية عبر التعلم التعزيزي باستخدام آلية مكافأة مبتكرة تراعي الجوار، مما يلغي الحاجة إلى الضبط الدقيق الخاضع للإشراف أو التقطير مع تحقيق أداء فائق عبر مختلف الاختبارات المعيارية ومستويات المهام.