🤖 machine learning
AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
تقدم هذه الورقة البحثية AIRL-S، وهو إطار عمل موحد يجمع بين التعلم العكسي التنافسي المعزز (Adversarial Inverse Reinforcement Learning) وتحسين السياسة النسبي للمجموعات (Group Relative Policy Optimization) لاستنتاج مكافآت كثيفة وخطوة بخطوة من المسارات المرجعية، مما يلغي الحاجة إلى بيانات عمليات مصنفة مع تمكين توسيع نطاق الاختبار القوي ومنخفض التكلفة الذي يحقق أداءً بمستوى GPT-4o عبر اختبارات قياس الرياضيات والعلوم وتوليد الكود البرمجي.
Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che (…)2026-08-27