DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification
يُعد DecomposeRL إطار عمل للتحقق من الادعاءات شبه مُشرف وقابل للتتبع، يستفيد من قمع تنقية البيانات والتعلم التعزيزي القائم على GRPO لتدريب نموذج مدمج بحجم 7 مليار بارامتر، محققاً أداءً يضاهي النماذج المرجعية الأكبر حجماً بكثير مع إنتاج مسارات استدلال قابلة للتفسير.