Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks
यह शोध पत्र तर्क की कठिनाई के दो आयामों (गहराई और जटिलता) और चार तर्क परिवारों (reasoning families) में 'वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) का अध्ययन करने के लिए एक नियंत्रित सिंथेटिक वातावरण प्रस्तुत करता है, जो यह प्रकट करता है कि इन कारकों का संयुक्त कवरेज और समान डेटा मिश्रण, एकल-अक्ष या चरणबद्ध दृष्टिकोणों की तुलना में बेहतर प्रदर्शन करते हैं, जबकि वर्तमान मॉडलों में एक निरंतर डीडक्टिव-ओवर-एबडक्टिव (deductive-over-abductive) विषमता को भी उजागर करते हैं।