PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration
PAVXploreRL एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रिवॉर्ड-संचालित प्रशिक्षण और शोर-संचालित आउट-ऑफ-डिस्ट्रीब्यूशन एक्शन अन्वेषण के माध्यम से भौतिक संभाव्यता (Physical Plausibility), एक्शन पालन (Action Adherence), और दृश्य निष्ठा (Visual Fidelity) यानी PAV उद्देश्यों को स्पष्ट रूप से अनुकूलित करके एक्शन-कंडीशन्ड वर्ल्ड मॉडल्स को बेहतर बनाता है, जिससे यह मौजूदा एक्सपर्ट-ओनली विधियों की तुलना में श्रेष्ठ सामान्यीकरण और अधिक विश्वसनीय पॉलिसी मूल्यांकन प्राप्त करता है।