On the Role of Computation in Reinforcement Learning
यह शोध पत्र कंप्यूट-बाउंडेड (compute-bounded) नीतियों की अवधारणा को औपचारिक रूप देता है ताकि यह प्रदर्शित किया जा सके कि, एक न्यूनतम परिवर्तनीय-कंप्यूट (minimal variable-compute) आर्किटेक्चर के माध्यम से कंप्यूटेशन को पैरामीटर संख्या से अलग करके, सुदृढीकरण लर्निंग (reinforcement learning) एजेंट केवल अधिक कम्प्यूटेशनल संसाधनों का उपयोग करके लंबी अवधि के कार्यों (long-horizon tasks) पर बेहतर प्रदर्शन और सामान्यीकरण प्राप्त कर सकते हैं।