Counterfactual Q Learning via the Linear Buckley James Method for Longitudinal Survival Data
यह शोध पत्र एक काउंटरफैक्चुअल बकलีย์-जेम्स क्यू-लर्निंग फ्रेमवर्क प्रस्तावित करता है जो सेंसर किए गए अनुदैर्ध्य डेटा (longitudinal data) की उपस्थिति में उत्तरजीविता समय (survival time) को अधिकतम करने के लिए इष्टतम गतिशील उपचार व्यवस्था (dynamic treatment regimes) का अनुमान लगाने हेतु बकलีย์-जेम्स इमप्यूटेशन पद्धति को सुदृढीकरण शिक्षण (reinforcement learning) के साथ एकीकृत करता है।