BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents
BiPACE एक ड्रॉप-इन एडवांटेज एस्टिमेटर पेश करता है जो लॉन्ग-होरिज़न LLM एजेंटों को प्रशिक्षित करने के लिए पॉलिसी-इंड्यूस्ड बिसिमिल्यूशन (policy-induced bisimulation) के माध्यम से स्टेप्स को क्लस्टर करके और एक्शन-कंडीशन्ड काउंटरफैक्चुअल बेसलाइन (action-conditioned counterfactual baselines) लागू करके ग्रुप-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में स्टेट-एक्शन क्रेडिट मिसमैच को हल करता है, जिससे बिना किसी सीखे गए क्रिटिक या अतिरिक्त रोलआउट्स के GiGPO जैसी मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।