One More Time: Revisiting Neural Quantum States from a Reinforcement Learning Perspective
यह शोध पत्र प्रॉक्सिमल वेवफंक्शन ऑप्टिमाइज़ेशन (PWO) को प्रस्तुत करता है, जो एक ट्रस्ट-रीजन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो संभाव्यता अनुपातों (probability ratios) और चरण वृद्धियों (phase increments) को क्लिप करके ऑटोरेग्रेसिव न्यूरल क्वांटम स्टेट्स के प्रशिक्षण की स्थिरता और स्केलेबिलिटी को बढ़ाता है, जिससे 1.5 बिलियन मापदंडों तक के मॉडलों का कुशल अनुकूलन सक्षम होता है।