Interactive Critique-Revision Training for Reliable Structured LLM Generation
यह शोध पत्र DPA-GRPO का प्रस्ताव करता है, जो एक जनरेटर-वेरिफायर गेम के लिए एक डुअल पेयर्ड-एक्शन प्रशिक्षण विधि है जो संरचित LLM आउटपुट को अनुकूलित करने के लिए सुरक्षा आश्वासन मामलों (safety assurance cases) और काउंटरफैक्चुअल एक्शन समूहों का उपयोग करता है, जो TaxCalcBench TY24 बेंचमार्क पर बेहतर सटीकता, त्रुटि पहचान और कैलिब्रेटेड संशोधन व्यवहार प्रदर्शित करता है।