Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows
यह शोध पत्र एक अवधारणा का प्रमाण (proof of concept) प्रस्तुत करता है जो यह प्रदर्शित करता है कि वेरिफिएबल रिवार्ड्स के साथ सुदृढीकरण लर्निंग (RLVR), सिंथेटिक एटलासियन (जीरा और कॉन्फ्लुएंस) परिवेशों में जटिल, बहु-चरणीय टूल कॉल्स को निष्पादित करने की छोटे भाषा मॉडलों की क्षमता में महत्वपूर्ण सुधार करता है, जो लाइव एपीआई या मानवीय फीडबैक पर निर्भर हुए बिना अधिकांश परिदृश्यों में लगभग पूर्ण सफलता दर प्राप्त करता है।