Foresight Optimization for Strategic Reasoning in Large Language Models
यह शोध पत्र फॉरसाइट पॉलिसी ऑप्टिमाइज़ेशन (FoPO) को प्रस्तुत करता है, जो मल्टी-एजेंट वातावरण के भीतर लार्ज लैंग्वेज मॉडल्स में रणनीतिक तर्क और निर्णय लेने की क्षमता को बढ़ाने के लिए पॉलिसी ऑप्टिमाइज़ेशन में अपोनेंट मॉडलिंग को एकीकृत करने वाली एक नवीन विधि है, जो विविध मॉडल्स और परिदृश्यों में महत्वपूर्ण प्रदर्शन सुधार और मजबूत सामान्यीकरण प्रदर्शित करता है।