Training Language Models for Bilateral Trade with Private Information
यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को बेंचमार्क और प्रशिक्षित करने के लिए एक संरचित द्विपक्षीय व्यापार वातावरण प्रस्तुत करता है, जो यह प्रकट करता है कि सीमावर्ती मॉडल (फ्रंटियर मॉडल्स) रणनीतिक मूल्य भेदभाव के माध्यम से इष्टतम परिणाम प्राप्त करते हैं, जबकि ओपन-वेट मॉडल्स का सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) फाइन-ट्यूनिंग आनुपातिक रणनीतियों को बढ़ा सकता है लेकिन डील पूरा होने की दर और अधिशेष अधिकतमकरण के बीच समझौतों का सामना करता है।