Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
हार्नेस-1 (Harness-1) एक 20B सुदृढीकरण लर्निंग-आधारित (reinforcement learning-based) खोज एजेंट है जो मौजूदा ओपन और फ्रंटियर मॉडलों की तुलना में बेहतर रिट्रीवल प्रदर्शन और विविध बेंचमार्क में मजबूत सामान्यीकरण प्राप्त करने के लिए, अर्थपूर्ण निर्णय लेने की क्षमता को बरकरार रखते हुए नियमित स्टेट मैनेजमेंट को एक बाहरी स्टेटफुल हार्नेस पर ऑफलोड करता है।