DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
यह शोध पत्र DR Tulu को प्रस्तुत करता है, जो 'इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग' (RLER) के माध्यम से प्रशिक्षित एक ओपन-सोर्स डीप रिसर्च मॉडल है, जो पॉलिसी के साथ मूल्यांकन मानदंडों को सह-विकसित करता है, जिससे यह मौजूदा ओपन एजेंटों से बेहतर प्रदर्शन करने और दीर्घकालिक शोध कार्यों पर प्रोप्रायटरी सिस्टमों को टक्कर देने में सक्षम होता है, जबकि यह काफी अधिक लागत-प्रभावी भी है।