← नवीनतम पेपर
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

यह शोध पत्र DR Tulu को प्रस्तुत करता है, जो 'इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग' (RLER) के माध्यम से प्रशिक्षित एक ओपन-सोर्स डीप रिसर्च मॉडल है, जो पॉलिसी के साथ मूल्यांकन मानदंडों को सह-विकसित करता है, जिससे यह मौजूदा ओपन एजेंटों से बेहतर प्रदर्शन करने और दीर्घकालिक शोध कार्यों पर प्रोप्रायटरी सिस्टमों को टक्कर देने में सक्षम होता है, जबकि यह काफी अधिक लागत-प्रभावी भी है।

मूल लेखक: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca So
प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "DR Tulu: Deep Research के लिए Evolving Rubrics के साथ Reinforcement Learning" पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

बड़ी तस्वीर: एक रोबोट को शोधकर्ता (Researcher) बनना सिखाना

कल्पना कीजिए कि आप एक रोबोट को किसी जटिल विषय पर एक लंबा, विस्तृत शोध रिपोर्ट लिखने के लिए प्रशिक्षित करना चाहते हैं, जैसे कि "जेनेटिक म्यूटेशन कैसे दुर्लभ बीमारियों का कारण बनते हैं?" या "नवीकरणीय ऊर्जा (renewable energy) का इतिहास क्या है?"

आज के अधिकांश AI मॉडल उन छात्रों की तरह हैं जो केवल छोटी क्विज़ के लिए पढ़ाई करते हैं। वे "फ्रांस की राजधानी क्या है?" जैसे सरल सवालों के जवाब देने में माहिर हैं, लेकिन जब उनसे 20 पन्नों की रिपोर्ट लिखने के लिए कहा जाता है जिसमें सैकड़ों वेबसाइटों को खंगालने, तथ्यों की जांच करने और स्रोतों का हवाला देने की आवश्यकता होती है, तो वे संघर्ष करते हैं।

इस पेपर के लेखकों ने एक नया AI बनाया है जिसे DR Tulu कहा जाता है। यह विशेष रूप से "डीप रिसर्चर" बनने के लिए प्रशिक्षित किया गया पहला ओपन-सोर्स मॉडल है। यह केवल अनुमान नहीं लगाता; यह योजना बनाता है, वेब खोजता है, शोध पत्रों को पढ़ता है, और एक लंबी, अच्छी तरह से प्रमाणित रिपोर्ट लिखता है।

समस्या: एक लंबी रिपोर्ट को ग्रेड कैसे दें?

AI को बेहतर करने के लिए सिखाने हेतु, आप आमतौर पर Reinforcement Learning नामक विधि का उपयोग करते हैं। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें:

  1. कुत्ता (AI) एक ट्रिक करता है।
  2. यदि वह इसे सही करता है, तो उसे इनाम (treat) मिलता है।
  3. यदि वह इसे गलत करता है, तो उसे कोई इनाम नहीं मिलता।

लंबी शोध रिपोर्टों के साथ समस्या यह है कि यह जानना कठिन है कि एक "अच्छी" रिपोर्ट कैसी दिखती है।

  • Static Rubrics (पुराना तरीका): कल्पना कीजिए कि एक शिक्षक कुत्ते को एक निश्चित चेकलिस्ट देता है: "5 पैराग्राफ होने चाहिए। 1990 का उल्लेख होना चाहिए।" यदि कुत्ता 1991 के बारे में एक शानदार रिपोर्ट लिखता है, तो शिक्षक उसे फेल कर देता है क्योंकि उसने सख्त चेकलिस्ट का पालन नहीं किया। वह चेकलिस्ट नहीं जानती कि कुत्ते ने वास्तव में क्या खोज निकाला है।
  • "क्लोज्ड-बुक" की समस्या: यदि आप किसी AI को केवल अपने मौजूदा ज्ञान के आधार पर चेकलिस्ट बनाने के लिए कहते हैं, तो वह उन नए तथ्यों को मिस कर सकता है जो उसने अभी इंटरनेट पर खोजे हैं।

समाधान: "Evolving Rubrics" (स्मार्ट टीचर)

यह पेपर एक नई विधि पेश करता है जिसे RLER (Reinforcement Learning with Evolving Rubrics) कहा जाता है।

एक स्मार्ट टीचर (Smart Teacher) की कल्पना करें जो एक निश्चित चेकलिस्ट का उपयोग नहीं करता है। इसके बजाय, शिक्षक छात्र (AI) को वास्तविक समय (real-time) में अपना शोध करते हुए देखता है।

  1. छात्र खोज करता है: छात्र बाहर जाता है, नए तथ्य पाता है, और एक ड्राफ्ट लिखता है।
  2. शिक्षक अनुकूलित होता है: स्मार्ट टीचर देखता है कि छात्र ने क्या पाया। "ओह, मुझे नहीं पता था कि यह तथ्य मौजूद है! मुझे अपनी चेकलिस्ट में एक नया नियम जोड़ना चाहिए: 'इस नए तथ्य की व्याख्या करनी चाहिए'।"
  3. फीडबैक लूप: शिक्षक छात्र के सीखने के दौरान ही चेकलिस्ट को अपडेट करता है। यदि छात्र धोखाधड़ी करने की कोशिश करता है (जैसे बिना पढ़े टेक्स्ट कॉपी करना), तो शिक्षक तुरंत एक नियम जोड़ देता है: "चीटिंग करने की अनुमति नहीं है।"

तकनीकी शब्दों में, पेपर इन Evolving Rubrics को कहता है। ये मूल्यांकन मानदंड (evaluation criteria) हैं जो बदलते रहते हैं और AI द्वारा अधिक जानकारी खोजने के साथ और स्मार्ट होते जाते हैं। यह AI को केवल नियमों के एक स्थिर सेट में फंसे रहने के बजाय अपनी खोजों से सीखने की अनुमति देता है।

परिणाम: कम बजट में एक सुपर-रिसर्चर

लेखकों ने इस "स्मार्ट टीचर" पद्धति का उपयोग करके DR Tulu को प्रशिक्षित किया। यहाँ क्या हुआ:

  • यह अधिक स्मार्ट है: DR Tulu ने अन्य ओपन-सोर्स रिसर्च मॉडल्स को बहुत बड़े अंतर से पीछे छोड़ दिया। इसने बेहतर रिपोर्ट लिखी, अधिक सटीक तथ्य खोजे और स्रोतों का सही ढंग से हवाला दिया।
  • यह दिग्गजों को टक्कर देता है: इसने OpenAI और Google जैसी बड़ी कंपनियों के महंगे, प्रोप्राइटरी सिस्टम के समान (और कभी-कभी बेहतर) प्रदर्शन किया।
  • यह सस्ता है: सबसे बड़ी जीत यही है। महंगे सिस्टम एक प्रश्न के लिए लगभग $1.80 खर्च करते हैं। DR Tulu एक प्रश्न के लिए लगभग $0.002 खर्च करता है। यह लगभग 1,000 गुना सस्ता है।

"जेनेटिक डिजीज" टेस्ट

यह साबित करने के लिए कि यह वास्तव में काम करता है, टीम ने DR Tulu को एक बहुत कठिन कार्य दिया: जेनेटिक म्यूटेशन का विश्लेषण करना कि क्या उन्हें विशिष्ट दवाओं के साथ ठीक किया जा सकता है। यह एक ऐसा कार्य है जो आमतौर पर मानव चिकित्सा विशेषज्ञों के लिए आरक्षित होता है।

  • DR Tulu ने सफलतापूर्वक मेडिकल डेटाबेस को खोजा, प्रासंगिक शोध पत्र ढूंढे, और एक रिपोर्ट तैयार की।
  • यह इस कार्य पर सबसे महंगे, क्लोज्ड-सोर्स AI सिस्टम के साथ प्रतिस्पर्धा करने में सक्षम रहा।
  • अन्य ओपन-सोर्स मॉडल विफल रहे क्योंकि वे सही साइटेशन (citations) नहीं ढूंढ सके या तथ्यों को सत्यापित नहीं कर सके।

टूलकिट: "dr-agent-lib"

पेपर ने एक "टूलबॉक्स" भी जारी किया है जिसे dr-agent-lib कहा जाता है।

  • इसे AI शोधकर्ताओं के लिए एक स्विस आर्मी नाइफ (Swiss Army Knife) के रूप में समझें।
  • यह AI को विभिन्न टूल्स का उपयोग करने की अनुमति देता है: Google Search, विशिष्ट वेबपेज पढ़ना, और अकादमिक शोध पत्रों को खोजना।
  • महत्वपूर्ण बात यह है कि AI काम के लिए सही टूल चुनना सीखता है। यदि प्रश्न विज्ञान के बारे में है, तो यह "पेपर सर्च" टूल का उपयोग करता है। यदि यह सामान्य समाचार के बारे में है, तो यह "वेब सर्च" का उपयोग करता है। यह केवल एक टूल का अंधाधुंध उपयोग नहीं करता है।

सारांश

यह पेपर DR Tulu को प्रस्तुत करता है, जो एक ओपन-सोर्स AI है जो गहरा, लंबा शोध करना सीखता है। यह एक विशेष प्रशिक्षण पद्धति (Evolving Rubrics) का उपयोग करता है जहाँ AI के "ग्रेडिंग नियम" AI द्वारा की गई खोजों के आधार पर वास्तविक समय में अपडेट होते हैं। यह AI को बहुत अधिक स्मार्ट, सटीक और वर्तमान अत्याधुनिक शोध उपकरणों की तुलना में काफी सस्ता बनाता है। लेखकों ने कोड, डेटा और मॉडल को साझा किया है ताकि कोई भी इसका उपयोग कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →