← नवीनतम पेपर
💬 NLP

DRBench: A Realistic Benchmark for Enterprise Deep Research

यह शोधपत्र DRBench को प्रस्तुत करता है, जो 10 एंटरप्राइज डोमेन में 100 मानव-सत्यापित, बहु-चरणीय गहन अनुसंधान कार्यों वाला एक यथार्थवादी बेंचमार्क है, जो सार्वजनिक वेब और निजी कंपनी डेटा दोनों से जानकारी को संश्लेषित करके सटीक, संरचित रिपोर्ट तैयार करने की क्षमता पर एआई एजेंटों का मूल्यांकन करता है।

मूल लेखक: Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han Lù, Nicolas Chapados, Spandana Gella, Peter West, Giuseppe Carenini, Christopher
प्रकाशित 2026-03-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han Lù, Nicolas Chapados, Spandana Gella, Peter West, Giuseppe Carenini, Christopher Pal, Alexandre Drouin, Issam H. Laradji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बेहद बुद्धिमान, अथक शोध सहायक (research assistant) "AI" को काम पर रखा है। आप उससे टोक्यो के मौसम जैसा एक सरल प्रश्न पूछते हैं। वह इंटरनेट चेक करता है और आपको तुरंत उत्तर दे देता है। यह आसान है।

लेकिन अब, कल्पना कीजिए कि आप उसी सहायक को एक बहुत कठिन, वास्तविक दुनिया का काम देते हैं: "हमारे कंपनी के निजी ईमेल देखें, हमारे आंतरिक सेल्स स्प्रेडशीट्स की जांच करें, हमारे चैट लॉग्स को स्कैन करें, और फिर इन सबको इंटरनेट पर मौजूद नवीनतम समाचारों के साथ तुलना करें। जो कुछ भी आपको मिले, उसके आधार पर एक रिपोर्ट लिखें कि हमें अपनी प्रोडक्ट योजना में कैसे बदलाव करना चाहिए ताकि हम नए सुरक्षा कानूनों का उल्लंघन न करें।"

यह बिल्कुल वही है जिसके बारे में DRBench पेपर है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "गूगल टेस्ट" बनाम "वास्तविक दुनिया"

AI के पिछले परीक्षण एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) की तरह थे। उन्होंने सरल प्रश्न पूछे जहाँ उत्तर गूगल पर बस एक क्लिक की दूरी पर था। लेकिन वास्तविक व्यावसायिक दुनिया में, उत्तर किसी एक वेबपेज पर नहीं मिलते। वे यहाँ छिपे होते हैं:

  • निजी कंपनी दस्तावेज़ों में (जैसे एक बंद फाइलिंग कैबिनेट)।
  • पुराने ईमेल और स्लैक संदेशों में (जैसे एक अस्त-व्यस्त ग्रुप चैट)।
  • सार्वजनिक समाचारों और वेबसाइटों में (जैसे खुला इंटरनेट)।

पुराने AI परीक्षण एक छात्र से एक साफ व्हाइटबोर्ड पर गणित का सवाल हल करने के लिए कहने जैसे थे। DR-Bench उस छात्र को एक व्यस्त लाइब्रेरी, एक शोर वाले कार्यालय और एक निर्माण स्थल में एक साथ फेंकने और उनसे एक घर बनाने के लिए कहने जैसा है।

2. समाधान: DRBench (द "डीप रिसर्च" जिम)

लेखकों ने DRBench बनाया है, जो अनिवार्य रूप से AI एजेंटों के लिए एक जिम है। हल्के वजन उठाने (सरल प्रश्नों) के बजाय, वे भारी, जटिल कार्यों को उठा रहे हैं।

  • वर्कआउट: उन्होंने 10 अलग-अलग विभागों (जैसे सेल्स, साइबर सुरक्षा और अनुपालन/Compliance) में 100 वास्तविक परिदृश्य बनाए।
  • नियम: AI को एक जासूस बनना होगा। वह केवल अनुमान नहीं लगा सकता; उसे सुराग खोजने के लिए "निजी तिजोरी" (कंपनी डेटा) और "सार्वजनिक चौक" (वेब) की खुदाई करनी होगी।
  • लक्ष्य: AI को केवल उत्तर खोजने के लिए ही नहीं मापा जाता है; इसे इस आधार पर भी मापा जाता है कि यह कितनी अच्छी तरह से कड़ियों को जोड़ता है, कितनी सच्चाई बताता है, और कितनी स्पष्ट, व्यवस्थित रिपोर्ट लिखता है जिसे एक मानव बॉस वास्तव में उपयोग कर सके।

3. उन्होंने इसे कैसे बनाया

उन्होंने केवल काल्पनिक प्रश्न नहीं बनाए। उन्होंने एक विशेष विधि का उपयोग किया:

  1. सिंथेसिस (Synthesis): उन्होंने कंप्यूटर का उपयोग करके वास्तविक "पर्सोना" (जैसे एक तनावग्रस्त सेल्स मैनेजर या एक सख्त अनुपालन अधिकारी) उत्पन्न किए।
  2. मानवीय जांच: वास्तविक मनुष्यों ने यह सत्यापित करने के लिए हस्तक्षेप किया कि कार्य तर्कसंगत थे और वास्तव में पर्याप्त कठिन थे।
  3. परिणाम: 100 "डीप रिसर्च" मिशनों का एक विशाल डेटासेट जो एक वास्तविक कार्यालय की अराजकता और जटिलता की नकल करता है।

4. यह क्यों महत्वपूर्ण है

लेखकों ने इस नए जिम पर कई अलग-अलग AI मॉडल (जैसे GPT, Llama, और Qwen) का परीक्षण किया। उन्होंने पाया कि हालांकि कुछ AI साधारण सामान्य ज्ञान (trivia) में बेहतरीन हैं, लेकिन वे अक्सर तब भटक जाते हैं जब कार्य के लिए निजी डेटा और सार्वजनिक जानकारी को एक साथ संभालने की आवश्यकता होती है।

संक्षेप में:
DRBench को AI शोधकर्ताओं के लिए ओलंपिक्स के रूप में देखें। इससे पहले, AI 100 मीटर की दौड़ (सरल, तेज़ उत्तर) में प्रतिस्पर्धा कर रहा था। अब, वे डेकाथलॉन (Decathlon) में प्रतिस्पर्धा कर रहे हैं, जहाँ उन्हें दौड़ना, कूदना, फेंकना और जटिल बाधाओं (निजी डेटा, सार्वजनिक वेब और तार्किक तर्क) को एक साथ पार करना होगा।

यह बेंचमार्क कंपनियों को यह समझने में मदद करता है कि कौन से AI सहायक वास्तव में व्यवसाय चलाने के जटिल और उलझे हुए काम को संभालने के लिए तैयार हैं, न कि केवल सरल प्रश्नों के उत्तर देने के लिए।

कहाँ खोजें: यदि आप स्वयं इस "जिम" को देखना चाहते हैं, तो कोड और डेटा GitHub पर सभी के उपयोग के लिए खुले हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →