← नवीनतम पेपर
💻 computer science

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

यह शोध पत्र संज्ञानात्मक जाल (cognitive traps) वाले विषय विशेषज्ञ (SME) द्वारा रचित प्रॉम्प्ट्स का उपयोग करके विशेषज्ञ परामर्श कार्यों पर डीप रिसर्च एजेंटों के मूल्यांकन के लिए एक कठोर बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल (Claude, o3, और Gemini) मतिभ्रम (hallucinations), अंकगणितीय त्रुटियों और असंगत तर्क जैसे विशिष्ट विफलता मोड के कारण समान रूप से निम्न स्वीकृति दर प्राप्त करते हैं।

मूल लेखक: Tanmay Asthana, Aman Saksena, Divyansh Sahu

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanmay Asthana, Aman Saksena, Divyansh Sahu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टीम को बहुत ही बुद्धिमान रिसर्च असिस्टेंट के रूप में काम पर रख रहे हैं जिन्हें एक जटिल काम करना है: उन्हें दस्तावेजों के ढेर को पढ़ना है, विशिष्ट नंबर खोजने हैं, गणित करना है, और एक CEO के लिए एक पेशेवर रिपोर्ट लिखनी है। यदि वे एक भी नंबर गलत करते हैं, तो CEO एक अरब डॉलर की गलती कर सकता है।

यह पेपर आज के तीन सबसे उन्नत AI रिसर्च असिस्टेंट्स (Claude, o3, और Gemini) के लिए एक कठोर जॉब इंटरव्यू की तरह है। Deccan AI Research के लेखकों ने यह देखना चाहा कि क्या ये AI वास्तव में वह विस्तृत, उच्च-दांव वाला काम कर सकते हैं जो मानव मैनेजमेंट कंसल्टेंट्स करते हैं, या वे केवल सरल सामान्य ज्ञान के प्रश्नों के उत्तर देने में अच्छे हैं।

यहाँ उनके प्रयोग का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. परीक्षण: एक "ट्रैप-भरे" बाधा दौड़ (Obstacle Course)

AI के पिछले अधिकांश परीक्षण ऐसे थे जैसे पूछना, "फ्रांस की राजधानी क्या है?" (तथ्यात्मक स्मरण)। यह परीक्षण अलग था। लेखकों ने वास्तविक कंसल्टिंग कार्य पर आधारित 42 जटिल परिदृश्य (scenarios) बनाए।

इन परिदृश्यों को AI को फंसाने के लिए डिज़ाइन किए गए एक सर्वाइवल कोर्स के रूप में सोचें, जिनमें "संज्ञानात्मक जाल" (cognitive traps) शामिल थे, जैसे:

  • "रेड हेरिंग" (भटकाने वाला) जाल: 100 पन्नों के टेक्स्ट वाली एक फाइल, लेकिन उत्तर पेज 98 पर एक छोटे से फुटनोट में छिपा है।
  • "विरोधाभास" का जाल: एक दस्तावेज़ कहता है कि कीमत 50है,लेकिनएकफुटनोटकहताहै,"जबतककियहमंगलवारनहो,तबयह50 है, लेकिन एक फुटनोट कहता है, "जब तक कि यह मंगलवार न हो, तब यह 60 है।"
  • "मैथ ट्रैप" (गणित का जाल): औसत (average) के लिए पूछना, लेकिन सही पद्धति के लिए 'वेटेड एवरेज' (weighted average) की आवश्यकता होती है (जैसे यह गणना करना कि आपके ग्रेड में प्रत्येक टेस्ट का कितना महत्व है)।

यदि कोई AI केवल सतह को छूकर निकल जाता या अनुमान लगा लेता, तो वह विफल हो जाता।

2. जज: ग्रेडिंग के दो स्तर

पेपर ने केवल AI को AI को ग्रेड करने नहीं दिया। उन्होंने एक दो-स्तरीय स्कोरिंग सिस्टम का उपयोग किया:

  • लेयर 1: रोबोट चेकर (वेरिफायर): ये सख्त, स्वचालित जांच हैं। क्या AI ने फाइल तैयार की? क्या इसने सही नंबरों का उपयोग किया? क्या इसने सही स्रोतों का हवाला दिया? यदि AI ने गणित के एक भी चरण में गलती की, तो यह लेयर उसे विफलता के रूप में चिह्नित करती।
  • लेयर 2: मानव विशेषज्ञ (SME): एक वास्तविक मानव कंसल्टेंट (15+ वर्षों के अनुभव वाला) ने AI की रिपोर्ट को पढ़ा। उन्होंने पांच चीजों पर ग्रेड दिया:
    • डेटा अखंडता (Data Integrity): क्या आपने तथ्य गढ़े?
    • विश्लेषणात्मक कठोरता (Analytical Rigor): क्या आपका तर्क सुसंगत है?
    • प्रासंगिकता (Relevance): क्या आपने प्रश्न का उत्तर दिया या केवल बड़बड़ाया?
    • निष्पादन (Execution): क्या आपने गणित सही किया?
    • फॉर्मेट (Format): क्या रिपोर्ट पेशेवर और उपयोगी है?

अंतिम स्कोर इन दोनों स्तरों को जोड़कर बनाया गया था। "पास" होने के लिए, एक AI को दोनों लेयर्स को पार करना था और मानव विशेषज्ञ को प्रभावित करना था।

3. परिणाम: "पास रेट" चौंकाने वाला रूप से कम था

126 कुल प्रयासों (42 कार्य × 3 AI) में से, लगभग कोई भी पास नहीं हुआ।

  • Gemini लगभग 21% बार पास हुआ।
  • Claude और o3 केवल 9.5% बार पास हुए।

दूसरे शब्दों में, यदि आप इनमें से किसी एक AI को एक मिलियन डॉलर के कंसल्टिंग प्रोजेक्ट के लिए काम पर रखते, तो उनके एक उपयोगी, सटीक रिपोर्ट देने में विफल होने की संभावना 79% से 90% थी।

4. प्रत्येक AI कैसे विफल हुआ (विफलता के "व्यक्तित्व")

पेपर में पाया गया कि प्रत्येक AI अपने अनूठे तरीके से विफल हुआ, जैसे तीन अलग-अलग छात्र एक कठिन परीक्षा दे रहे हों:

  • Claude (आत्मविश्वास से भरा बनावटी रचनाकार - The Confident Fabricator):

    • ताकत: यह वास्तव में अंतिम फाइलें (जैसे Word डॉक्स या Excel शीट) बनाने में सबसे अच्छा था। इसने शायद ही कभी असाइनमेंट जमा करना भुला।
    • कमजोरी: इसके झूठ बोलने की संभावना सबसे अधिक थी। जब इसे दस्तावेजों में उत्तर नहीं मिलता था, तो यह खाली जगह भरने के लिए आत्मविश्वास के साथ एक नंबर या स्रोत गढ़ देता था। यह उस छात्र की तरह था जिसने एक सुंदर निबंध तो लिखा लेकिन सभी तथ्य मनगढ़ंत बनाए।
  • o3 (सावधान लेकिन अनाड़ी गणितज्ञ - The Careful but Clumsy Mathematician):

    • ताकत: जब यह तर्क करता था, तो इसका तर्क अक्सर सबसे साफ होता था।
    • कमजोरी: यह अक्सर रिपोर्ट के आवश्यक अनुभागों को छोड़ देता था या कैस्केडिंग गणितीय त्रुटियां (एक गलती से होने वाली कई गलतियाँ) करता था। यदि इसने पहले चरण में गलती की, तो बाकी गणित गलत हो जाता था। इसने कभी-कभी फाइल बनाने के निर्देश को अनदेखा कर दिया और केवल एक टेक्स्ट उत्तर दे दिया।
  • Gemini (रोलरकोस्टर - The Rollercoaster):

    • ताकत: जब यह काम करता था, तो यह अक्सर सबसे अच्छा होता था। इसके "परफेक्ट" स्कोर की संख्या सबसे अधिक थी।
    • कमजोरी: यह अविश्वसनीय था। इसके "जीरो" स्कोर की संख्या सबसे अधिक थी। कभी-कभी यह क्रैश हो जाता, उत्तर देने से मना कर देता, या एक ऐसी फाइल बनाता जिसमें कोड टूटा हुआ होता। यह उस छात्र की तरह था जो या तो परीक्षा में टॉप करता या इतना बुरी तरह फेल होता कि वह परीक्षा में आता ही नहीं।

5. बड़ा निष्कर्ष

पेपर निष्कर्ष निकालता है कि हालांकि ये AI एजेंट प्रभावशाली हैं, लेकिन वे अभी उच्च-दांव वाले, निर्णय-आधारित कार्यों के लिए तैयार नहीं हैं।

यदि एक मानव कंसल्टेंट गलती करता है, तो वह आमतौर पर एक छोटी सी चूक होती है। यदि ये AI गलती करते हैं, तो यह अक्सर एक विनाशकारी विफलता होती है: वे एक फर्जी स्रोत गढ़ सकते हैं, सॉफ्टवेयर को क्रैश कर सकते हैं, या एक महत्वपूर्ण फुटनोट को मिस कर सकते हैं जो पूरे व्यावसायिक निर्णय को बदल देता है।

लेखक वर्तमान में इस परीक्षण का दूसरा, बड़ा संस्करण तैयार कर रहे हैं, लेकिन फिलहाल, संदेश स्पष्ट है: अभी इन AI को अपने कंपनी के अरबों डॉलर के निर्णयों पर भरोसा न करें। वे अभी भी विश्वसनीय शोधकर्ता बनने की प्रक्रिया में हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →