← नवीनतम पेपर
🤖 AI

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

यह शोध पत्र 'रिसर्च गैप इन्फरेंस' नामक एक नवीन प्रक्रिया-स्तरीय फीडबैक पद्धति का उपयोग करते हुए डीप रिसर्च एजेंटों के लिए एक मल्टी-टर्न मूल्यांकन ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि लक्षित फीडबैक का एक एकल दौर रिपोर्ट की गुणवत्ता में महत्वपूर्ण सुधार करता है, लेकिन आगामी टर्न (turns) लाभों को संचित करने में विफल रहते हैं क्योंकि एजेंट पहले से संतुष्ट मानदंडों पर वापस जाने लगते हैं, जो यह संकेत देता है कि विश्वसनीय मल्टी-टर्न सुधार वर्तमान आर्किटेक्चर के लिए अभी भी पहुंच से बाहर है।

मूल लेखक: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक जटिल विषय पर विस्तृत रिपोर्ट लिखने के लिए विशेषज्ञों की एक टीम (जिन्हें डीप रिसर्च एजेंट कहा जाता है) को काम पर रखा है, जैसे कि "डीपफेक तकनीक का इतिहास" या "किसी विशिष्ट कंपनी का वित्तीय स्वास्थ्य।"

आमतौर पर, हम इन सहायकों का परीक्षण एक प्रश्न देकर, उन्हें एक ड्राफ्ट लिखने देकर और फिर उस एकल ड्राफ्ट को ग्रेड देकर करते हैं। लेकिन असल जिंदगी में, यदि आपको किसी मानव शोधकर्ता से एक ड्राफ्ट मिलता है, तो आप शायद ही कभी उसे सीधे स्वीकार करते हैं। आप उन्हें फीडबैक देते हैं जैसे, "आपने कुछ प्रमुख कानूनों को छोड़ दिया है," या "आपके स्रोत बहुत अस्पष्ट हैं," और उनसे उसे फिर से लिखने के लिए कहते हैं।

यह शोध पत्र पूछता है: क्या ये AI सहायक वास्तव में फीडबैक मिलने पर बेहतर हो सकते हैं, या क्या वे अपने काम को ठीक करने की कोशिश में सब कुछ गड़बड़ कर देते हैं?

शोधकर्ताओं ने इसे फीडबैक देने के दो अलग-अलग तरीकों का उपयोग करके परखा:

1. "सेल्फ-रिफ्लेक्शन" टेस्ट (द ब्लाइंडफोल्डेड एडिटर - आँखों पर पट्टी बांधा हुआ संपादक)

इस परिदृश्य में, AI को कहा जाता है: "अपनी रिपोर्ट देखो, अपनी गलतियाँ ढूँढो और उन्हें ठीक करो।" यहाँ बाहर से कोई मदद नहीं दी जाती।

  • परिणाम: यह एक छात्र को अपने निबंध को खुद ग्रेड करने के लिए कहने जैसा था, बिना किसी शिक्षक की उत्तर कुंजी के। AI ने पूरी कोशिश की, वेब पर अधिक खोजा और अधिक स्रोतों को पढ़ा, लेकिन वह यह समझ ही नहीं पाया कि वास्तव में कमी कहाँ थी।
  • उपमा: कल्पना कीजिए कि आप आँखों पर पट्टी बांधकर एक लीक होती नाव को ठीक करने की कोशिश कर रहे हैं। आप लकड़ी पर हथौड़ा मारेंगे और अधिक तख्ते जोड़ेंगे (अधिक काम करेंगे), लेकिन क्योंकि आप छेद नहीं देख पा रहे हैं, इसलिए आप गलती से किसी दूसरे स्थान पर छेद कर सकते हैं। परिणाम? नाव अभी भी लीक हो रही है, या शायद अब और भी ज्यादा लीक हो रही है। AI का स्कोर या तो लगभग वैसा ही रहा, या कभी-कभी और खराब हो गया।

2. "प्रोसेस-लेवल फीडबैक" टेस्ट (द स्ट्रैटेजिक कोच - रणनीतिक कोच)

यहाँ, शोधकर्ताओं ने केवल यह नहीं कहा कि "इसे ठीक करो।" उन्होंने RGI (रिसर्च गैप इन्फरेंस) नामक एक विशेष टूल का उपयोग किया। इस टूल ने AI की रिपोर्ट और ग्रेडिंग रूब्रिक (मानदंडों) को देखकर यह पता लगाया कि AI कहाँ विफल हुआ।

केवल "X के बारे में एक तथ्य जोड़ें" कहने के बजाय, फीडबैक एक कोच की तरह था जो कहता है: "आप गलत प्रकार के स्रोतों को देख रहे हैं," या "आप इस विषय को बहुत व्यापक रूप से ले रहे हैं और आपको विशिष्ट विवरणों में गहराई तक जाने की आवश्यकता है," या "आप सबसे महत्वपूर्ण कानूनी दस्तावेजों को भूल गए हैं।"

  • परिणाम: सुधार के पहले दौर के लिए यह चमत्कार की तरह काम कर गया। AI रणनीति को समझ गया, वह वापस लाइब्रेरी गया, सही किताबें ढूँढ निकालीं और एक बहुत बेहतर रिपोर्ट लिखी। उनके स्कोर में उल्लेखनीय वृद्धि हुई (लगभग 8 से 15 अंक)।
  • उपमा: यह एक कोच की तरह है जो धावक को बताता है, "तुम्हारी ऊर्जा खत्म नहीं हो रही है; तुम्हारे जूते गलत साइज के हैं।" एक बार जब AI को सही जूते मिल गए (सही शोध रणनीति मिली), तो वह बहुत तेजी से और बेहतर तरीके से दौड़ा।

पेच: "रीराइट" (फिर से लिखने) की समस्या

इसके बाद शोधकर्ताओं ने AI को इसे दोबारा करने के लिए कहा (तीसरा दौर)। उन्हें उम्मीद थी कि स्कोर लगातार बेहतर होता जाएगा।

  • परिणाम: अधिकांश AI मॉडलों के लिए, सुधार रुक गया। वास्तव में, जब उन्होंने शेष छोटी समस्याओं को ठीक करने की कोशिश की, तो उन्होंने अनजाने में उन हिस्सों को भी बिगाड़ दिया जो पहले से ही सही काम कर रहे थे।
  • उपमा: कल्पना कीजिए कि एक शेफ एक बेहतरीन सूप बनाता है। कोच कहता है, "एक चुटकी नमक डालें।" शेफ नमक डालता है, और सूप एकदम सही हो जाता है। लेकिन फिर कोच कहता है, "अब, सजावट (गार्निश) को ठीक करो।" शेफ, पूर्णता पाने की कोशिश में, पूरे बर्तन को फेंक देता है और शून्य से शुरुआत करता है। इस प्रक्रिया में, वे वह नमक भी भूल जाते हैं जो उन्होंने अभी डाला था, या वे उन सब्जियों को बिगाड़ देते हैं जिन्हें उन्होंने पहली बार में सही बनाया था।
  • क्यों? इस अध्ययन में उपयोग किए गए AI मॉडल हर बार "पूरी रिपोर्ट को शून्य से फिर से लिखकर" काम करते हैं। उनके पास यह याद रखने की क्षमता नहीं होती कि "पिछली बार क्या अच्छा था।" इसलिए, जब वे एक चीज़ को ठीक करने की कोशिश करते हैं, तो वे अक्सर उन चीजों को खो देते हैं जिन्हें वे पहले ही ठीक कर चुके थे।

एक अपवाद: "केयरफुल" (सावधान) मॉडल

एक विशिष्ट AI मॉडल (DeepSeek-V4-Flash) अलग व्यवहार करता है। उसने पूरा बर्तन नहीं फेंका। उसने अधिकांश अच्छी चीज़ों को बरकरार रखा और बस नए घटक जोड़े। इसने तीसरे दौर में अपने स्कोर में फिर से सुधार किया।

  • लागत: हालाँकि, यह "सावधान" मॉडल अविश्वसनीय रूप से महंगा और धीमा था। इसने अन्य मॉडलों की तुलना में लगभग 4 गुना अधिक कंप्यूटर पावर का उपयोग किया और सोचने में बहुत अधिक समय लिया। यह एक ऐसे शेफ की तरह था जो कुछ भी फेंकने से इनकार करता है और हर एक सामग्री की बारीकी से जाँच करता है, जिसमें बहुत समय लगता है और भारी खर्च आता है।

मुख्य निष्कर्ष (The Bottom Line)

  1. AI खुद को ठीक नहीं कर सकता: यदि आप AI को "अपनी गलतियाँ सुधारो" कहते हैं, तो वह आमतौर पर चीजों को और खराब कर देता है या वैसा ही रहता है क्योंकि वह बड़ी तस्वीर (Big Picture) नहीं देख पाता।
  2. रणनीतिक फीडबैक काम करता है: यदि आप AI को कैसे शोध करना है (जैसे, "ब्लॉग पोस्ट के बजाय आधिकारिक दस्तावेज़ खोजें"), तो वह एक बहुत बेहतर रिपोर्ट लिख सकता है।
  3. "फुल रीराइट" की खामी: वर्तमान AI शोध उपकरण उन कलाकारों की तरह हैं जो हर बार नया स्ट्रोक लगाने के लिए अपना पूरा कैनवास मिटा देते हैं। यह उन्हें एक रिपोर्ट को स्टेप-बाय-स्टेप सुधारने में बहुत कठिन बना देता है क्योंकि वे अनजाने में अच्छे हिस्सों को भी हटा देते हैं। वास्तव में विश्वसनीय, बहु-चरणीय सुधार प्राप्त करने के लिए, हमें ऐसे AI की आवश्यकता है जो याद रख सके कि उसने क्या सही किया था और केवल उसी को बदले जिसकी आवश्यकता है, न कि हर बार शून्य से शुरू करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →