← नवीनतम पेपर
🤖 AI

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

यह शोध पत्र DeepVerifier को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) ढांचा है जो एक नवीन विफलता वर्गीकरण (failure taxonomy) से प्राप्त रूब्रिक्स का उपयोग करके आउटपुट को पुनरावृत्तीय रूप से सत्यापित और परिष्कृत करके इन्फरेंस-टाइम स्केलिंग के माध्यम से डीप रिसर्च एजेंट्स को उन्नत करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के महत्वपूर्ण सटीकता लाभ प्राप्त होता है और ओपन-सोर्स प्रगति को समर्थन देने के लिए एक संबंधित डेटासेट जारी किया जाता है।

मूल लेखक: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी शोध सहायक है जिसका नाम "डीप रिसर्च एजेंट" (DRA) है। यह सहायक जानकारी खोजने, सैकड़ों वेबसाइटों को पढ़ने और रिपोर्ट लिखने में बहुत माहिर है। हालाँकि, किसी भी इंसान की तरह, इससे भी गलतियाँ हो सकती हैं: यह गलत वेबसाइट पढ़ सकता है, सवाल को गलत समझ सकता है, या आत्मविश्वास के साथ कोई ऐसा तथ्य बता सकता है जो सच नहीं है।

आमतौर पर, यदि आपका यह सहायक कोई गलती करता है, तो आपको उसे रोकना पड़ता है, उसे समझाना पड़ता है कि क्या गलत हुआ, और यह उम्मीद करनी पड़ती है कि अगली बार वह बेहतर करेगा। लेकिन क्या होगा अगर सहायक अपने काम को आपके देखने से पहले ही स्वयं जांच सके, अपनी गलतियों को ढूंढ सके और उन्हें तुरंत ठीक कर सके?

यही वह चीज़ है जिसे यह पेपर प्रस्तावित करता है। उन्होंने DeepVerifier नामक एक सिस्टम बनाया है जो इन AI एजेंटों के लिए एक "स्व-सुधार करने वाले संपादक" (self-correcting editor) के रूप में कार्य करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)

जब एक AI किसी कठिन समस्या को हल करने की कोशिश करता है (जैसे, "किसी विशिष्ट शोधकर्ता का सबसे प्रारंभिक प्रकाशन खोजें"), तो वह अक्सर चरणों के एक भूलभुलैया में खो जाता है। यदि आप एक मानक AI से पूछते हैं कि "जांचें कि क्या यह उत्तर सही है," तो वह अक्सर विफल हो जाता है क्योंकि एक जटिल उत्तर की जांच करना, समस्या को हल करने जितना ही कठिन होता है। यह एक छात्र से बिना किसी रूब्रिक (rubric) के अपने 50 पन्नों के निबंध को ग्रेड करने के लिए कहने जैसा है; वे सूक्ष्म गलतियों को मिस कर सकते हैं।

2. समाधान: "रूब्रिक" और "रबर स्टैम्प"

शोधकर्ताओं ने महसूस किया कि एक उत्तर की जांच करना वास्तव में एक उत्तर बनाने से आसान है। वे इसे "सत्यापन की विषमता" (asymmetry of verification) कहते हैं।

इसे काम करने के लिए, उन्होंने एक विफलता वर्गीकरण (Failure Taxonomy) बनाया। इसे एक विशाल चेकलिस्ट के रूप में समझें जिसमें AI के गलत होने के हर तरीके का विवरण है। उन्होंने हजारों पिछले गलतियों का विश्लेषण किया और उन्हें 5 मुख्य समूहों और 13 उप-समूहों में वर्गीकृत किया (जैसे, "गलत स्रोत का उपयोग किया," "निर्देशों को गलत पढ़ा," या "कोई तथ्य मनगढ़ंत बनाया")।

DeepVerifier इस चेकलिस्ट का उपयोग एक सख्त संपादक के रूप में करने के लिए करता है:

  • डीकंपोजर (The Decomposer): AI को पूरे बिखरे हुए रिपोर्ट को फिर से पढ़ने के लिए कहने के बजाय, यह मॉड्यूल समस्या को छोटे, सरल प्रश्नों में तोड़ देता है। "क्या पूरी रिपोर्ट सही है?" पूछने के बजाय, यह पूछता है, "क्या स्रोत X ने वास्तव में Y कहा था?" या "क्या नवीनतम रिपोर्ट में यह संख्या सही है?"
  • वेरिफायर (The Verifier): यह चेकलिस्ट का उपयोग करके इन छोटे सवालों के जवाब देता है।
  • जज (The Judge): यह एक स्कोर (1 से 4) और विशिष्ट फीडबैक देता है। यदि उत्तर गलत है, तो यह केवल "नहीं" नहीं कहता। यह कहता है, "आपने इस तथ्य के लिए गलत स्रोत का उपयोग किया है। वापस जाएं और मूल दस्तावेज़ खोजें।"

3. जादू: "टेस्ट टाइम" पर "स्व-विकसित" होना

सबसे दिलचस्प बात यह है कि यह सब AI के काम करते समय होता है, बिना AI के मस्तिष्क को फिर से प्रशिक्षित (retrain) किए (जो महंगा और धीमा है)।

कल्पना कीजिए कि AI एक उत्तर लिखता है। DeepVerifier उसे पढ़ता है, एक दोष ढूंढता है, और कहता है, "हे, तुमने यह विवरण छोड़ दिया।" AI फिर उस फीडबैक का उपयोग करके उत्तर को फिर से लिखता है। वे इसे एक लूप (संपादन के दौर की तरह) में करते हैं।

  • राउंड 1: AI उत्तर लिखता है।
  • राउंड 2: DeepVerifier त्रुटियां ढूंढता है, AI उन्हें ठीक करता है।
  • राउंड 3: DeepVerifier अधिक सूक्ष्म त्रुटियां ढूंढता है, AI फिर से ठीक करता है।

पेपर दिखाता है कि इस "स्व-संपादन" के कुछ दौरों के साथ, AI काफी स्मार्ट हो जाता है। कठिन परीक्षणों (जैसे GAIA बेंचमार्क) पर, AI की सटीकता 8% से 11% बढ़ गई। यह एक ऐसे AI के लिए एक बड़ी छलांग है जिसे फिर से प्रशिक्षित नहीं किया गया, बल्कि केवल अपने काम को जांचने का एक बेहतर तरीका दिया गया।

4. समुदाय को उपहार: "DeepVerifier-4K"

शोधकर्ताओं ने इस तकनीक को केवल अपने तक सीमित नहीं रखा। उन्होंने महसूस किया कि ओपन-सोर्स AI मॉडल (मुफ्त वाले) को इस स्व-जांच में कुशल होने के लिए अभ्यास की आवश्यकता है।

इसलिए, उन्होंने DeepVerifier-4K नामक एक डेटासेट बनाया। इसे एक "प्रशिक्षण मैनुअल" के रूप में समझें जिसमें इसके उदाहरण शामिल हैं:

  • एक AI द्वारा की गई गलती।
  • "संपादक" (DeepVerifier) द्वारा चेकलिस्ट का उपयोग करके ठीक से बताया गया कि क्या गलत हुआ।
  • AI द्वारा गलती को सुधारना।

उन्होंने इस मैनुअल का उपयोग ओपन-सोर्स मॉडल को अपने स्वयं के संपादक बनने के लिए सिखाने के लिए किया। परिणाम? ये ओपन मॉडल तर्क करने और अपनी गलतियों को पकड़ने में बहुत बेहतर हो गए, जिससे उन्होंने महंगे, क्लोज्ड-सोर्स मॉडल के बीच के अंतर को कम कर दिया।

सारांश

संक्षेप में, यह पेपर AI एजेंटों को अपना काम जमा करने से पहले रुकने और सोचने की शिक्षा देता है। बड़ी समस्याओं को छोटे, जांच योग्य तथ्यों में तोड़कर और सामान्य गलतियों की एक सख्त चेकलिस्ट का उपयोग करके, AI वास्तविक समय में स्व-सुधार (self-correct) कर सकता है। यह AI को एक दर्पण और एक नियम पुस्तिका देने जैसा है, जिससे वह बिना किसी शिक्षक द्वारा फिर से प्रशिक्षित किए, तुरंत अपने उत्तरों को विकसित और बेहतर बना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →