← नवीनतम पेपर
🤖 AI

AutoVerifier: An Agentic Automated Verification Framework Using Large Language Models

यह शोध पत्र AutoVerifier को प्रस्तुत करता है, जो एक LLM-आधारित एजेंटिक फ्रेमवर्क है जो दावों को संरचित ट्रिपल्स (triples) में विभाजित करके और उन्हें छह रीजनिंग परतों के माध्यम से विश्लेषण करके एंड-टू-एंड तकनीकी दावा सत्यापन को स्वचालित करता है, और मानवीय विशेषज्ञता की आवश्यकता के बिना जटिल वैज्ञानिक डोमेन में पद्धतिगत दोषों और हितों के टकराव की पहचान करने की अपनी क्षमता को सफलतापूर्वक प्रदर्शित करता है।

मूल लेखक: Yuntao Du, Minh Dinh, Kaiyuan Zhang, Ninghui Li

प्रकाशित 2026-04-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuntao Du, Minh Dinh, Kaiyuan Zhang, Ninghui Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल के बजाय, आप वैज्ञानिक शोध पत्रों (scientific papers) के एक पहाड़ को देख रहे हैं। ये पेपर दावा करते हैं कि उन्होंने "जादुई" नई तकनीकें खोज ली हैं—जैसे कि क्वांटम कंप्यूटर जो समस्याओं को तुरंत हल कर सकते हैं। समस्या क्या है? ये पेपर एक गुप्त कोड (जार्गन/तकनीकी शब्दावली) में लिखे गए हैं, ये अक्सर अपने निष्कर्षों को बढ़ा-चढ़ाकर पेश करते हैं, और कभी-कभी लेखकों का एक छिपा हुआ एजेंडा भी होता है (जैसे कि कोई उत्पाद बेचना)।

आजकल के अधिकांश AI टूल्स अति-उत्साही इंटर्न (over-eager interns) की तरह हैं। यदि आप उनसे पूछते हैं, "क्या यह सच है?" तो वे सारांश (abstract) पढ़ते हैं, उसमें "ब्रेकथ्रू" शब्द देखते हैं, और आत्मविश्वास से कहते हैं, "हाँ, यह अद्भुत है!" वे अक्सर बारीक विवरण, छूटे हुए डेटा, या इस तथ्य को मिस कर देते हैं कि लेखक उस तकनीक को बेचने वाली कंपनी का CEO भी है।

AutoVerifier अलग है। यह केवल एक इंटर्न नहीं है; यह AI एजेंटों से बना एक सुपर-डिटेक्टिव स्क्वाड (जासूसी दल) है। यह केवल पढ़ता नहीं है; यह जांच करता है, जिरह करता है, और एक केस फाइल तैयार करता है।

यहाँ बताया गया है कि AutoVerifier कैसे काम करता है, एक सरल कहानी के माध्यम से:

मिशन: "जादु적인" क्वांटम कंप्यूटर

टीम ने AutoVerifier का परीक्षण एक विशिष्ट पेपर पर किया जिसमें दावा किया गया था कि एक नया क्वांटम एल्गोरिदम (BF-DCQ-O) एक "रनटाइम क्वांटम एडवांटेज" था। सरल भाषा में, पेपर ने दावा किया: "हमारे क्वांटम कंप्यूटर ने एक सामान्य कंप्यूटर की तुलना में एक पहेली को 80 गुना तेजी से हल किया!"

टीम को क्वांटम भौतिकी का शून्य ज्ञान था। उन्हें विशेषज्ञों होने की आवश्यकता नहीं थी क्योंकि AutoVerifier भारी काम खुद करता है। यहाँ 6-चरणीय जांच प्रक्रिया दी गई है:

लेयर 1: साक्ष्य जुटाना (लाइब्रेरी)

कल्पना कीजिए कि एक जासूस मामले से संबंधित हर संभव दस्तावेज़ इकट्ठा कर रहा है। AutoVerifier केवल मुख्य पेपर को नहीं देखता; यह पेटेंट, लेखक प्रोफाइल और अन्य शोध पत्रों की तलाश करता है। यह उन्हें एक खोजने योग्य डिजिटल लाइब्रेरी में व्यवस्थित करता है, बिखरे हुए PDF को साफ, खोजने योग्य टेक्स्ट में बदल देता है और चार्ट और ग्राफ को भी समझ लेता है।

लेyer 2: इसे टुकड़ों में तोड़ना (लेगो ब्लॉक्स)

पेपर को एक बड़े टेक्स्ट ब्लॉक के रूप में पढ़ने के बजाय, AutoVerifier हर वाक्य को "क्लेम ट्रिपल्स" (Claim Triples) नामक छोटे लेगो ब्लॉक्स में तोड़ देता है।

  • विषय (Subject): एल्गोरिदम (BF-DCQ-O)
  • क्रिया (Predicate): को हराता है (Beats)
  • वस्तु (Object): क्लासिकल कंप्यूटर (SA)
    यह प्रत्येक ब्लॉक को एक "ट्रस्ट स्कोर" के साथ भी टैग करता है। क्या यह एक वास्तविक प्रयोग पर आधारित तथ्य है? या यह केवल लेखक का अनुमान है?

लेयर 3: आंतरिक ऑडिट (झूठ की जाँच करना)

अब, जासूस पेपर की स्वयं के विरुद्ध जाँच करता है।

  • जाल: पेपर का सारांश कहता है, "हम 80 गुना तेज़ हैं!"
  • वास्तविकता: विस्तृत गणित अनुभाग कहता है, "हमने केवल एक विशिष्ट, आसान पहेली का परीक्षण किया, और हमने कंप्यूटर को सेटअप करने में लगने वाले समय को अनदेखा कर दिया।"
    AutoVerifier इसे पकड़ लेता है। यह "80 गुना तेज़" के दावे को एक ओवरक्लेम (Overclaim) के रूप में फ्लैग करता है क्योंकि पेपर के भीतर का साक्ष्य वास्तव में इतने बड़े नंबर का समर्थन नहीं करता है। यह वैसा ही है जैसे एक कार सेल्समैन कहता है, "यह कार 200 मील प्रति घंटे की रफ्तार से चलती है!" लेकिन बारीक अक्षरों में लिखा है, "केवल तभी जब आप इसे ढलान पर हवा रहित दिन में चलाएं।"

लेयर 4: क्रॉस-एग्जामिनेशन (अन्य गवाहों को बुलाना)

जासूस एक गवाह पर नहीं रुकता। AutoVerifier यह देखने के लिए अन्य वैज्ञानिकों को बुलाता है कि क्या वे सहमत हैं।

  • संघर्ष: अन्य स्वतंत्र प्रयोगशालाओं ने उसी परीक्षण को चलाने की कोशिश की। उन्होंने कहा, "नहीं, जब हम सेटअप समय को शामिल करते हैं, तो स्पीडअप गायब हो जाता है।"
  • "BF-Null" टेस्ट: एक प्रतिद्वंद्वी कंपनी (D-Wave) ने एक परीक्षण किया जहाँ उन्होंने "क्वांटम" वाले हिस्से को पूरी तरह से हटा दिया और बस एक साधारण क्लासिकल ट्रिक का उपयोग किया। आश्चर्यजनक रूप से, यह उतना ही अच्छा काम कर गया! इससे साबित हुआ कि "क्वांटम" वाला हिस्सा शायद कोई बड़ा काम नहीं कर रहा था।
    AutoVerifier को समझ आता है कि मूल पेपर ने केवल सबसे अच्छे परिणामों को चुना और विफलताओं को अनदेखा कर दिया।

लेयर 5: बैकग्राउंड चेक (छिपे हुए इरादे)

यह सबसे रचनात्मक हिस्सा है। AutoVerifier विज्ञान की दुनिया से बाहर देखता है।

  • हितों का टकराव (Conflict of Interest): यह पता लगाता है कि इस एल्गोरिदम को बेचने वाली कंपनी के संस्थापक ही इस पेपर के लेखक हैं।
  • समयरेखा (Timeline): कंपनी ने इस "ब्रेकथ्रू" का दावा करने वाले पेपर के प्रकाशित होने से दो महीने पहले ही उत्पाद को बाजार में लॉन्च कर दिया था।
  • IBM वेब: इसे पता चलता है कि IBM (जिसने कंप्यूटर हार्डवेयर प्रदान किया) तुलना के लिए उपयोग किए जाने वाले सॉफ्टवेयर का स्वामित्व भी रखता है और पेपर लिखने में भी मदद की थी।
    यह ऐसा है जैसे यह महसूस करना कि कार सेल्समैन ही मैकेनिक, बीमा एजेंट और जज भी है। AutoVerifier इसे एक बड़े हितों के टकराव (Conflict of Interest) के रूप में फ्लैग करता है।

लेयर 6: अंतिम निर्णय (रिपोर्ट)

अंत में, AutoVerifier सभी टुकड़ों को एक "हाइपोथीसिस मैट्रिक्स" में जोड़ता है। यह केवल "सत्य" या "असत्य" नहीं कहता। यह कहता है:

  • क्या तकनीक काम करती है? हाँ, कंप्यूटर कोड चलाता है (सत्य)।
  • क्या यह एक चमत्कार है? नहीं। "80x स्पीडअप" संभवतः एक हैलुसिनेशन (भ्रम) है (एक गलती या अतिशयोक्ति) जो खराब गणित और छिपे हुए इरादों के कारण हुआ है।
  • असली कहानी: यह एक अच्छा हाइब्रिड टूल है, लेकिन यह वह क्रांतिकारी ब्रेकथ्रू नहीं है जिसका पेपर दावा कर रहा था।

यह क्यों महत्वपूर्ण है

अतीत में, यदि आप जानना चाहते थे कि एक नई तकनीक का दावा वास्तविक है या नहीं, तो आपको उस विशिष्ट क्षेत्र में पीएचडी की आवश्यकता होती थी। यदि आपके पास वह नहीं था, तो आपको लेखकों पर भरोसा करना पड़ता था।

AutoVerifier खेल बदल देता है। यह एक यूनिवर्सल ट्रांसलेटर और फैक्ट-चेकर की तरह कार्य करता है। यह क्वांटम भौतिकी, जीव विज्ञान या AI के बारे में एक जटिल, तकनीकी शब्दावली से भरे पेपर को ले सकता है, और इसे इस तरह तोड़ सकता है कि एक सामान्य व्यक्ति (या एक बिजनेस लीडर) देख सके:

  1. वास्तव में क्या सिद्ध हुआ है।
  2. क्या केवल मार्केटिंग हाइप है।
  3. किसका छिपा हुआ एजेंडा है।

यह कच्चे, भ्रमित करने वाले दस्तावेजों को स्पष्ट, साक्ष्य-आधारित इंटेलिजेंस में बदल देता है, जिससे हमें वास्तविक वैज्ञानिक सफलताओं और "नकली दवा" (snake oil) के बिक्री के दावों के बीच अंतर करने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →