← नवीनतम पेपर
🤖 AI

From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

यह शोध पत्र ProFact को प्रस्तुत करता है, जो एक एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पृथक चरण अनुकूलन और निश्चित ह्यूरिस्टिक्स की सीमाओं को दूर करने के लिए प्रोसेस-अवेयर रिवॉर्ड्स के साथ एक एकीकृत नीति को प्रशिक्षित करके बहु-चरणीय तथ्य सत्यापन को एंड-टू-एंड अनुकूलित करता है।

मूल लेखक: Rongxin Yang, Shenghong He, Siyuan Zhu, Chao Yu

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rongxin Yang, Shenghong He, Siyuan Zhu, Chao Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक दावा (किसी व्यक्ति द्वारा कही गई बात) है और आपको यह पता लगाना है कि वह सत्य (True) है, असत्य (False) है, या निर्णय लेने के लिए पर्याप्त प्रमाण नहीं है (Enough Evidence)

अतीत में, AI जासूसों ने एक कठोर, पूर्व-लिखित चेकलिस्ट का पालन करके इसे हल करने की कोशिश की थी। वे दावे को प्रश्नों में तोड़ते थे, उत्तरों की तलाश करते थे, और फिर निर्णय का अनुमान लगाते थे। समस्या क्या थी? प्रत्येक चरण अलग-थलग होकर किया जाता था। प्रश्न लिखने वाले व्यक्ति ने उत्तर खोजने वाले व्यक्ति से बात नहीं की थी, और निर्णय लगाने वाले व्यक्ति को यह नहीं पता था कि दूसरों ने कितनी मेहनत की थी। यह एक रिले रेस की तरह था जहाँ धावक कभी भी बैटन (बैटन) को ठीक से पास नहीं कर पाते थे—वे बस अपने हिस्से की दौड़ पूरी करते थे और उम्मीद करते थे कि सब ठीक हो जाएगा।

ProFact एक नया तरीका है जिससे एक AI जासूस को "एजेंटिक रीइन्फोर्समेंट लर्निंग" (Agentic Reinment Learning) नामक विधि का उपयोग करके प्रशिक्षित किया जाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग करके बताया गया है:

1. "एक मस्तिष्क" वाला दृष्टिकोण (Unified Policy)

प्रश्न पूछने, साक्ष्य खोजने और अंतिम निर्णय लेने के लिए अलग-अलग विशेषज्ञों के बजाय, ProFact एक ही एकल AI मस्तिष्क को शुरू से अंत तक पूरा काम करने के लिए प्रशिक्षित करता है।

  • पुराना तरीका: एक फैक्ट्री असेंबली लाइन की कल्पना करें। कार्यकर्ता A एक हिस्सा बनाता है, कार्यकर्ता B उसे पेंट करता है, और कार्यकर्ता C उसे बॉक्स में पैक करता है। यदि बॉक्स बदसूरत है, तो कार्यकर्ता C को दोषी ठहराया जाता है, लेकिन कार्यकर्ता A और B को यह नहीं पता होता कि उन्होंने गलती की है।
  • ProFact का तरीका: एक मास्टर शेफ की कल्पना करें जो पूरा भोजन पका रहा है। यदि सूप बहुत नमकीन है, तो शेफ को तुरंत पता चल जाता है कि उन्होंने बहुत अधिक नमक डाला था। वे एक साथ काटने, मसाले डालने और पकाने के तरीके को समायोजित करना सीखते हैं क्योंकि वे पूरे व्यंजन के लिए जिम्मेदार हैं।

2. तत्काल फीडबैक देने वाला "कोच" (Process-Aware Rewards)

इन AI जासूसों को प्रशिक्षित करने में सबसे बड़ी चुनौती यह है कि "उत्तर कुंजी" (अंतिम सत्य) केवल बिल्कुल अंत में आती है। यदि AI अंतिम निर्णय गलत देता है, तो उसे यह नहीं पता चलता कि क्यों। क्या उसने गलत प्रश्न पूछे? क्या उसने गलत साक्ष्य खोजे? या क्या उसने अंत में केवल गलत अनुमान लगाया?

  • स्पार्स सिग्नल (Sparse Signal) की समस्या: यह एक वीडियो गेम खेलने जैसा है जहाँ आपको केवल अंत में "गेम ओवर" स्क्रीन मिलती है। आपको यह नहीं पता होता कि आप इसलिए हारे क्योंकि आपने बहुत जल्दी कूदने की कोशिश की, कोई पावर-अप मिस कर दिया, या किसी दीवार से टकरा गए।
  • ProFact का समाधान: शोधकर्ताओं ने AI को एक कोच दिया जो हर कदम पर फीडबैक फुसफुसाता है।
    • चरण 1 (प्रश्न पूछना): कोच कहता है, "उस बड़े दावे को छोटे, स्पष्ट प्रश्नों में तोड़ने के लिए बहुत बढ़िया!" (प्रश्न की गुणवत्ता के लिए इनाम)।
    • चरण 2 (साक्ष्य खोजना): कोच कहता है, "बहुत अच्छे! आपने वही सटीक दस्तावेज़ ढूँढ लिया जो आपके तर्क को सिद्ध करता है।" (साक्ष्य की सटीकता के लिए इनाम)।
    • चरण 3 (निर्णय): कोच कहता है, "सही! आपने सत्य का अनुमान लगाया।" (अंतिम सटीकता के लिए इनाम)।

यह एक अस्पष्ट "गेम ओवर" को एक विस्तृत स्कोरकार्ड में बदल देता है, जिससे AI यह सीख पाता है कि किन चालों ने सफलता दिलाई और किन चालों ने विफलता।

3. परीक्षण और त्रुटि से सीखना (Reinforcement Learning)

बेहतरीन होने के लिए, AI केवल किताब नहीं पढ़ता; वह हज़ारों बार खेल खेलता है।

  • यह दावे को तोड़ने के विभिन्न तरीकों को आजमाता है।
  • यह साक्ष्य खोजने के विभिन्न तरीकों को आजमाता है।
  • यह अपने विभिन्न प्रयासों की तुलना करता है (जैसे छात्रों का एक समूह एक ही परीक्षा दे रहा हो)। यदि एक छात्र बेहतर स्कोर प्राप्त करता है, तो AI उस छात्र की रणनीति को कॉपी करना सीख जाता है।

परिणाम: तेज़ और स्मार्ट

जब शोधकर्ताओं ने ProFact का परीक्षण किया, तो उन्होंने दो प्रमुख जीत देखीं:

  1. बेहतर सटीकता: AI सत्य का पता लगाने में बहुत बेहतर हो गया क्योंकि इसने अपने चरणों को पूरी तरह से समन्वयित करना सीख लिया। इसने केवल अनुमान नहीं लगाया; इसने एक ठोस मामला बनाया।
  2. तेज़ और सस्ता: आश्चर्यजनक रूप से, ProFact पुराने तरीकों की तुलना में तेज़ भी था और इसने कम कंप्यूटिंग पावर का उपयोग किया। क्योंकि इसने एक अधिक कुशल रणनीति सीखी, इसने अनावश्यक प्रश्न पूछने या अप्रासंगिक दस्तावेज़ पढ़ने में समय बर्बाद नहीं किया। इसने एक लीन (lean) और कुशल जासूस बनना सीख लिया।

सारांश

संक्षेप में, ProFact तथ्य-जांच (fact-checking) की अराजक प्रक्रिया को एक सुचारू, समन्वित नृत्य में बदल देता है। AI को एक "कोच" देकर जो न केवल अंत में बल्कि हर कदम पर उसकी प्रशंसा या सुधार करता है, AI बेहतर प्रश्न पूछना, बेहतर साक्ष्य खोजना और अधिक सटीक निर्णय लेना सीखता है, और वह भी पहले की तुलना में तेज़ी से।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →