← नवीनतम पेपर
🤖 AI

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो दृश्य सूचना प्राप्ति को पदानुक्रमित कार्यों और सघन पुरस्कारों के साथ एक अनुक्रमिक निर्णय लेने वाली समस्या के रूप में रूपित करके विजुअल RAG को उन्नत करता है, जिससे एक LVLM एजेंट को उत्कृष्ट जटिल तर्क के लिए मोटे दस्तावेज़ पुनर्प्राप्ति से लेकर सूक्ष्म-स्तरीय क्षेत्र क्रॉपिंग तक साक्ष्य को प्रगतिशील रूप से परिष्कृत करने में सक्षम बनाया जा सके।

मूल लेखक: Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Cewu Lu

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Cewu Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल रहस्य को सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आपके पास केवल एक सिंगल फाइल कैबिनेट नहीं है, बल्कि लाखों किताबों, चार्टों और रेखाचित्रों से भरी एक विशाल, अराजक लाइब्रेरी है। आपका लक्ष्य उस विशिष्ट साक्ष्य (एविडेंस) को खोजना है जो एक बहुत ही कठिन प्रश्न का उत्तर दे सके।

यह पेपर UniDoc-RL पेश करता है, जो एक नया "सुपर-डिटेक्टिव" AI है जिसे इस लाइब्रेरी में पिछले संस्करणों की तुलना में बहुत बेहतर तरीके से नेविगेट करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

समस्या: "अंधाधुंध खोज" (The "Blind Search")

पुराने AI सिस्टम जो विजुअल प्रश्नों (जैसे एक जटिल चार्ट या स्कैन की गई रिपोर्ट को पढ़ना) को हल करने की कोशिश करते हैं, वे अक्सर एक ऐसे व्यक्ति की तरह व्यवहार करते हैं जो आंखों पर पट्टी बांधकर भीड़ में चिल्ला रहा हो

  1. वे एक सर्च इंजन से "X के बारे में दस्तावेज़ों" के लिए पूछते हैं।
  2. इंजन उनके सामने कागजों का एक विशाल ढेर डाल देता है।
  3. AI एक साथ उस पूरे ढेर को पढ़ने की कोशिश करता है।
  4. क्योंकि वह ढेर शोर और अप्रासंगिक विवरणों से भरा होता है, AI भ्रमित हो जाता है, उस छोटे से सुराग को मिस कर देता है जिसकी उसे आवश्यकता थी, और गलत उत्तर देता है।

समाधान: UniDoc-RL (द "स्मार्ट डिटेक्टिव")

UniDoc-RL केवल पढ़ता नहीं है; यह एक मानव जासूस की तरह सोचता है, कार्य करता है और सीखता है। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक एक विशेष प्रशिक्षण पद्धति का उपयोग करता है (इसे एक वीडियो गेम की तरह समझें जहाँ AI को अच्छे मूव्स के लिए अंक मिलते हैं और बुरे मूव्स के लिए अंक कटते हैं)।

यह तीन मुख्य सुपरपावर्स का उपयोग करके इस समस्या को हल करता है:

1. "सर्च-सेलेक्ट-परसीव" रणनीति (कोर्स-टू-फाइन)

पूखी लाइब्रेरी को एक साथ पढ़ने के बजाय, UniDoc-RL "ज़ूम इन" करने का खेल खेलता है:

  • सर्च (The Net - जाल): सबसे पहले, यह संभावित दस्तावेजों की एक विस्तृत सूची पकड़ने के लिए एक बड़ा जाल फैलाता है। यह समुद्र में मछली के झुंड को पकड़ने के लिए मछली पकड़ने का जाल फेंकने जैसा है।
  • सेलेक्ट (The Filter - फ़िल्टर): इसके बाद, यह अपनी पकड़ को देखता है और कहता है, "ठीक है, यह मछली एक शार्क है (अप्रासंगिक), यह एक टूना है (शायद उपयोगी), लेकिन यह वह सुनहरा मछली है जिसकी हमें ज़रूरत है!" यह शोर को बाहर निकाल देता है और केवल सबसे प्रासंगिक दस्तावेज़ को रखता है।
  • परसीव (The Magnifying Glass - आवर्धक लेंस): अंत में, इसे एहसास होता है कि वह सुनहरी मछली छोटी और देखने में कठिन है। पूरी मछली को घूरने के बजाय, यह उस विशिष्ट स्केल या टेक्स्ट को देखने के लिए एक मैग्नीफाइंग ग्लास (क्रॉपिंग और ज़ूमिंग) का उपयोग करता है जो उत्तर रखता है।

सादृश्य (Analogy): कल्पना कीजिए कि आप 100 पन्नों के अनुबंध में एक विशिष्ट शब्द ढूंढ रहे हैं।

  • पुराना AI: हर पन्ने के हर एक शब्द को पढ़ता है, थक जाता है, और उस शब्द को मिस कर देता है।
  • UniDoc-RL: विषय सूची (Table of Contents) को सरसरी तौर से देखता है (Search), सही अध्याय पर कूदता है (Select), और फिर बारीक अक्षरों को पढ़ने के लिए विशिष्ट पैराग्राफ पर ज़ूम करता है (Perceive)।

2. "डेंस रिवॉर्ड" सिस्टम (The "Coach" - कोच)

अतीत में, AI प्रशिक्षण एक ऐसे खेल की तरह था जहाँ आपको खेल के अंत में केवल "जीत" या "हार" मिलती थी। यदि आप हार जाते थे, तो आपको यह नहीं पता चलता था कि कौन सा मूव गलत था। क्या आपने गलत चीज़ के लिए खोज की? क्या आपने गलत पन्ना चुना? या क्या आपने गलत जगह ज़ूम किया?

UniDoc-RL एक डेंस रिवॉर्ड (Dense Reward) सिस्टम पेश करता है। कल्पना कीजिए कि एक कोच खेल के दौरान AI के बगल में खड़ा है:

  • "सही अध्याय खोजने के लिए अच्छा काम किया!" (Selection के लिए रिवॉर्ड)।
  • "उस चार्ट पर बेहतरीन ज़ूम किया!" (Perception के लिए रिवॉर्ड)।
  • "ओह, आपने वहां प्रासंगिक वाक्य को मिस कर दिया।" (खराब क्रॉपिंग के लिए पेनल्टी)।

यह निरंतर, चरण-दर-चरण फीडबैक AI को यह सीखने में मदद करता है कि कैसे सोचना है, न कि केवल यह कि उत्तर क्या है।

3. "टीचर" डेटासेट

इस AI को सिखाने के लिए, शोधकर्ताओं ने इसे केवल प्रश्न नहीं दिए; उन्होंने परफेक्ट उदाहरणों की एक विशाल लाइब्रेरी बनाई। उन्होंने हजारों जासूसी मामलों को सिम्युलेट करने के लिए एक सुपर-स्मार्ट "टीचर AI" का उपयोग किया, जिसने दिखाया कि बिल्कुल कैसे सर्च करना, सेलेक्ट करना और ज़ूम करना चाहिए। UniDoc-RL ने फिर इन उदाहरणों पर अभ्यास किया, अपनी गलतियों से सीखा और तब तक अभ्यास किया जब तक कि वह एक मास्टर डिटेक्टिव नहीं बन गया।

परिणाम

कठिन बेंचमार्क (जैसे जटिल वैज्ञानिक चार्ट या कानूनी दस्तावेजों को पढ़ना) पर परीक्षण किए जाने पर, UniDoc-RL ने केवल थोड़ा बेहतर प्रदर्शन ही नहीं किया; इसने दबदबा बनाया। इसने पिछले सर्वश्रेष्ठ सिस्टमों को एक बड़े अंतर से पीछे छोड़ दिया (17.7% तक बेहतर)।

संक्षेप में: UniDoc-RL ने "पूरी लाइब्रेरी पर चिल्लाना" छोड़कर "सही पन्ने पर फुसफुसाने और फिर सही वाक्य पर ज़ूम करने" का हुनर सीखा। स्मार्ट सर्चिंग, सावधानीपूर्वक फ़िल्टरिंग और सक्रिय ज़ूमिंग को जोड़कर, जो एक सख्त कोच द्वारा निर्देशित है, यह उन विजुअल पहेलियों को हल करता है जो पहले कंप्यूटरों को उलझा देती थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →