← नवीनतम पेपर
🤖 AI

Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward

यह शोध पत्र InfoReasoner को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो मैन्युअल एनोटेशन के बिना नीति प्रशिक्षण (policy training) को निर्देशित करने के लिए आउटपुट वितरण से प्राप्त सैद्धांतिक रूप से आधारित, सिंथेटिक सिमेंटिक सूचना लाभ (synthetic semantic information gain) पुरस्कार का उपयोग करके रिट्रीवल के साथ एजेंटिक रीजनिंग को अनुकूलित करता है, जिससे कई बेंचमार्क में महत्वपूर्ण सटीकता सुधार प्राप्त होते हैं।

मूल लेखक: Senkang Hu, Yong Dai, Yuzhi Zhao, Yihang Tao, Yu Guo, Zhengru Fang, Sam Tak Wu Kwong, Yuguang Fang

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Senkang Hu, Yong Dai, Yuzhi Zhao, Yihang Tao, Yu Guo, Zhengru Fang, Sam Tak Wu Kwong, Yuguang Fang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही पेचीदा पहेली को सुलझाने की कोशिश कर रहे हैं। आपके पास एक सुपर-स्मार्ट दोस्त (AI) है जो बहुत कुछ जानता है, लेकिन कभी-कभी वे अटक जाते हैं या गलत अनुमान लगा लेते हैं क्योंकि उनके पास सभी तथ्य नहीं होते। आमतौर पर, जब यह दोस्त मदद मांगता है (जानकारी प्राप्त करता है), तो हम उन्हें केवल अंत में "अच्छा काम किया!" या "फिर से कोशिश करो" कहते हैं, जब पहेली सुलझ जाती है। यह एक खेल खेलने जैसा है जहाँ आपको केवल फिनिश लाइन पर स्कोर मिलता है, जिससे रास्ते में बेहतर तरीके से खेलना सीखना मुश्किल हो जाता है।

यह पेपर इन AI दोस्तों को मदद मांगने में बेहतर बनने का एक नया तरीका सिखाने के बारे में है। वे अपने नए सिस्टम को InfoReasoner कहते हैं।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "मौन" खोज (The "Silent" Search)

पुराने तरीके में, यदि AI ने सर्च इंजन से एक प्रश्न पूछा और उसे एक बेकार उत्तर मिला, तो उसे तब तक पता नहीं चलता था कि उसने गलती की है जब तक कि वह अंतिम परीक्षण में विफल नहीं हो जाता। यह एक जासूस की तरह था जो एक सुराग देखता है, भ्रमित होता है, लेकिन उसे तब तक पता नहीं चलता कि वह भ्रमित है जब तक कि मामला बंद नहीं हो जाता। AI को एक तरीके की आवश्यकता थी जिससे वह जान सके, "हे, उस आखिरी जानकारी ने वास्तव में मुझे चीजें समझने में मदद की," या "नहीं, इसने तो मुझे और भ्रमित कर दिया।"

2. समाधान: "भ्रम" को मापना (Measuring "Confusion")

लेखकों ने महसूस किया कि एक अच्छी खोज केवल सही उत्तर खोजने के बारे में नहीं है; यह भ्रम को कम करने के बारे में है।

कल्पना कीजिए कि आपका मन एक धुंधला कमरा है।

  • उच्च अनिश्चितता (High Uncertainty): कमरे में घना कोहरा है। आप कुछ भी स्पष्ट रूप से नहीं देख पा रहे हैं।
  • कम अनिश्चितता (Low Uncertainty): कोहरा छंट गया है, और आप उत्तर को स्पष्ट रूप से देख पा रहे हैं।

InfoReasoner का लक्ष्य AI को ऐसे सर्च क्वेरी चुनने के लिए प्रशिक्षित करना है जो कोहरे को हटा सकें। यदि कोई सर्च क्वेरी कोहरा साफ कर देती है, तो AI को इनाम मिलता है। यदि कोई सर्च क्वेरी कोहरा घना कर देती है (या उसे बदलती नहीं है), तो AI को दंड (penalty) मिलता है।

3. जादू का तरीका: "सिंथेटिक" पुरस्कार (The Magic Trick: "Synthetic" Rewards)

यहाँ पेचीदा बात यह है: आपको कैसे पता चलेगा कि कोहरा छंटा है यदि आप अभी तक उत्तर नहीं जानते?

आमतौर पर, आपको एक मानव शिक्षक की आवश्यकता होगी जो कहे, "हाँ, वह खोज मददगार थी।" लेकिन लेखक हर खोज को ग्रेड करने के लिए इंसानों को काम पर नहीं रखना चाहते थे। इसके बजाय, उन्होंने एक स्व-जांच प्रणाली (self-checking system) बनाई।

  • सिमुलेशन (The Simulation): AI पहेली के कई अलग-अलग संभावित उत्तर उत्पन्न करता है।
  • समूहीकरण (The Grouping): यह उन उत्तरों को एक साथ समूहित करता है। यदि वह कहता है "बैंड Buzzcocks है" और "यह बोलटन का पंक बैंड है," तो सिस्टम पहचान लेता है कि ये एक ही विचार हैं, बस अलग तरह से कहे गए हैं। यह उन्हें एक ही "बाल्टी" (bucket) में डाल देता है।
  • कोहरा मीटर (The Fog Meter): यह AI द्वारा विचार किए जा रहे विभिन्न "बाल्टियों" (विचारों) की गिनती करता है।
    • यदि AI 10 अलग-अलग, परस्पर विरोधी विचारों पर विचार कर रहा है, तो "कोहरा" घना है (उच्च अनिश्चितता)।
    • यदि AI मुख्य रूप से एक विशिष्ट विचार के प्रति आश्वस्त है, तो "कोहरा" पतला है (कम अनिश्चितता)।

पुरस्कार (The Reward): जब AI जानकारी के लिए खोज करता है, तो सिस्टम जाँचता है: क्या इस खोज ने AI की "बाल्टियों" को छोटा और अधिक केंद्रित बनाया?

  • हाँ? AI को "सिंथेटिक सिमेंटिक इंफॉर्मेशन गेन" पुरस्कार मिलता है (भ्रम कम करने के लिए एक गोल्ड स्टार)।
  • नहीं? AI को कम स्कोर मिलता है।

4. यह बेहतर क्यों है

इसे एक कुत्ते को प्रशिक्षित करने की तरह समझें।

  • पुराना तरीका: आप कुत्ते को इनाम तभी देते हैं जब वह अंततः फ्रिसबी पकड़ लेता है। यदि वह 10 मिनट तक गलत दिशा में दौड़ता है, तो उसे अंत तक पता नहीं चलता कि वह गलत था।
  • InfoReasoner तरीका: आप कुत्ते को हर बार एक ट्रीट देते हैं जब वह एक ऐसा कदम लेता है जो उसे फ्रिसबी के करीब ले जाता है, भले ही उसने अभी तक उसे पकड़ा न हो। यह कुत्ते को सिखाता है कि वह केवल अंतिम पकड़ के बारे में नहीं, बल्कि यह भी कि वह कैसे चलता है, कुशल और स्मार्ट बने।

5. परिणाम

इस पेपर ने सात अलग-अलग प्रकार की पहेलियों (प्रश्नों) और गणित की समस्याओं पर परीक्षण किया।

  • परिणाम: इस "कोहरा हटाने वाले" पुरस्कार के साथ प्रशिक्षित AI ने अन्य AI की तुलना में प्रश्नों के उत्तर देने में काफी बेहतर प्रदर्शन किया।
  • दक्षता (Efficiency): इसने अधिक संक्षिप्त होना भी सीखा। बिना सोचे-समझे इधर-उधर भटकने और बिना लक्ष्य के खोजने के बजाय, इसने कोहरा जल्दी साफ करने के लिए सही प्रश्न पूछना सीख लिया।

सारांश

InfoReasoner एक नया प्रशिक्षण तरीका है जो AI एजेंटों को यह सिखाता है कि सूचना का मूल्य इस आधार पर तय किया जाए कि वह उनके भ्रम को कितना कम करती है, न कि केवल अंतिम उत्तर के सही होने का इंतजार करने के आधार पर। यह एक चतुर "स्व-ग्रेडिंग" प्रणाली का उपयोग करता है ताकि AI को निरंतर फीडबैक मिल सके कि उसकी खोज कितनी मददगार है, जिससे यह अधिक स्मार्ट, तेज़ और सटीक तर्क प्रक्रिया की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →