← नवीनतम पेपर
💬 NLP

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report एक हल्का, स्थानीय डीप रिसर्च सिस्टम है जो मानव-समान "Writing As Reasoning" पॉलिसी का लाभ उठाता है, जो ड्राफ्टिंग और गहन शोध (deepening) को गतिशील रूप से आपस में जोड़ता है, जिससे छोटे 8B-पैरामीटर वाले मॉडल अंतर्दृष्टिपूर्ण रिपोर्ट तैयार करने में अग्रणी क्लोज्ड-सोर्स सिस्टम्स से भी बेहतर प्रदर्शन करने में सक्षम होते हैं।

मूल लेखक: Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "कठोर ब्लूप्रिंट" का जाल

कल्पना कीजिए कि आपसे किसी ऐसे विषय पर 50 पन्नों का एक विशाल विश्वकोश (encyclopedia) लिखने के लिए कहा गया है जिसके बारे में आप बहुत कम जानते हैं, जैसे कि "AI का भविष्य"।

अधिकांश वर्तमान AI सिस्टम एक कठोर आर्किटेक्ट (architect) की तरह काम करते हैं। एक भी शब्द लिखने से पहले, वे पूरी इमारत का एक सटीक, विस्तृत ब्लूप्रिंट (नक्शा) बनाने की कोशिश करते हैं। वे यह तय कर लेते हैं कि हर कमरा कैसा दिखेगा, इससे पहले कि वे पहली ईंट भी रखें।

  • दोष: यदि आर्किटेक्ट ब्लूप्रिंट बनाने में कोई गलती करता है (जो सब कुछ जाने बिना पूर्णता के साथ करना कठिन है), तो पूरी इमारत बर्बाद हो जाती है। निर्माण शुरू होने के बाद वे योजना को आसानी से बदल नहीं सकते।
  • परिणाम: एक अच्छा ब्लूप्रिंट बनाने के लिए, आपको एक जीनियस आर्किटेक्ट की आवश्यकता होती है (एक विशाल, महंगा, क्लोज्ड-सोर्स AI)। यदि आप एक छोटे, सस्ते AI का उपयोग करते हैं, तो ब्लूप्रिंट आमतौर पर खराब होता है, और अंतिम रिपोर्ट सतही और उबाऊ होती है।

समाधान: "मूर्तिकार" दृष्टिकोण

इस शोध पत्र के लेखकों ने एक नया सिस्टम बनाया है जिसे AgentCPM-Report कहा जाता है। एक आर्किटेक्ट के बजाय, वे AI के साथ एक मूर्तिकार (sculptor) की तरह व्यवहार करते हैं।

एक मूर्तिकार पहले से ही मूर्ति के हर घुमाव की योजना नहीं बनाता। वे पत्थर के एक खुरदरे टुकड़े (एक साधारण रूपरेखा) से शुरुआत करते हैं, कुछ हिस्सों को तराशते हैं, आकार को देखते हैं, और फिर महसूस करते हैं, "ओह, मैंने इस विवरण के बारे में नहीं सोचा था; मुझे यहाँ और गहराई से खुदाई करने की आवश्यकता है।" वे काम करते समय अपनी योजना बदलते रहते हैं।

इसे WARP (Writing As Reasoning Policy) कहा जाता है। इसका अर्थ है कि लिखना ही सोचने की प्रक्रिया है। AI एक अनुभाग लिखता है, महसूस करता है कि यह बहुत सतही है, रुकता है, अधिक जानकारी खोजने के लिए जाता है, योजना को अपडेट करता है, और फिर से लिखता है।

यह कैसे काम करता है: दो चरणों वाला नृत्य

AI दो मोड के बीच बारी-बारी से बदलता है, जैसे एक डांसर अपने स्टेप्स बदलता है:

  1. साक्ष्य-आधारित ड्राफ्टिंग (लेखक/Scribe): AI रूपरेखा के एक हिस्से को चुनता है, तथ्यों के लिए इंटरनेट खोजता है, और एक पैराग्राफ लिखता है। यह एक लेखक की तरह है जो जो पाया है उसे लिख रहा है।
  2. तर्क-संचालित गहनता (जासूस/Detective): लिखने के बाद, AI पीछे हटता है और पूछता है, "क्या यह काफी अच्छा है? क्या मैंने कुछ छोड़ दिया है?"
    • यदि उत्तर नहीं है, तो वह एक जासूस की तरह कार्य करता है। वह कहानी में एक कमी ढूंढता है, उस अनुभाग को छोटे, अधिक विशिष्ट प्रश्नों में तोड़ता है, और रूपरेखा को अपडेट करता है।
    • यदि उत्तर हाँ है, तो वह आगे बढ़ जाता है।

यह लूप AI को लिखने की प्रक्रिया के दौरान ही नए विचारों को खोजने की अनुमति देता है, बजाय इसके कि वह शुरुआत में एक खराब योजना में फंसा रहे।

प्रशिक्षण: एक छोटे कुत्ते को शिकार करना सिखाना

यह पेपर एक अपेक्षाकृत छोटे AI मॉडल (केवल 8 बिलियन पैरामीटर्स, जो AI की दुनिया में "छोटा" है) का उपयोग करता है। आमतौर पर, छोटे मॉडल जटिल योजना बनाने में खराब होते हैं। इसे ठीक करने के लिए, टीम ने एक बहु-चरणीय प्रशिक्षण रणनीति (Multi-Stage Training Strategy) का उपयोग किया:

  1. कोल्ड स्टार्ट (बुनियादी बातें): उन्होंने AI को वर्णमाला सिखाई। इसने सीखा कि कैसे खोज की जाती है, कैसे एक वाक्य लिखा जाता है, और कैसे बुनियादी नियमों का पालन किया जाता है।
  2. एटॉमिक स्किल RL (अभ्यास): उन्होंने विशिष्ट चालों का अभ्यास किया। उन्होंने AI को एक अच्छा पैराग्राफ कैसे लिखा जाए या एक अच्छा खोज प्रश्न कैसे पूछा जाए, यह सिखाया, और उन छोटे कार्यों को सही ढंग से करने के लिए उसे पुरस्कृत किया।
  3. होलिस्टिक पाइपलाइन RL (मैराथन): अंत में, उन्होंने AI को पूरी दौड़ लगाने दी। उन्होंने केवल यह नहीं देखा कि वाक्य अच्छे थे या नहीं; उन्होंने यह भी जांचा कि क्या पूरी रिपोर्ट विचारोत्तेक थी।
    • महत्वपूर्ण ट्रिक: उन्होंने "ट्रैजेक्टरी प्रूनिंग" (Trajectory Pruning) विधि का उपयोग किया। कल्पना कीजिए कि एक शिक्षक एक लंबी कहानी लिख रहा है लेकिन बीच-बीच में रुक जाता है। AI ने उन सभी ड्राफ्ट्स को देखा जो शिक्षक ने बनाए थे, सबसे बेहतरीन वाले को चुना, और कहा, "यहाँ रुक जाओ!" इसने छोटे AI को ठीक से सिखाया कि अधिक जानकारी के लिए खुदाई कब रोकनी है ताकि वह समय बर्बाद न करे।

परिणाम: छोटा मॉडल, बड़ा दिमाग

इस पेपर ने Google, OpenAI और Anthropic जैसी कंपनियों के सबसे बड़े, सबसे महंगे AI सिस्टम के मुकाबले इस सिस्टम का परीक्षण किया।

  • आश्चर्य: इस छोटे, स्थानीय AI (AgentCPM-Report) ने विचारोत्तेक (Insightful) रिपोर्ट बनाने में विशाल, क्लोज्ड-सोर्स सिस्टम को भी पीछे छोड़ दिया।
  • क्यों? क्योंकि "मूर्तिकार" दृष्टिकोण (WARP) ने छोटे AI को परिस्थितियों के अनुसार सोचने की अनुमति दी। उसे एक आदर्श ब्लूप्रिंट बनाने के लिए विशाल मस्तिष्क की आवश्यकता नहीं थी; उसे बस काम करते समय अपनी योजना को बदलने में कुशल होना था।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • गोपनीयता (Privacy): क्योंकि यह सिस्टम इतना छोटा है कि इसे आपके अपने कंप्यूटर (या स्थानीय सर्वर) पर चलाया जा सकता है, इसलिए आपको एक गहरा शोध रिपोर्ट प्राप्त करने के लिए अपना निजी डेटा किसी बड़ी कंपनी के क्लाउड पर अपलोड करने की आवश्यकता नहीं है।
  • लागत (Cost): उच्च गुणवत्ता वाला शोध प्राप्त करने के लिए आपको महंगे, विशाल AI मॉडल की आवश्यकता नहीं है।
  • गुणवत्ता (Quality): रिपोर्ट अधिक गहरी और स्मार्ट होती हैं क्योंकि AI को काम करते समय अपना मन बदलने की अनुमति होती है, ठीक वैसे ही जैसे एक मानव शोधकर्ता करता है।

संक्षेप में: यह पेपर दिखाता है कि गहरा शोध करने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है; आपको बस काम करने के एक स्मार्ट तरीके (WARP) की आवश्यकता है जो AI को लिखते समय सीखने और अनुकूलित होने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →