← नवीनतम पेपर
💬 NLP

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

IterResearch इंटरैक्शन स्केलिंग और MDP-प्रेरित वर्कस्पेस पुनर्निर्माण पर आधारित एक पुनरावृत्ति गहन-अनुसंधान प्रतिमान (iterative deep-research paradigm) प्रस्तुत करता है, जो एक प्रशिक्षित मॉडल और फ्रंटियर सिस्टम के लिए एक प्रॉम्प्टिंग रणनीति, दोनों के रूप में लंबी अवधि के कार्यों (long-horizon tasks) पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करने के लिए मौजूदा एजेंटों की संदर्भ सीमाओं को दूर करता है।

मूल लेखक: Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Z
प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ IterResearch पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "अनंत स्क्रॉल" (Endless Scroll) का जाल

कल्पना कीजिए कि आप एक बहुत ही कठिन रहस्य को सुलझाने की कोशिश कर रहे हैं, जैसे इंटरनेट की गहराइयों में छिपा हुआ कोई विशिष्ट तथ्य ढूँढना।

वर्तमान के अधिकांश AI एजेंट एक ऐसे व्यक्ति की तरह काम करते हैं जो पन्ना पलटे बिना किताब पढ़ने की कोशिश करता है। वे पेज 1 पढ़ते हैं, फिर पेज 2, फिर पेज 3। लेकिन पुराने पन्नों को बंद करने और नए सिरे से शुरुआत करने के बजाय, वे उसी विशाल ढेर के नीचे नए पन्ने जोड़ते जाते हैं।

  • परिणाम: 50 पन्नों के बाद, ढेर इतना ऊँचा हो जाता है कि व्यक्ति को ऊपर का हिस्सा दिखाई देना बंद हो जाता है। वे पुराने टेक्स्ट के बोझ तले "दम घुटने" लगते हैं।
  • शोर (Noise): यदि उन्होंने गलती से पेज 5 पर कोई गलत तथ्य पढ़ लिया, तो वह गलत तथ्य हमेशा के लिए उस ढेर में फंस जाता है, जो उन्हें पेज 50 पर भी भ्रमित करता रहता है।

पेपर इसे "मोनो-कॉन्टेक्स्टुअल पैराडाइम" (Mono-contextual Paradigm) कहता है। यह एक ऐसा व्यक्ति होने जैसा है जो एक भारी बैकपैक खींचते हुए मैराथन दौड़ने की कोशिश कर रहा है, जो हर कदम के साथ भारी होता जा रहा है। अंततः, आप गिर जाते हैं।

समाधान: "स्मार्ट नोटबुक" (IterResearch)

लेखक IterResearch पेश करते हैं, जो AI के सोचने का एक नया तरीका है। एक विशाल कागजों के ढेर को खींचने के बजाय, AI एक स्मार्ट नोटबुक का उपयोग करता है जिसे हर बार कुछ नया सीखने पर फिर से लिखा जाता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

  1. "रीसेट" (Reset) बटन:
    कल्पना कीजिए कि आप एक जासूस हैं। आप कुछ सुराग इकट्ठा करते हैं। हर उस कागज के टुकड़े को रखने के बजाय जिसे आपने छुआ था, आप बैठते हैं, अब तक जो आप जानते हैं उसका एक सारांश (Summary) एक साफ नोटबुक में लिखते हैं, और फिर उन बिखरे हुए कागजों को फेंक देते हैं
  • पेपर का शब्द: इटरेटिव वर्कस्पेस रिकंस्ट्रक्शन (Iterative Workspace Reconstruction)।
  • उपमा: AI अपनी मेज साफ करता है, केवल आवश्यक "केस फाइल" (रिपोर्ट) रखता है, और जांच के अगले दौर की शुरुआत एक ताज़ा, साफ स्लेट के साथ करता है। यह बहुत अधिक पुराने टेक्स्ट के कारण होने वाले "दम घुटने" की स्थिति को रोकता है।
  1. "विकासवादी" (Evolutionary) रिपोर्ट:
    AI केवल तथ्यों को याद नहीं रखता; यह एक जीवित रिपोर्ट लिखता है। हर बार जब इसे नई जानकारी मिलती है, तो यह इस रिपोर्ट को अपडेट करता है, कचरे को बाहर निकालता है और केवल काम की चीज़ों को रखता है।
  • पेपर का शब्द: इवॉल्विंग रिपोर्ट मेमोरी (Evolving Report Memory)।
  • उपमा: यह एक विकिपीडिया पेज की तरह है जिसे AI वास्तविक समय में एडिट करता है। पुरानी, गलत या अप्रासंगिक जानकारी को हटा दिया जाता है; नई, सही जानकारी जोड़ी जाती है। जांच चाहे कितनी भी लंबी क्यों न हो, "मेमोरी" छोटी और साफ बनी रहती है।
  1. "दक्षता" (Efficiency) कोच:
    AI को यह सीखने की आवश्यकता है कि कुशलता से कैसे खोजा जाए। पेपर एक प्रशिक्षण पद्धति पेश करता है जिसे EAPO (एफिशिएंसी-अवेयर पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है।
  • उपमा: कल्पना कीजिए कि एक कोच आपको एक पहेली को 5 चालों में हल करने के लिए गोल्ड स्टार देता है, लेकिन 50 चालों में हल करने के लिए केवल एक छोटा, धुंधला स्टार देता है। भले ही आप सही उत्तर प्राप्त कर लें, कोच आपको तेज़ और स्मार्ट बनना सिखाता है, न कि केवल तब तक खोदते रहना जब तक कि आपकी किस्मत चमक न जाए।

अद्भुत परिणाम

पेपर ने इस नए "स्मार्ट नोटबुक" तरीके का परीक्षण पुराने "अनंत स्क्रॉल" तरीकों के मुकाबले किया। यहाँ क्या हुआ:

  • प्रतिद्वंद्वियों को पछाड़ना: नए AI (IterResearch) ने छह अलग-अलग कठिन परीक्षणों में किसी भी अन्य ओपन-सोर्स AI एजेंट की तुलना में काफी अधिक स्कोर किया। इसने सबसे महंगे, प्रोप्राइटरी सिस्टम (जैसे गूगल या OpenAI के सिस्टम) के साथ के अंतर को कम कर दिया।
  • "सुपर-लॉन्ग" मैराथन: सबसे चौंकाने वाला परिणाम इंटरैक्शन स्केलिंग (Interaction Scaling) था।
    • उपमा: पुराने एजेंट आमतौर पर 20 या 30 स्टेप्स के बाद हार मान लेते हैं या भ्रमित हो जाते हैं क्योंकि उनका "बैकपैक" बहुत भारी हो जाता है। IterResearch बिना थके 2,048 स्टेप्स तक दौड़ने में सक्षम था।
    • परिणाम: जब इसे अधिक स्टेप्स (2,048 तक) लेने की अनुमति दी गई, तो इसका प्रदर्शन 3.5% के भयानक स्तर से बढ़कर 42.5% के अद्भुत स्तर पर पहुँच गया। इसने साबित कर दिया कि समस्या यह नहीं थी कि AI कार्य को हल करने के लिए "बहुत मूर्ख" था, बल्कि यह थी कि पुराने तरीके इसे पर्याप्त समय तक देखने ही नहीं दे पा रहे थे।
  • एक सार्वभौमिक ट्रिक: लेखकों ने पाया कि आपको इस तरीके का उपयोग करने के लिए AI को फिर से प्रशिक्षित करने की भी आवश्यकता नहीं है। यदि आप बस "स्मार्ट नोटबुक" के निर्देश (एक प्रॉम्प्ट) किसी अन्य, शक्तिशाली AI को देते हैं, तो वह AI तुरंत लंबे कार्यों में बहुत बेहतर हो जाता है। यह एक मानक टॉर्च को एक नया लेंस देने जैसा है जो उसे मीलों दूर तक देखने में मदद करता है।

सारांश

IterResearch गहरे शोध करने के लिए AI का एक नया तरीका है। हर उस जानकारी को जमा करने के बजाय जो उसे मिलती है (जो अंततः AI का दम घोट देती है), यह समय-समय पर जो वह जानता है उसका सारांश बनाता है, शोर को हटा देता है, और नए सिरे से शुरुआत करता है

यह AI को निम्नलिखित करने की अनुमति देता है:

  1. बहुत लंबे समय तक (2,048 स्टेप्स तक) स्पष्ट रूप से सोचना।
  2. अधिक कुशलता से उत्तर खोजना।
  3. वर्तमान में उपलब्ध लगभग किसी भी अन्य ओपन-सोर्स एजेंट से बेहतर काम करना।

यह AI को कागजों के ढेर में डूबते हुए व्यक्ति से बदलकर, एक पूरी तरह से व्यवस्थित, निरंतर अपडेट होने वाली केस फाइल रखने वाले जासूस में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →