← नवीनतम पेपर
💻 computer science

Forage V2: Knowledge Evolution and Transfer in Autonomous Agent Organizations

Forage V2 एक स्वायत्त एजेंट संगठन आर्किटेक्चर पेश करता है जो मॉडल क्षमताओं के बीच ज्ञान संचय और हस्तांतरण को संस्थागत बनाकर ओपन-वर्ल्ड कार्यों में "डेनोमिनेटर ब्लाइंडनेस" (denominator blindness) पर विजय प्राप्त करता है, जिससे साझा, मॉडल-अज्ञेय (model-agnostic) संगठनात्मक स्मृति के माध्यम से कमजोर एजेंटों को बेहतर प्रदर्शन, कम लागत और तेज़ अभिसरण (convergence) प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Huaqing Xie

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huaqing Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टीम को एक विशाल, अनमैप्ड (unmapped) जंगल में हर एक प्रकार के दुर्लभ ऑर्किड (orchid) को खोजने के लिए भेज रहे हैं।

पुराने तरीके में (जिसे पेपर में Forage V1 कहा गया है), आप एक खोजकर्ता भेजते हैं। वह 50 ऑर्किड ढूंढता है, थक जाता है, और कहता है, "मुझे सब मिल गए! 100% पूरा हुआ!" लेकिन वास्तव में, वहां 200 ऑर्किड थे। खोजकर्ता को यह नहीं पता था कि वहां कितने होने चाहिए थे, इसलिए उसने मान लिया कि उसका छोटा सा ढेर ही पूरा जंगल है। इसे "डेनॉमिनेटर ब्लाइंडनेस" (Denominator Blindness) कहा जाता है—वह जो उसने पाया उसे तो गिन सकता है (न्यूमरेटर/numerator), लेकिन वह खोज के कुल आकार (डेनॉमिनेटर/denominator) के प्रति अंधा है।

Forage V2 खेल बदल देता है। एक अकेले खोजकर्ता के बजाय, यह एक लर्निंग ऑर्गनाइजेशन (Learning Organization) बनाता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. दो सिरों वाली टीम (द इवैल्यूएटर और द प्लानर)

V2 में, हर मिशन में दो अलग भूमिकाएँ होती हैं जो एक-दूसरे के गुप्त नोट्स कभी नहीं देखते:

  • द प्लानर (द स्काउट): इनका काम बाहर जाना, ऑर्किड ढूंढना और उन्हें वापस लाना है। वे नक्शा और संग्रह की रणनीति लिखते हैं।
  • द इवैल्यूएटर (द ऑडिटर): इनका काम पीछे खड़े होकर यह पूछना है, "क्या यह वाकई सब कुछ है? वहां कितने ऑर्किड होने चाहिए?" उन्हें यह नहीं पता कि स्काउट ने उन्हें कैसे ढूंढा; वे केवल परिणाम का न्याय करते हैं।

इन्हें अलग क्यों रखा गया है?
यदि स्काउट अपने काम का खुद न्याय करता है, तो वह सोच सकता है, "मैंने बहुत मेहनत की, इसलिए मैं पूरा हो गया हूँ।" उन्हें अलग करके, ऑडिटर ईमानदार रहता है। वह स्काउट के प्रयासों से धोखा नहीं खा सकता; उसे केवल सच्चाई की परवाह है।

2. "पोस्ट-मॉर्टम" (गलतियों से सीखना)

पुराने दिनों में, जब एक टीम जंगल से लौटती थी, तो वे अपना सामान पैक करते थे, और उनके द्वारा सीखे गए सभी सबक खो जाते थे। अगली टीम को शून्य से शुरुआत करनी पड़ती थी, और वे वही गलतियाँ दोहराते थे (जैसे कि ऐसी खड़ी चट्टान पर चढ़ने की कोशिश करना जो बहुत अधिक ढाल वाली थी)।

Forage V2 एक पोस्ट-मॉर्टम (Post-Mortem) पेश करता है। हर मिशन के बाद, टीम बैठती है और एक "फील्ड जर्नल" लिखती है।

  • उदाहरण: "TechPowerUp से डेटा निकालने की कोशिश न करें; वे रोबोट्स को ब्लॉक कर देते हैं।"
  • उदाहरण: "Wikipedia टेबल अव्यवस्थित हैं; इसके बजाय एक क्यूरेटेड लिस्ट का उपयोग करें।"

ये जर्नल एक शेयर्ड लाइब्रेरी (Shared Library) (ज्ञान आधार) में सहेजे जाते हैं।

3. "स्ट्रॉन्ग" बनाम "वीक" एक्सप्लोरर (ज्ञान का हस्तांतरण)

यही V2 का जादू है।

  • द स्ट्रॉन्ग एक्सप्लोरर (Opus): एक बहुत ही स्मार्ट, महंगी AI मॉडल। यह 6 मिशनों पर जाता है, सब कुछ सीखता है, और 54 "फील्ड जर्नल्स" की एक विशाल लाइब्रेरी बनाता है।
  • द वीक एक्सप्लोरर (Sonnet): एक सस्ती, कम शक्तिशाली AI मॉडल।

अतीत में, यदि आप कमजोर खोजकर्ता को भेजते, तो वह संघर्ष करता, दोगुना समय लेता, और अधिक पैसा खर्च करता क्योंकि उसे वह सब कुछ फिर से खोजना पड़ता था जो स्ट्रॉन्ग एक्सप्लोरर पहले ही जान चुका था।

V2 के साथ: आप कमजोर खोजकर्ता को जाने से पहले स्ट्रॉन्ग एक्सप्लोरर के फील्ड जर्नल्स दे देते हैं।

  • कमजोर खोजकर्ता को बहुत स्मार्ट होने की जरूरत नहीं है। उन्हें बस हैंडबुक पढ़ने की जरूरत है।
  • वे गलतियों को छोड़ देते हैं। वे ब्लॉक की गई चट्टान पर चढ़ने की कोशिश करने में समय बर्बाद नहीं करते।
  • परिणाम: स्ट्रॉन्ग एक्सप्लोरर के अनुभव से लैस होकर, कमजोर खोजकर्ता लगभग स्ट्रॉन्ग एक्सप्लोरर जितना ही प्रदर्शन करता है, लेकिन आधे खर्च और आधे समय में।

4. "इंस्टीट्यूशन" बनाम "इंडिविजुअल"

पेपर का तर्क है कि हमें केवल AI को "स्मार्टर" बनाने की कोशिश नहीं करनी चाहिए (जैसे किसी कुत्ते को जीनियस बनाने के लिए प्रशिक्षित करना)। इसके बजाय, हमें एक बेहतर ऑर्गनाइजेशन बनाना चाहिए (जैसे एक अच्छी तरह से चलने वाली कंपनी)।

  • पुराना तरीका: "चलो एक कुत्ते को सुपर-जीनियस बनाने के लिए प्रशिक्षित करते हैं।"
  • V2 का तरीका: "चलो हर कुत्ते को, भले ही वे औसत हों, एक परफेक्ट रूलबुक और एक सख्त मैनेजर दें जो उनके काम की जांच करे।"

सिस्टम को इस तरह डिज़ाइन किया गया है कि भले ही AI "औसत" हो, फिर भी संरचना (नियम, कर्तव्यों का अलगाव, साझा लाइब्रेरी) परिणाम को विश्वसनीय बनाती है।

5. "कॉमन लॉ" सिस्टम

लाइब्रेरी में मौजूद ज्ञान कोई सख्त कानून नहीं है जो AI को बिल्कुल एक ही चीज़ करने के लिए मजबूर करता है। यह कॉमन लॉ (Common Law) (कानूनी मिसालें) की तरह है।

  • AI पिछले मामलों को पढ़ता है: "2023 में, हमने X आजमाया और वह विफल रहा।"
  • AI निर्णय लेता है: "ठीक है, मैं X नहीं करूँगा। लेकिन शायद मैं Y आज़मा सकता हूँ।"
  • यह AI को लचीला बनाता है जबकि उसे ज्ञात बाधाओं से भी बचाता है।

सारांश: उन्होंने क्या साबित किया?

  1. ज्ञान संचित होता है: 6 रन के दौरान, टीम का "फील्ड जर्नल" 0 से बढ़कर 54 प्रविष्टियों तक पहुँच गया। टीम न केवल यह खोजने में, बल्कि यह सीखने में भी स्मार्ट हुई कि क्या खोजना है।
  2. ज्ञान हस्तांतरित होता है: एक कमजोर AI, जिसे स्ट्रॉन्ग AI के नोट्स दिए गए, उसने वही गलतियाँ करना बंद कर दिया। उसने उतने ही "प्रोडक्ट्स" (ऑर्किड) ढूंढे लेकिन आधे पैसे और समय में।
  3. कैलिब्रेशन (सटीकता): कमजोर AI ने केवल अधिक आइटम ही नहीं ढूंढे; इसने वास्तव में कुल संख्या का सही अनुमान लगाना भी शुरू कर दिया (जैसे, "वहाँ ठीक 266 उत्पाद हैं"), जबकि नोट्स के बिना, वह गलत अनुमान लगाता था (जैसे, "वहाँ 400 हैं!")।

बड़ी तस्वीर:
Forage V2 दिखाता है कि ऐसी दुनिया में जहाँ हमें पहले से "सही उत्तर" नहीं पता होता (जैसे वास्तविक दुनिया की खोज करना), हमें सुपर-इंटेलिजेंट रोबोट्स की आवश्यकता नहीं है। हमें स्मार्ट सिस्टम्स की आवश्यकता है जो अपने अतीत को याद रखें, काम करने वालों को परखने वालों से अलग करें, और अपने सबक अगली पीढ़ी को सौंपें। यह एक अराजक अभियान को एक विश्वसनीय, सीखने वाले संगठन में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →