← नवीनतम पेपर
💻 computer science

Experience Graphs: The Data Foundation for Self-Improving Agents

यह शोध पत्र ट्रेलिस (Trellis) का प्रस्ताव करता है, जो एक डेटाबेस-केंद्रित आर्किटेक्चर है जो लंबी अवधि के एजेंटिक कार्यों से उत्पन्न संरचित "अनुभव ग्राफों" (experience graphs) को प्रथम-श्रेणी के, क्वेरी करने योग्य डेटा के रूप में मानता है ताकि स्टेटलेस एजेंटों, मजबूत क्रैश रिकवरी और एक क्लोज्ड-लूप ट्रेनिंग फ्लाईव्हील को सक्षम बनाया जा सके, जो मेटा में एक प्रोडक्शन कर्नेल ऑप्टिमाइज़र में महत्वपूर्ण दक्षता लाभ प्रदर्शित करता है।

मूल लेखक: Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanov
प्रकाशित 2026-06-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Experience Graphs: The Data Foundation for Self-Improving Agents" पेपर की सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए व्याख्या दी गई है।

मुख्य विचार: "भुलक्कड़" एजेंटों से "संचयी" (Cumulative) शिक्षार्थियों तक

कल्पना कीजिए कि आप एक रोबोट को एक बहुत कठिन पहेली सुलझाना सिखा रहे हैं, जैसे कि एक नया कंप्यूटर चिप डिजाइन करना या जटिल कोड लिखना।

पुराना तरीका (वर्तमान एजेंट):
अभी, अधिकांश AI एजेंट एक ऐसे व्यक्ति की तरह काम करते हैं जो एक ही बार में पहेली सुलझाने की कोशिश करता है। वे एक कदम उठाते हैं, शायद असफल होते हैं, फिर से प्रयास करते हैं, और उत्तर मिलने तक चलते रहते हैं। लेकिन एक बार काम पूरा होने पर (या क्रैश होने पर), वे उस विशिष्ट प्रयास के दौरान सीखी गई लगभग हर चीज़ को भूल जाते हैं। यदि वे कल वही पहेली फिर से सुलझाते हैं, तो उन्हें शून्य से शुरुआत करनी पड़ती है। उनकी "याददाश्त" केवल अव्यवस्थित नोट्स (लॉग्स) का एक ढेर है जिसे पढ़ना या पुन: उपयोग करना कठिन होता है।

नया तरीका (Trellis और Experience Graphs):
यह पेपर Trellis नामक एक नई प्रणाली प्रस्तावित करता है। एक 'ट्रेलीस' (Trellis) को एक लकड़ी के ढांचे के रूप में सोचें जिसका उपयोग माली बेलों को बढ़ने में मदद करने के लिए करते हैं। बेल (AI एजेंट) चढ़ने और बढ़ने का काम करती है, लेकिन ट्रेलीस (डेटाबेस) सब कुछ थामे रखता है, शाखाओं को व्यवस्थित करता है, और यह सुनिश्चित करता है कि पौधा ढह न जाए।

इस नई प्रणाली में, एजेंट द्वारा उठाया गया हर एक कदम—हर अनुमान, हर विफलता, उसके द्वारा उपयोग किया गया हर टूल, और उसे प्राप्त स्कोर—एक विशाल, व्यवस्थित और खोजने योग्य संरचना में सहेजा जाता है जिसे Experience Graph कहा जाता है।

मुख्य रूपक (Metaphor): "प्रयासों का बगीचा"

एजेंट केवल एक अंतिम रिपोर्ट लिखने के बजाय, कल्पना कीजिए कि वह एक विशाल बगीचे की खोज कर रहा है।

  • Experience Graph: यह स्वयं बगीचा है। एजेंट द्वारा चला गया हर रास्ता, चुना गया हर फूल, और वह हर मृत अंत (dead end) जहाँ वह रुका, बगीचे में एक स्थायी पौधे के रूप में दर्ज किया जाता है।
  • "बेलें" (The Vines): AI एजेंट वे बेलें हैं। वे बढ़ती हैं, खोज करती हैं और नई चीजें आज़माती हैं।
  • "ट्रेलीस" (Trellis System): यह वह डेटाबेस है जो बगीचे को थामे रखता है। यह पौधे नहीं उगाता; यह उन्हें सहारा देता है। इसे याद रहता है कि हर शाखा कहाँ है, वह कितनी अच्छी तरह विकसित हुई, और यदि आपने एक अलग रास्ता अपनाया होता तो क्या होता।

यह सब कुछ कैसे बदल देता है

पेपर का तर्क है कि इन "बगीचे के रिकॉर्ड" को एक उचित डेटाबेस (जैसे कि बैंक या एयरलाइंस चलाने वाले डेटाबेस) के रूप में मानना, तीन मुख्य तरीकों से AI के काम करने के तरीके को बदल देता है:

1. क्रैश होने के बाद "स्मृति लोप" (Amnesia) नहीं

समस्या: यदि वर्तमान एजेंट क्रैश हो जाता है (जैसे कंप्यूटर फ्रीज होना), तो वह अपनी प्रगति खो देता है। यह एक हाइकर (हाइकर) के पहाड़ से गिरने जैसा है और गिरने के बाद वह अपने हाथ में पकड़े नक्शे को भी भूल जाता है।
Trellis का समाधान: क्योंकि "नक्शा" (experience graph) डेटाबेस में रहता है, न कि एजेंट के दिमाग में, इसलिए एजेंट को तुरंत रीस्टार्ट किया जा सकता है। वह बस डेटाबेस से पूछता है, "मैं कहाँ था?" और ठीक वहीं से शुरू करता है जहाँ वह रुका था। एजेंट स्वयं "स्टेटलेस" (stateless) बन जाता है—वह केवल सोचने वाला एक कार्यकर्ता है, जबकि डेटाबेस उसकी स्मृति को थामे रखता है।

2. दूसरों से सीखना (Cross-Session Reuse)

समस्या: वर्तमान में, यदि एजेंट A किसी समस्या को हल करता है, तो एजेंट B को अपने आप इसके बारे में पता नहीं चलता। वे अलग-थलग हैं।
Trellis का समाधान: डेटाबेस एजेंट B को एजेंट A के "बगीचे" को देखने की अनुमति देता है। यदि एजेंट A ने कोई शॉर्टकट खोजा है या किसी मृत अंत से बचने का तरीका ढूँढा है, तो एजेंट B उस रास्ते को तुरंत देख सकता है।

  • परिणाम: पेपर का परीक्षण एक वास्तविक उपकरण KernelEvolve (जो कंप्यूटर कोड को ऑप्टिमाइज़ करता है) के साथ किया गया। जब एजेंटों को साझा बगीचे से "उधार" लेने की अनुमति मिली, तो उन्होंने 10 गुना तेजी से अच्छे समाधान खोजे और 52% कम कंप्यूटिंग पावर (टोकन) का उपयोग किया, क्योंकि उन्होंने उन गलतियों को दोहराने में समय बर्बाद नहीं किया जो दूसरों ने पहले ही कर ली थीं।

3. प्रशिक्षण के लिए "टाइम ट्रैवल" (Time Travel)

समस्या: AI को बेहतर बनाने के लिए, हमें आमतौर पर यह देखने के लिए अस्त-व्यस्त लॉग्स को खंगालना पड़ता है कि क्या काम किया और क्या नहीं। यह धीमा और अक्सर गलत हो सकता है।
Trellis का समाधान: डेटाबेस स्वचालित रूप से "बगीचे" को प्रशिक्षण सामग्री में व्यवस्थित करता है।

  • यह AI को दिखा सकता है: "यहाँ एक रास्ता है जहाँ आप सफल हुए (अच्छा)।"
  • यह दिखा सकता है: "यहाँ एक रास्ता है जहाँ आप असफल रहे (बुरा)।"
  • यह "टाइम ट्रैवल" भी कर सकता है: यह बिल्कुल पुनर्गठित कर सकता है कि अतीत के उस विशिष्ट क्षण में एजेंट क्या जानता था, बिना भविष्य के परिणामों को देखे। यह स्वचालित रूप से उच्च-गुणवत्ता वाला प्रशिक्षण डेटा बनाता है।

"स्व-सुधार चक्र" (Self-Improving Flywheel)

पेपर एक ऐसे चक्र का वर्णन करता है जो सिस्टम को समय के साथ स्मार्ट बनाता है:

  1. खोज (Explore): एजेंट बगीचे की खोज करते हैं, नई चीजें आज़माते हैं।
  2. रिकॉर्ड (Record): प्रत्येक प्रयास को Trellis डेटाबेस में सहेजा जाता है।
  3. सीखना (Learn): डेटाबेस इन प्रयासों को AI मॉडल को सिखाने के लिए प्रशिक्षण डेटा में बदल देता है।
  4. सुधार (Improve): स्मार्ट मॉडल वापस बगीचे में जाते हैं और और भी बेहतर खोज करते हैं।

चूंकि डेटाबेस स्मृति को थामे रखता है, इसलिए पूरा सिस्टम जैसे-जैसे अधिक लोग इसका उपयोग करते हैं, बेहतर होता जाता है। यह केवल एक एजेंट का स्मार्ट होना नहीं है; यह एजेंटों का एक पूरा समुदाय है जो एक साझा, बढ़ते हुए अनुभव के पुस्तकालय को साझा कर रहा है।

यह पेपर वास्तव में क्या दावा करता है (और क्या नहीं)

  • यह दावा करता है: उन्होंने एक सिस्टम (Trellis) बनाया है जो AI सर्च हिस्ट्री को एक डेटाबेस के रूप में मानता है। उन्होंने इसका परीक्षण कंप्यूटर चिप ऑप्टिमाइज़ेशन (KernelEvolve) और हार्डवेयर वैलिडेशन पर किया। उन्होंने दिखाया कि यह एजेंटों को तेज़, सस्ता और अधिक विश्वसनीय बनाता है।
  • यह दावा करता है: यह आर्किटेक्चर "रिकर्सिव सेल्फ-इम्प्रूवमेंट" (एजेंट अपने ही काम में बेहतर होते हैं) की अनुमति देता है।
  • यह दावा नहीं करता: यह पेपर चिकित्सा उपयोगों, क्लिनिकल ट्रायल या सॉफ्टवेयर/हार्डवेयर ऑप्टिमाइज़ेशन के बाहर के विशिष्ट अनुप्रयोगों (हालांकि यह उल्लेख करता है कि इसकी संरचना ड्रग डिस्कवरी या विज्ञान पर लागू हो सकती है, लेकिन प्रस्तुत वास्तविक परिणाम केवल कंप्यूटर कोड और चिप्स के बारे में हैं) के बारे में चर्चा नहीं करता है।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि वैज्ञानिकों का एक समूह भौतिकी के एक नए नियम की खोज करने की कोशिश कर रहा है।

  • Trellis के बिना: प्रत्येक वैज्ञानिक एक अलग कमरे में काम करता है, कागज पर नोट्स लिखता है, और यदि वे कमरा छोड़ देते हैं, तो नोट्स फेंक दिए जाते हैं। उन्हें हर बार पहिए का पुन: आविष्कार करना पड़ता है।
  • Trellis के साथ: सभी वैज्ञानिक एक विशाल, साझा पुस्तकालय में काम करते हैं। प्रत्येक प्रयोग, प्रत्येक विफलता और प्रत्येक सफलता को एक कार्ड पर लिखा जाता है और ठीक से फाइल किया जाता है। यदि कोई वैज्ञानिक गलती करता है, तो पुस्तकालय को पता होता है। यदि किसी अन्य वैज्ञानिक को किसी संकेत की आवश्यकता है, तो वह अपने सहकर्मी के प्रयोग के सटीक कार्ड को देख सकता है। पुस्तकालय स्वयं "मस्तिष्क" है जो सब कुछ याद रखता है, जिससे वैज्ञानिक एक-दूसरे के कंधों पर खड़े होकर पहले से कहीं अधिक दूर तक पहुँच सकते हैं।

पेपर निष्कर्ष निकालता है कि लॉग्स ने डेटाबेस को विश्वसनीय बनाया, लेकिन एक्सपीरियंस ग्राफ्स AI एजेंटों को संचयी (cumulative) बना सकते हैं—अर्थात, वे ऐसा ज्ञान बना सकते हैं जो लंबे समय तक टिके और बढ़ता रहे, न कि केवल एक समय में एक समस्या को हल करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →