← नवीनतम पेपर
🤖 machine learning

Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs

SEAM एक हल्का, प्लग-इन मॉड्यूल है जो अपने स्वयं के मापदंडों के भीतर अनुभव को संग्रहीत करता है और एक ही फॉरवर्ड पास में फ्रोजन (frozen) LLMs के लिए संरचित, उपयोगिता-अनुकूलित मार्गदर्शन उत्पन्न करता है, जिससे पारंपरिक रिट्रीवल-आधारित विधियों की विलंबता या शोर के बिना तर्क प्रदर्शन में सुधार होता है।

मूल लेखक: Xuancheng Li, Haitao Li, Yujia Zhou, Yiqun Liu, Qingyao Ai

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xuancheng Li, Haitao Li, Yujia Zhou, Yiqun Liu, Qingyao Ai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विश्व प्रसिद्ध शेफ (LLM एक्जीक्यूटर) हैं। आप अविश्वसनीय रूप से कुशल हैं, लेकिन आपकी एक समस्या है: आपकी कोई दीर्घकालिक स्मृति (long-term memory) नहीं है। हर बार जब कोई ग्राहक आता है और किसी व्यंजन के लिए पूछता है, तो आपको शून्य से शुरुआत करनी पड़ती है। भले ही आपने पाँच मिनट पहले एक जटिल सूफ़ले (soufflé) बनाया हो और महसूस किया हो कि आपने उसमें बहुत अधिक नमक डाल दिया था, अगले ऑर्डर के आते ही आप उस गलती को भूल जाते हैं और शायद इसे दोबारा भी कर सकते हैं।

वर्तमान में, अधिकांश लोग शेफ की मदद करने के लिए उन्हें एक विशाल, धूल भरी कुकबुक (यह RAG/रिट्रीवल है) देते हैं। जब शेफ को मदद की ज़रूरत होती है, तो उन्हें रुकना पड़ता है, हज़ारों पन्नों को पलटना पड़ता है, एक ऐसी रेसिपी ढूँढनी पड़ती है जो दिखने में "समान" हो, और फिर उसका पालन करने की कोशिश करनी पड़ती है। यह धीमा है, और कभी-कभी कुकबुक ऐसी रेसिपी दे देती है जो "कुछ हद तक" संबंधित तो है लेकिन वास्तव में व्यंजन को खराब कर देती है।

यह पेपर SEAM पेश करता है, और यह खेल बदल देता है।

अवधारणा: "पर्सनल सू-शेफ" (व्यक्तिगत सहायक शेफ)

एक विशाल, धीमी कुकबुक के बजाय, शोधकर्ताओं ने शेफ को एक छोटा, बिजली की तरह तेज़ सू-शेफ (SEما - SEAM) दिया है।

यह सू-शेफ कोई लाइब्रेरी नहीं ढोता। इसके बजाय, सू-शेफ ने अभ्यास के माध्यम से शेफ की विशिष्ट आदतों, खूबियों और सामान्य गलतियों को "सीखा" है। जब एक नया ऑर्डर आता है, तो सू-शेफ लाइब्रेरी में खोजने नहीं जाता; वह बस शेफ के कान में एक त्वरित, संरचित नोट फुसफुसा देता है।

यह नोट केवल एक रेसिपी नहीं है। यह एक "चीट शीट" (Cheat Sheet) है जिसमें तीन चीजें शामिल हैं:

  1. "हेड्स अप" (चेतावनी): "हे, यह व्यंजन कठिन है क्योंकि गर्मी (heat) बहुत संवेदनशील है।" (समस्या विश्लेषण)
  2. "प्रो-टिप" (विशेष सुझाव): "याद रखें, पिछली बार जब हमने यह किया था, तो हम पैन को प्रीहीट करना भूल गए थे।" (अनुभव हाइलाइट्स)
  3. "गेम प्लान" (कार्य योजना): "पहले काटें, फिर सौते (sauté) करें, फिर धीमी आंच पर पकाएं।" (संदर्भ योजना)

सू-शेफ कैसे सीखता है (प्रशिक्षण)

शोधकर्ताओं ने केवल सू-शेफ को यह नहीं बताया कि उसे क्या कहना है। उन्होंने GRPO नामक पद्धति का उपयोग किया, जो एक उच्च-तीव्रता वाले प्रशिक्षण शिविर की तरह है।

यह इस प्रकार काम करता है:

  1. परीक्षण और त्रुटि (Trial and Error): सू-चेफ एक व्यंजन के लिए तीन अलग-अलग "चीट शीट्स" का सुझाव देता है।
  2. परीक्षण: शेफ प्रत्येक चीट शीट का उपयोग करके व्यंजन बनाने की कोशिश करता है।
  3. फीडबैक: यदि व्यंजन अद्भुत स्वाद वाला है, तो सू-शेफ को एक "गोल्ड स्टार" मिलता है। यदि व्यंजन आपदा है, तो सू-शेफ को "रेड कार्ड" मिलता है।
  4. विकास: समय के साथ, सू-शेफ ठीक यही सीख जाता है कि किस तरह की सलाह वास्तव में इस विशिष्ट शेफ को सफल होने में मदद करती है।

यह बेहतर क्यों है?

  • यह तेज़ है: लाइब्रेरी में खोजने की कोई आवश्यकता नहीं है। सू-शेफ बस तुरंत बोल उठता है।
  • यह स्मार्ट है: सलाह केवल "जो समान दिखता है" उस पर आधारित नहीं है, बल्कि "जो वास्तव में काम करता है" उस पर आधारित है। यह समानता के बजाय उपयोगिता (utility) के लिए अनुकूलित है।
  • यह व्यक्तिगत है: सू-शेफ शेफ की विशिष्ट बारीकियों को सीखता है। यदि शेफ काटने में माहिर है लेकिन समय (timing) के मामले में कमजोर है, तो सू-शेफ अपना ध्यान टाइमिंग पर केंद्रित करता है।
  • यह हल्का (Lightweight) है: आपको मास्टर शेफ को फिर से प्रशिक्षित करने की आवश्यकता नहीं है (जो महंगा और कठिन है)। आप केवल छोटे, विशेष रूप से प्रशिक्षित सू-शेफ को प्रशिक्षित करते हैं।

निष्कर्ष

AI की दुनिया में, हम आमतौर पर "दिमाग" (LLM) को बड़ा और बड़ा बनाने की कोशिश करते हैं। यह पेपर एक अलग रास्ता सुझाता है: दिमाग को वैसा ही रहने दें, लेकिन उसे एक स्मार्ट, विशेष सहायक दें जो पिछली गलतियों को तत्काल, कार्रवाई योग्य ज्ञान में बदल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →