← नवीनतम पेपर
🤖 AI

Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization

यह शोध पत्र लार्ज लैंग्वेज मॉडल-आधारित मल्टी-एजेंट सिस्टम को अनुकूलित करने के लिए एक नवीन ढांचे का प्रस्ताव करता है जो लक्षित, कुशल प्रॉम्प्ट रिफाइनमेंट के लिए एक डिस्क्रीट, वर्बलाइज्ड ब्लॉक कोऑर्डिनेट डिसेंट एल्गोरिदम को निर्देशित करने हेतु टेम्पोरल और स्ट्रक्चरल क्रेडिट असाइनमेंट तंत्रों को पेश करके नॉन-डिफरेंशिएबिलिटी और स्पार्स सुपरविजन की चुनौतियों का समाधान करता है।

मूल लेखक: Wenwu Li, Yuran Song, Mingze Zhao, Bo Jin, Wenhao Li

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenwu Li, Yuran Song, Mingze Zhao, Bo Jin, Wenhao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक कठिन पहेली को हल करने के लिए काम करने वाली AI सहायकों की एक टीम है, जैसे कि एक जटिल यात्रा की योजना बनाना या एक कठिन गणितीय समस्या को हल करना। वे कई राउंड तक आपस में बातचीत करते हैं: एक विचार सुझाता है, दूसरा उनकी आलोचना करता है, और तीसरा उन सभी को जोड़ने का प्रयास करता है।

समस्या यह है कि जब टीम अंतिम उत्तर गलत देती है, तो यह एक रहस्य बन जाता है। क्या पहले व्यक्ति ने एक बुरा विचार सुझाया था? क्या दूसरे व्यक्ति ने आलोचना को गलत समझा? या क्या सब कुछ संक्षेप में लिखने वाले व्यक्ति ने अंतिम चरण में गलती कर दी? क्योंकि AI टीम एक "ब्लैक बॉक्स" की तरह काम करती है, हम आमतौर पर यह नहीं बता पाते कि कौन जिम्मेदार है। हम केवल अनुमान लगाते हैं और एक साथ सभी के निर्देशों को बदलने लगते हैं, जो अक्षम है और अक्सर चीजों को और खराब कर देता है।

यह शोध पत्र इन AI टीमों को ठीक करने का एक स्मार्ट तरीका प्रस्तावित करता है। लेखक इस विधि को "टेम्पोरल एंड स्ट्रक्चरल क्रेडिट असाइनमेंट" (Temporal and Structural Credit Assignment) कहते हैं। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "अंधे कोच" (The Blindfolded Coach)

एक कोच की कल्पना करें जो एक रिले रेस टीम को सुधारने की कोशिश कर रहा है। टीम दौड़ पूरी करती है, और अंत में कोच देखता है कि वे हार गए। कोच को पता ही नहीं चलता कि टीम कहाँ विफल हुई।

  • पुराना तरीका: कोच पूरी टीम पर चिल्लाता है कि "तेज़ दौड़ो" या पूरी टीम के लिए जूते बदल देता है, इस उम्मीद में कि शायद कुछ सुधार हो जाए। वर्तमान AI ऑप्टिमाइज़र यही करते हैं: वे पूरे सिस्टम को बेतरतीब ढंग से ट्यून करते हैं।
  • शोध पत्र का अंतर्दृष्टि: टीम को ठीक करने के लिए, कोच को यह जानने की आवश्यकता है कि किस धावक ने बैटन गिराया और दौड़ के किस विशिष्ट भाग में।

2. समाधान: दो प्रकार के "क्रेडिट" (Two Types of "Credit")

लेखक यह पता लगाने के लिए कि किसने क्या किया, दो तरीके पेश करते हैं, जो समस्या को समय (Time) और संरचना (Structure) में विभाजित करते हैं।

A. टेम्पोरल क्रेडिट (समय - "कब")

AI टीम की बातचीत को कई दृश्यों (राउंड 1, राउंड 2, आदि) वाली एक फिल्म के रूप में सोचें।

  • बाधा (The Bottleneck): लेखक टीम को हर राउंड के बाद रुकने और अब तक जो हुआ उसका एक छोटा सा रिपोर्ट लिखने के लिए एक "समराइज़र" (Summarizer) बनाने के लिए मजबूर करते हैं। यह एक स्पष्ट चेकपॉइंट बनाता है।
  • समाधान: यदि अंतिम उत्तर गलत है, तो सिस्टम इन चेकपॉइंट्स को देखता है। यह पूछता है: "क्या राउंड 2 की रिपोर्ट संदिग्ध थी? क्या राउंड 4 का सारांश किसी महत्वपूर्ण तथ्य को छोड़ गया?"
  • परिणाम: पूरी फिल्म को दोष देने के बजाय, सिस्टम उस विशिष्ट "दृश्य" की पहचान करता है जहाँ कहानी पटरी से उतर गई थी।

B. स्ट्रक्चरल क्रेडिट (संरचना - "कौन")

अब कल्पना करें कि टीम में विशिष्ट भूमिकाएँ हैं: एक प्लानर (Planner), एक सॉल्वर (Solver), और एक क्रिटिक (Critic)

  • स्टेशनरी पॉलिसी (The Stationary Policy): लेखक यह सुनिश्चित करते हैं कि "प्लानर" हर राउंड में एक ही सेट निर्देशों का उपयोग करता है, और "क्रिटिक" भी ऐसा ही करता है। वे खेल के बीच में अपना व्यक्तित्व नहीं बदलते।
  • समाधान: क्योंकि भूमिकाएँ सुसंगत हैं, सिस्टम पूरे खेल को देख सकता है और कह सकता है, "प्लानर राउंड 1 और राउंड 3 में बहुत अच्छा था, लेकिन क्रिटिक हर राउंड में लगातार कमजोर रहा।"
  • परिणाम: सिस्टम यह पहचान लेता है कि कमजोर कड़ी 'क्रिटिक' है, न कि प्लानर।

3. रणनीति: "लक्षित सर्जरी" (Targeted Surgery)

एक बार जब सिस्टम जान जाता है कि कब (कौन सा राउंड) और कौन (कौन सी भूमिका) विफल हो रहा है, तो वह अनुमान लगाना बंद कर देता है। यह ब्लॉक कोऑर्डिनेट डिसेंट (Block Coordinate Descent) नामक विधि का उपयोग करता है, जो एक सामान्य चेक-अप के बजाय एक सर्जन द्वारा की जाने वाली लक्षित सर्जरी की तरह है।

  • चरण 1: यह टीम के "अच्छे" हिस्सों को फ्रीज कर देता है। यदि प्लानर बहुत अच्छा कर रहा है, तो उसके निर्देश बिल्कुल वैसे ही रहते हैं।
  • चरण 2: यह केवल "बुरे" हिस्सों के निर्देशों को फिर से लिखता है। यदि क्रिटिक कमजोर है, तो सिस्टम एक स्मार्ट AI से केवल क्रिटिक के लिए एक नया, बेहतर निर्देश लिखने के लिए कहता है।
  • चरण 3: यह "बुरे" राउंड्स के लिए भी ऐसा ही करता है। यदि राउंड 2 एक आपदा था, तो यह केवल राउंड 2 में सारांश चरण के निर्देशों को फिर से लिखता है।

4. परिणाम

इस शोध पत्र का परीक्षण विभिन्न तर्क कार्यों (जैसे चिकित्सा संबंधी प्रश्न और यात्रा योजना) पर किया गया।

  • दक्षता (Efficiency): उन्होंने पाया कि केवल विशिष्ट कमजोर कड़ियों को ठीक करके, उन्हें टीम को कुशलतापूर्वक चलाने के लिए बहुत कम प्रयासों की आवश्यकता पड़ी।
  • प्रदर्शन (Performance): टीमें समस्याओं को हल करने में उन टीमों की तुलना में काफी बेहतर रहीं जहाँ सभी के निर्देशों को बेतरतीब ढंग से बदला गया था।
  • स्पष्टता (Clarity): सिस्टम वास्तव में आपको बता सकता है कि उसने कोई बदलाव क्यों किया (उदाहरण के लिए, "हमने क्रिटिक के निर्देशों को अपडेट किया क्योंकि वह राउंड 2 में तार्किक त्रुटियों को मिस कर रहा था")।

सारांश

संक्षेप में, यह शोध पत्र हमें सिखाता है कि AI टीमों को रहस्यमय बॉक्स की तरह मानना कैसे बंद किया जाए। स्पष्ट चेकपॉइंट्स (समय) और सुसंगत भूमिकाएं (संरचना) बनाकर, हम सटीक रूप से पहचान सकते हैं कि बातचीत का कौन सा हिस्सा गलत हुआ। पूरे स्क्रिप्ट को बेतरतीब ढंग से फिर से लिखने के बजाय, हम केवल कमजोर वाक्यों और भ्रमित पात्रों को लक्षित रूप से संपादित कर सकते हैं, जिससे अधिक स्मार्ट, तेज़ और विश्वसनीय AI टीमें बनती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →