← नवीनतम पेपर
💻 computer science

SAGE: Stochastic Prompt Optimization via Agent-Guided Exploration

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक स्टोकेस्टिक प्रॉम्प्ट ऑप्टिमाइज़ेशन फ्रेमवर्क है जो ओपन-एंडेड टास्क-ओरिएंटेड डायलॉग सिस्टम को प्रभावी ढंग से सुधारने के लिए मल्टी-एजेंट एक्सप्लोरेशन और डायग्नोस्टिक कोड निष्पादन का लाभ उठाता है, जो निरंतर, एजेंट-निर्देशित ए/बी टेस्टिंग के माध्यम से उपयोगकर्ता प्रतिधारण (यूज़र रिटेंशन) में सांख्यिकीय रूप से सुदृढ़ लाभ प्रदर्शित करता है।

मूल लेखक: Ziyi Zhu, Luka Smyth, Saki Shinoda, Jinghong Chen

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyi Zhu, Luka Smyth, Saki Shinoda, Jinghong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े जिद्दी रोबोट को एक अच्छी बातचीत करना सिखाने की कोशिश कर रहे हैं। आप उसे निर्देशों का एक सेट (एक "प्रॉम्ट") देते हैं, लेकिन वह गलतियाँ करता रहता है। इस पेपर का लक्ष्य यह पता लगाना है कि उन निर्देशों को लिखने का सबसे अच्छा तरीका क्या है ताकि रोबोट बेहतर हो सके, बिना खुद रोबोट को फिर से प्रशिक्षित (retrain) किए।

लेखक अपने नए तरीके को SAGE (Stochastic Prompt Optimization via Agent-Guided Exploration) कहते हैं। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ तोड़कर समझाया गया है:

समस्या: "आंखों पर पट्टी बंधा हाइकर"

सोचिए कि सभी संभावित निर्देशों का स्थान एक विशाल, धुंधले पहाड़ों के क्षेत्र जैसा है। पहाड़ों की चोटी "परफेक्ट" निर्देशों का एक सेट है।

  • पुराने तरीके एक ऐसे हाइकर की तरह थे जो एक बार में एक कदम आगे बढ़ता है और केवल अपने सामने की जमीन को देखता है। यदि उसने एक कदम लिया और उसे थोड़ा बेहतर महसूस हुआ, तो वह उसी दिशा में बढ़ता रहा। लेकिन इस वजह से वह अक्सर एक छोटी सी पहाड़ी पर फंस जाता था, यह सोचकर कि यही शिखर है, जबकि अगली पहाड़ी के ऊपर एक बहुत ऊँचा पर्वत मौजूद था।
  • वास्तविकता: पेपर का तर्क है कि आप शिखर खोजने के लिए गणितीय "ग्रेडिएंट्स" (जैसे एक चिकनी ढलान से नीचे उतरना) का उपयोग नहीं कर सकते क्योंकि निर्देश शब्दों से बने होते हैं, संख्याओं से नहीं। यह परिदृश्य "शोर भरा" (noisy) और ऊबड़-खाबड़ है।

समाधान: खोजकर्ताओं की एक टीम

लेखकों ने इस पहाड़ पर चढ़ने के तीन अलग-अलग तरीकों का परीक्षण किया:

  1. "जुआरी" (SPO-RS): यह तरीका पासा फेंकने जैसा है। यह वर्तमान निर्देशों को लेता है, उसमें कुछ यादृच्छिक अराजकता (high temperature) जोड़ता है, और AI से एक नया संस्करण अनुमान लगाने को कहता है। यह तेज़ और रैंडम है, लेकिन यह वास्तव में इस बारे में नहीं सोचता कि पिछला संस्करण क्यों विफल हुआ।
  2. "प्रजनक" (SPO-GA): यह एक जेनेटिक एल्गोरिदम की तरह है। यह निर्देशों के दो सबसे अच्छे संस्करणों को लेता है, उन्हें आपस में मिलाता है (crossover), और छोटे-छोटे बदलाव (mutation) करता है। यह जुआरी से अधिक स्मार्ट है लेकिन अभी भी मुख्य रूप से AI के अनुमान पर निर्भर करता है कि क्या बदलाव किया जाए।
  3. "जासूस टीम" (SAGE): यह इस पेपर का मुख्य आकर्षण है। केवल अनुमान लगाने के बजाय, SAGE एक जासूसों की टीम की तरह काम करता है।
    • एनालिस्ट (विश्लेषक): रोबोट द्वारा की गई सभी गलतियों को देखता है और पैटर्न खोजने के लिए कोड चलाता है। (जैसे, "हे, रोबोट हर बार विफल हो जाता है जब उपयोगकर्ता पैसे के बारे में पूछता है।")
    • इन्वेस्टिगेटर (जांचकर्ता): विशिष्ट उदाहरणों की गहराई से जांच करता है ताकि यह साबित किया जा सके कि पैटर्न वास्तविक है।
    • जेनरेटर (उत्पादक): विशेष रूप से उस सटीक पैटर्न को ठीक करने के लिए डिज़ाइन किए गए निर्देशों का एक नया सेट लिखता है।

मुख्य अंतर: पहले दो तरीके सिर्फ "चीजों को आज़माते" हैं। SAGE पहले समस्या का निदान (diagnose) करता है, फिर इलाज बताता है। यह पैटर्न को समझने के लिए AI की अपनी राय के बजाय कंप्यूटर कोड का उपयोग करता है।

परिणाम: एक ही आकार सबके लिए सही नहीं है

शोधकर्ताओं ने तीन अलग-अलग प्रकार के कार्यों पर इन तरीकों का परीक्षण किया:

  • वित्तीय गणित (Financial Math): एक जटिल, श्रृंखला-प्रतिक्रिया वाली त्रुटियों वाला कार्य। यहाँ, जासूस टीम (SAGE) जीत गई क्योंकि यह भ्रम के मूल कारण का पता लगा सकती थी।
  • नाम टैगिंग (Name Tagging): एक सरल कार्य। यहाँ, प्रजनक (Breeder) या साधारण रैंडम अनुमान भी उतना ही अच्छा काम कर रहा था। जासूस टीम इस सरल काम के लिए वास्तव में बहुत जटिल थी।
  • ऐप कंट्रोल (App Control): एक कार्य जहाँ रोबोट को ऐप्स का उपयोग करना होता है। यहाँ प्रजनक ने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया।

सबक: कोई एक तरीका "सर्वश्रेष्ठ" नहीं है। यदि त्रुटियां सरल हैं, तो एक सरल खोज काम करती है। यदि त्रुटियां जटिल और श्रृंखला-प्रतिक्रिया वाली (जैसे ताश के पत्तों का महल गिरना) हैं, तो आपको जासूस टीम के गहरे विश्लेषण की आवश्यकता होती है।

वास्तविक दुनिया का परीक्षण: मानसिक स्वास्थ्य चैटबॉट

यह साबित करने के लिए कि यह काम करता है, उन्होंने एक मानसिक स्वास्थ्य चैटबॉट (जिसका नाम "Ash" है) पर SAGE को तैनात किया जो वास्तविक लोगों से बात करता है।

  • चुनौती: आप एक साधारण गणित स्कोर के साथ यह आसानी से नहीं माप सकते कि एक चैटबॉट "सहायक" है या नहीं। सिग्नल शोर भरा (noisy) है।
  • रणनीति: उन्होंने आठ सप्ताह तक चैटबॉट चलाया। हर हफ्ते, उन्होंने बातचीत का विश्लेषण करने, निर्देशों का एक थोड़ा बेहतर संस्करण बनाने और यह देखने के लिए एक त्वरित परीक्षण (A/B टेस्ट) चलाने के लिए SAGE का उपयोग किया कि क्या नए संस्करण के साथ उपयोगकर्ता अगले दिन वापस आते हैं।
  • जादू: व्यक्तिगत रूप से, इनमें से अधिकांश साप्ताहिक परीक्षण सांख्यिकीय रूप से कुछ भी साबित करने के लिए बहुत छोटे थे। लेकिन उन्हें एक साथ जोड़ने से, छोटे सुधार जुड़ते गए।
  • परिणाम: आठ चक्रों में, चैटबॉट की उपयोगकर्ताओं को अगले दिन वापस लाने की क्षमता में 29% का सुधार हुआ।

मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि खुले अंत वाले कार्यों (जैसे इंसान से बात करना) के लिए, आपको गुणात्मक निदान (मानव या एजेंट यह देखते हैं कि चीजें क्यों गलत हुईं) के साथ मात्रात्मक सत्यापन (संख्याओं की जांच करना) को जोड़ने की आवश्यकता है।

SAGE इसलिए काम करता है क्योंकि यह केवल अंधाधुंध अनुमान नहीं लगाता; यह सूक्ष्मदर्शी (microscope) के रूप में कार्य करने के लिए कोड का उपयोग करता है, निर्देशों में विशिष्ट दरारों को ढूंढता है और उन्हें ठीक करता है, जिससे कई छोटे, शोर भरे सुधारों को एक बड़े, मजबूत परिणाम में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →