← नवीनतम पेपर
🤖 AI

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

FAPO एक पूर्णतः स्वायत्त ढांचा है जो प्रॉम्प्ट और चेन संरचनाओं दोनों का पुनरावृत्ति के माध्यम से मूल्यांकन, निदान और परिशोधन करके मल्टी-स्टेप LLM पाइपलाइनों को अनुकूलित करता है, जिससे GEPA बेसलाइन से बेहतर प्रदर्शन करते हुए सामान्य और सुरक्षा-केंद्रित बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जटिल पहेली सुलझाने के लिए मिलकर काम करने वाले रोबोटों की एक टीम है। प्रत्येक रोबोट का एक विशिष्ट कार्य है: एक सुराग ढूंढता है, दूसरा उनके बारे में सोचता है, और तीसरा अंतिम उत्तर लिखता है। कभी-कभी, पूरी टीम विफल हो जाती है, लेकिन यह बताना कठिन होता है कि किस रोबोट ने गड़बड़ी की। क्या पहले वाले ने कोई सुराग मिस कर दिया? क्या दूसरा भ्रमित हो गया? या क्या तीसरे ने उत्तर गलत फॉर्मेट में लिखा?

यह मल्टी-स्टेप LLM पाइपलाइन्स (जटिल AI कार्यों की श्रृंखला) के साथ होने वाली समस्या है। पारंपरिक तरीके पूरे समूह को ठीक करने के लिए केवल "बॉस" रोबोट को दिए गए निर्देशों (प्रॉम्ट) को फिर से लिखने की कोशिश करते हैं। लेकिन यदि समस्या यह है कि टीम एक चरण भूल रही है या वे गलत लोगों से बात कर रहे हैं, तो केवल निर्देशों को बदलने से कोई मदद नहीं मिलेगी।

पेश है FAPO (फुली ऑटोनॉमस प्रॉम्ट ऑप्टिमाइज़ेशन)। FAPO को एक सुपर-स्मार्ट, ऑटोनॉमस प्रोजेक्ट मैनेजर के रूप में सोचें (जो Claude Code नामक एक AI द्वारा संचालित है) जो केवल निर्देश ही नहीं लिखता; बल्कि यह पूरे दल के काम करने के तरीके को देखता है, सटीक बाधा (bottleneck) को ढूंढता है, और उसे ठीक करता है।

FAPO कैसे काम करता है, इसे सरल उपमाओं का उपयोग करके यहाँ समझाया गया है:

1. डिटेक्टिव चरण (निरीक्षण)

अनुमान लगाने के बजाय, FAPO एक अभ्यास पहेली को हल करने के दौरान टीम को देखता है। यह हर चाल, खोजा गया हर सुराग और हर विचार प्रक्रिया को रिकॉर्ड करता है। यदि टीम उत्तर गलत देती है, तो FAPO एक जासूस की तरह काम करता है:

  • "क्या हम इसलिए विफल हुए क्योंकि हमने सही सुराग नहीं ढूंढा?" (रिट्रीवल विफलता)
  • "क्या हमने सुराग तो ढूंढ लिया लेकिन उसे गलत समझ लिया?" (रीजनिंग विफलता)
  • "क्या हमने उसे समझ लिया लेकिन उत्तर गलत फॉर्मेट में लिखा?" (फॉर्मेटिंग विफलता)

2. "पहले ठीक करें" का नियम (प्रॉम्ट संपादन)

FAPO एक सख्त नियम का पालन करता है: छोटी शुरुआत करें।
यदि जासूस को पता चलता है कि टीम को बस स्पष्ट निर्देशों की आवश्यकता है, तो FAPO प्रॉम्ट (निर्देशों) को फिर से लिख देता है। यह रोबोटों को यह बताने जैसा है, "अरे, नीले बॉक्स के बजाय लाल बॉक्स को देखो।" यह इसे पहले आजमाता है क्योंकि यह सबसे आसान समाधान है।

3. "रीडिजाइन" चरण (संरचनात्मक परिवर्तन)

यदि FAPM बार-बार निर्देशों को फिर से लिखने की कोशिश करता है, लेकिन टीम फिर भी विफल हो जाती है क्योंकि उन्हें एक महत्वपूर्ण चरण की आवश्यकता है (जैसे कि गणित को दोबारा जांचने के लिए चौथे रोबोट की आवश्यकता), तो FAPO को टीम की संरचना बदलने की अनुमति मिलती है।

  • यह टीम में एक नया रोबोट जोड़ सकता है।
  • यह इस क्रम को बदल सकता है जिसमें रोबोट एक-दूसरे से बात करते हैं।
  • यह एक "सुरक्षा जांच" चरण जोड़ सकता है जो टीम को अंतिम उत्तर लिखने से पहले विशिष्ट नियमों का पालन करने के लिए मजबूर करता है।

यही मुख्य अंतर है: FAPO पाइपलाइन की संरचना में परिवर्तन तभी करता है जब वह यह साबित कर देता है कि केवल शब्दों (प्रॉम्ट्स) को बदलना पर्याप्त नहीं है।

4. सुरक्षा निरीक्षक (गार्डरेल्स)

FAPO द्वारा कोई भी बदलाव करने से पहले, एक "सुरक्षा निरीक्षक" (एक अन्य AI एजेंट) योजना की जांच करता है। यह सुनिश्चित करता है कि FAPO गलती से महत्वपूर्ण नियमों को हटा न दे, निजी डेटा लीक न कर दे, या स्कोरिंग सिस्टम को खराब न कर दे। यह एक निर्माण कार्य शुरू होने से पहले नवीनीकरण योजना की जांच करने वाले बिल्डिंग इंस्पेक्टर की तरह है।

परिणाम: यह कितना अच्छा रहा?

पेपर ने FAPO का परीक्षण GEPA (जो एक बहुत अच्छा संपादक है जो केवल निर्देश ही लिखता है) के विरुद्ध छह अलग-अलग प्रकार की चुनौतियों में किया, जिनमें गणित की समस्याएं से लेकर सुरक्षा कार्य तक शामिल थे।

  • स्कोरबोर्ड: FAPO 18 में से 15 बार जीता।
  • बड़ी जीत: सबसे कठिन कार्यों पर (जैसे जटिल कहानियों की तथ्य-जांच करना या सख्त फॉर्मेटिंग नियमों का पालन करना), FAPO ने केवल निर्देशों को ट्यून नहीं किया; बल्कि इसे एहसास हुआ कि टीम को एक नई संरचना की आवश्यकता है। इन मामलों में, FAPO के स्कोर में भारी उछाल आया (प्रतिस्पर्धा से +33.8 प्रतिशत अंक बेहतर)।
  • सुरक्षा कार्य: FAPO ने यह भी सुधार किया कि AI मॉडल सुरक्षा कमजोरियों (जैसे सॉफ्टवेयर बग्स को उनके कारणों से मैप करना) को कितनी अच्छी तरह पहचान सकते हैं, जिससे यह साबित हुआ कि यह गंभीर, उच्च-दांव वाले कार्यों के लिए भी काम करता है।

एक अपवाद

वहाँ एक गणित प्रतियोगिता (AIME) थी जहाँ FAPO नहीं जीता। लेखकों का सुझाव है कि ऐसा इसलिए हो सकता है क्योंकि गणित के प्रश्न इतने कठिन थे और सैंपल साइज इतना छोटा था कि AI "भ्रमित" हो गया या वास्तव में गणित को बेहतर सीखने के बजाय अभ्यास समस्याओं के प्रति "ओवर-फिट" हो गया।

सारांश

FAPO एक स्मार्ट मैनेजर की तरह है जो केवल श्रमिकों को "बेहतर करो" कहकर चिल्लाता नहीं है। इसके बजाय, यह वर्कफ़्लो को देखता है, निदान करता है कि प्रक्रिया कहाँ टूट रही है, पहले निर्देशों को ठीक करता है, और यदि वह विफल हो जाता है, तो यह टीम को अधिक प्रभावी बनाने के लिए पूरे वर्कफ़्लो को फिर से डिजाइन करता है। यह AI चरणों की एक अव्यवस्थित, विफल श्रृंखला को एक विश्वसनीय, उच्च-प्रदर्शन करने वाली मशीन में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →