← नवीनतम पेपर
🤖 AI

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

यह शोध पत्र HALO को प्रस्तुत करता है, जो एक हाइब्रिड एजेंट-लर्नड ऑर्केस्ट्रेटर है जो एंड-टू-एंड PDDL प्लानिंग के लिए एक छोटे, लागत-कुशल पॉलिसी को प्रशिक्षित करने के लिए वेरीफायर-सर्टिफाइड रिफाइनमेंट ट्रेजेक्टरीज का लाभ उठाता है, जिससे फ्रंटियर LLMs के तुलनीय सफलता दर प्राप्त होती है जबकि ऑर्केस्ट्रेशन लागत को एक क्रम से अधिक (order of magnitude) कम किया जाता है।

मूल लेखक: Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "अनुवादक" की बाधा (The "Translator" Bottleneck)

कल्पना कीजिए कि आप फर्नीचर का एक जटिल टुकड़ा बनाना चाहते हैं। आपके पास एक रफ स्केच है और साधारण अंग्रेजी में लिखे हुए कुछ विचार हैं (Natural Language)। हालाँकि, वह मशीन जो वास्तव में फर्नीचर बनाती है (Classical Planner), केवल एक बहुत ही सख्त, रोबोटिक कोड समझती है जिसे PDDL कहा जाता है।

यदि आप किसी सामान्य AI (जैसे Large Language Model या LLM) से वह कोड लिखने के लिए कहते हैं, तो वह अक्सर गलतियाँ करता है। वह ऐसे पुर्जे बना सकता है जो मौजूद ही नहीं हैं, पेच (screws) की सूची लिखना भूल सकता है, या ऐसे निर्देश लिख सकता है जिन्हें मशीन पढ़ ही न सके।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक "रिपेयर टीम" बनाई। उनके पास एक मैनेजर (Or\Orchestrator) है जो टूटे हुए कोड को देखता है और विशिष्ट त्रुटियों को ठीक करने के लिए विशेषज्ञों (Agents) की एक टीम को काम पर रखता है। एक विशेषज्ञ व्याकरण (grammar) ठीक करता है, दूसरा तर्क (logic) ठीक करता है, और दूसरा यह जाँचता है कि क्या पुर्जे आपस में फिट बैठते हैं।

चुनौती: पुराने सिस्टम में, मैनेजर एक बहुत महंगा, हाई-एंड AI (जैसे GPT-5 या Gemini) था। हर बार जब टीम को किसी गलती को सुधारने की आवश्यकता होती थी, तो आपको मैनेजर को समस्या पर सोचने और अगला विशेषज्ञ चुनने के लिए एक भारी शुल्क देना पड़ता था। यदि किसी प्रोजेक्ट को ठीक करने में 10 कदम लगते, तो आपको मैनेजर को 10 बार भुगतान करना पड़ता था। यह पूरी प्रक्रिया को छोटे लैब्स या स्थानीय कंप्यूटरों के लिए बहुत महंगा बना देता था।

समाधान: HALO (द इंटर्न मैनेजर)

इस पेपर के लेखक, राजेश मंगन्नवर और उनकी टीम ने पूछा: "क्या हमें हर एक कदम के लिए एक बहुत महंगे मैनेजर की वास्तव में आवश्यकता है? क्या हम एक सस्ते, स्थानीय इंटर्न को यह काम करने के लिए प्रशिक्षित कर सकते हैं?"

उन्होंने HALO (Hybrid Agent-Learned Orchestrator) बनाया। यह कैसे काम करता है, इसके तीन मुख्य तरीके यहाँ दिए गए हैं:

1. "जीतने वाले" प्लेबुक से सीखना

आमतौर पर, AI को प्रशिक्षित करना कठिन होता है क्योंकि आपको हर चरण के लिए "सही" उत्तर नहीं पता होता। लेकिन इस सिस्टम में, एक रेफरी (Verifier) है जो अंतिम फर्नीचर की जाँच करता है।

  • यदि अंतिम योजना काम करती है, तो रेफरी कहता है, "अच्छा काम किया!"
  • टीम ने महसूस किया: हर बार जब रेफरी ने "अच्छा काम किया" कहा, तो उनके द्वारा उपयोग किए गए मैनेजरों और विशेषज्ञों का क्रम एक जीतने वाली रणनीति थी।

उन्होंने हजारों ऐसे "जीतने वाले प्लेबुक" लिए, उनमें से महंगे मैनेजर की आवाज़ को हटा दिया, और केवल यह रिकॉर्ड रखा: "जब कोड X जैसा दिखता था, तो जीतने वाली टीम ने विशेषज्ञ Y को चुना।" उन्होंने इस डेटा का उपयोग HALO नामक एक छोटे, सस्ते AI को उन जीतने वाले निर्णयों की नकल करने के लिए प्रशिक्षित करने के लिए किया।

2. "नियम पुस्तिका" का शॉर्टकट (The "Rulebook" Shortcut)

HALO केवल एक दिमाग नहीं है; यह एक दिमाग है जिसके पास एक 'चीट शीट' है। लेखकों ने महसूस किया कि कुछ निर्णय इतने स्पष्ट होते हैं कि एक इंसान को भी उनके बारे में सोचने की आवश्यकता नहीं होगी।

  • उदाहरण: यदि कोड खाली है, तो नियम है "इमरजेंसी एजेंट को बुलाएं।"
  • उदाहरण: यदि कोड में स्पेलिंग की गलती है, तो नियम है "सिंटैक्स एजेंट को बुलाएं।"
  • उदाहरण: यदि योजना एकदम सही है, तो नियम है "रुकें।"

HALO पहले इन सरल नियमों की जाँच करता है। यदि कोई नियम लागू होता है, तो यह अपने "दिमाग" (AI मॉडल) का उपयोग किए बिना तुरंत कार्य करता है। इससे समय और पैसा दोनों बचते हैं। केवल तभी जब समस्या वास्तव में भ्रमित करने वाली होती है, तब HALO निर्णय लेने के लिए अपने प्रशिक्षित AI का उपयोग करता है।

3. एक बड़ा टूलबॉक्स

टीम ने विशेषज्ञों की टीम का विस्तार भी किया। उन्होंने मूल 13 विशेषज्ञों में 8 नए विशेषज्ञ जोड़े, जिससे कुल संख्या 21 हो गई। इनमें से कुछ नए विशेषज्ञ "डिटरमिनिस्टिक" (deterministic) हैं, जिसका अर्थ है कि वे सरल कंप्यूटर स्क्रिप्ट हैं जो तुरंत चलती हैं और जिनका कोई खर्च नहीं होता, बजाय महंगे AI मॉडल्स के। इसने HALO को समस्याओं को तेज़ी से हल करने के लिए अधिक उपकरण दिए।

परिणाम: तेज़, सस्ता और उतना ही बेहतर

टीम ने 11 अलग-अलग प्रकार की प्लानिंग समस्याओं (जैसे लॉजिस्टिक्स, रोबोट मूवमेंट और शेड्यूलिंग) पर HALO का महंगे, हाई-एंड AI मैनेजर्स के मुकाबले परीक्षण किया।

  • सफलता दर (Success Rate): HALO महंगे AI के समान ही अच्छा था, या कभी-कभी उससे भी बेहतर था। इसने समस्याओं को उसी दर से हल किया।
  • गति (Speed): क्योंकि HALO आसान समस्याओं के लिए सरल नियमों का उपयोग करता है और कठिन कार्यों के लिए एक छोटे स्थानीय मॉडल का, यह बहुत तेज़ी से निर्णय लेता है।
  • लागत (Cost): यह सबसे बड़ी जीत है।
    • पुराने तरीके (GPT-5 का उपयोग करने) में प्रति कार्य लगभग $0.18 का खर्च आता था।
    • HALO का खर्च प्रति कार्य लगभग $0.004 है।
    • यह लगभग 45 गुना सस्ता है। यह हर भोजन के लिए एक सेलिब्रिटी शेफ को काम पर रखने के बजाय एक अत्यधिक प्रशिक्षित स्थानीय रसोइये को रखने जैसा है जो सरल व्यंजनों के लिए रेसिपी बुक का उपयोग करता है।

निष्कर्ष (The Bottom Line)

यह पेपर साबित करता है कि आपको रिपेयर एजेंटों की टीम को प्रबंधित करने के लिए एक "सुपर-इंटेलिजेंट" AI की आवश्यकता नहीं है। यदि आपके पास एक सख्त रेफरी (Verifier) है जो आपको बताता है कि एक योजना सफल है या नहीं, तो आप एक छोटे, सस्ते AI को उन सफलताओं से सीखने के लिए प्रशिक्षित कर सकते हैं।

यह जटिल प्लानिंग सिस्टम को एक लैब (या यहाँ तक कि एक लैपटॉप) में एक सिंगल कंप्यूटर पर चलाने की अनुमति देता है, बिना हर बार महंगे क्लाउड API के लिए भुगतान किए। यह एक लग्जरी सेवा को ऐसी चीज़ में बदल देता है जिसे कोई भी स्थानीय रूप से चला सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →