← नवीनतम पेपर
🤖 AI

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Uno-Orchestra एक एकीकृत, सुदृढीकरण शिक्षण (reinforcement learning) आधारित ऑर्केस्ट्रेशन पॉलिसी पेश करता है जो विविध बेंचमार्क पर कठोर मल्टी-एजेंट सिस्टम की तुलना में काफी अधिक सटीकता और कम लागत प्राप्त करने के लिए टास्क डिकंपोजिशन डेप्थ, वर्कर सिलेक्शन और इन्फरेंस बजट को संयुक्त रूप से अनुकूलित करता है।

मूल लेखक: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत बड़ी, जटिल समस्या को हल करने की चुनौती है, जैसे कि एक देश से दूसरे देश की सड़क यात्रा (road trip) की योजना बनाना जिसमें होटल ढूँढना, उड़ान बुक करना, ट्रैफिक चेक करना और भोजन पकाना शामिल हो।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, आज के अधिकांश सिस्टम इसे दो अनाड़ी तरीकों से संभालते हैं:

  1. "एक ही आकार सबके लिए" वाला बॉस (The "One-Size-Fits-All" Boss): वे हर काम करने के लिए—फ्लाइट बुक करने से लेकर सब्जियां काटने तक—सबसे महंगे, सुपर-स्मार्ट CEO (एक विशाल AI मॉडल) को काम पर रखते हैं। यह काम तो करता है, लेकिन मौसम देखने जैसे सरल कार्यों के लिए भी यह अविश्वसनीय रूप से महंगा और धीमा है।
  2. "कठोर असेंबली लाइन" (The "Rigid Assembly Line"): उनके पास एक पहले से लिखा हुआ स्क्रिप्ट होता है जो कहता है, "पहले, CEO से फ्लाइट के बारे में पूछो। फिर, CEO से होटल के बारे में पूछो।" यह लचीला नहीं है। यदि CEO व्यस्त है या कार्य बदल जाता है, तो पूरी लाइन टूट जाती है।

Uno-Orchestra इस शो को चलाने का एक नया, स्मार्ट तरीका है। इसे एक प्रतिभाशाली, लागत-कुशल टूर मैनेजर (Tour Manager) के रूप में समझें जो खुद काम नहीं करता, बल्कि यह जानता है कि काम के हर छोटे हिस्से के लिए किसे काम पर रखना है।

मूल विचार: "चयनात्मक प्रतिनिधि बनाना" (Selective Delegation)

टूर मैनेजर (Uno-Orchestra) आपके अनुरोध को देखता है और एक साथ दो प्रश्न पूछता है:

  1. "क्या मुझे इसे तोड़ने की आवश्यकता है?" (विखंडन/Decomposition)
  2. "इस विशिष्ट हिस्से के लिए सबसे अच्छा व्यक्ति कौन है?" (रूटिंग/Routing)
  • यदि कार्य सरल है (जैसे, "2+2 क्या है?"), तो मैनेजर कहता है, "मुझे किसी को बुलाने की आवश्यकता नहीं है। मैं इसे तुरंत खुद ही उत्तर दे दूँगा।" यह पैसा और समय बचाता है।
  • यदि कार्य जटिल है (जैसे, "स्टॉक डेटा का विश्लेषण करने और उसे विज़ुअलाइज़ करने के लिए एक पायथन स्क्रिप्ट लिखें"), तो वह इसे उप-कार्यों में तोड़ देता है: "डेटा खोजें," "कोड लिखें," "कोड चलाएं," "चार्ट बनाएं।"
  • जादुई ट्रिक: प्रत्येक उप-कार्य के लिए, मैनेजर परफेक्ट कार्यकर्ता चुनता है। वे "डेटा खोजने" के कार्य को एक तेज़, सस्ते इंटर्न (एक छोटा, सस्ता AI मॉडल) को भेज सकते हैं। लेकिन वे "चार्ट बनाने" के कार्य को एक विशेष, महंगे कलाकार (एक शक्तिशाली, महंगा AI मॉडल) को भेज सकते हैं।

इसने इतनी कुशलता कैसे सीखी

पेपर एक दो-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है, जैसे किसी नए कर्मचारी को प्रशिक्षित करना:

  1. इंटर्नशिप (सुपरवाइज्ड फाइन-ट्यूनिंग): सिस्टम ने एक "मास्टर मैनेजर" को समस्या सुलझाते हुए 61,000 उदाहरण देखे। उस मास्टर मैनेजर ने वास्तविक उपकरणों और वास्तविक कोड निष्पादन (सिर्फ अनुमान लगाने के बजाय) का उपयोग किया था। सिस्टम ने इन सफल पैटर्न को कॉपी करना सीखा: कब चीजों को तोड़ना है, और किस काम के लिए किस कार्यकर्ता को चुनना है।
  2. सिमुलेशन लीग (रीइन्फोर्समेंट लर्निंग): इसके बाद सिस्टम को एक "प्रशिक्षण अरीना" में डाला गया जहाँ उसे अपने आप कठिन समस्याओं को हल करना था।
    • यदि उसने समस्या को सही ढंग से और सस्ते में हल किया, तो उसे उच्च स्कोर मिला।
    • यदि उसने इसे सही ढंग से हल किया लेकिन पैसे बर्बाद किए, तो उसे कम स्कोर मिला।
    • यदि वह विफल रहा, तो उसे शून्य मिला।
    • महत्वपूर्ण बात यह है कि सिस्टम ने विशिष्ट चरणों को श्रेय (या दोष) देना सीखा। यदि उसने चरण 3 के लिए गलत कार्यकर्ता चुना, तो उसने केवल सामान्य "आप विफल रहे" के बजाय उस विशिष्ट गलती से सीखा।

परिणाम: तेज़, सस्ता और स्मार्ट

शोधकर्ताओं ने इस नए टूर मैनेजर का परीक्षण 22 अन्य सिस्टमों (अन्य "राउटर्स" और "असेंबली लाइनों" सहित) के खिलाफ 13 विभिन्न प्रकार की चुनौतियों, जैसे गणित, कोडिंग और लंबे दस्तावेज़ पढ़ने के माध्यम से किया।

  • स्कोर: Uno-Orchestra की सफलता दर 77% रही, जो अगले सबसे अच्छे सिस्टम से लगभग 16% बेहतर थी।
  • लागत: इससे भी अधिक प्रभावशाली बात यह है कि इसने यह सब भारी-भरकम वर्कफ़्लो सिस्टमों की तुलना में प्रति क्वेरी 10 गुना कम लागत में किया।

यह बेहतर क्यों काम करता है

पेपर का दावा है कि इसका रहस्य लचीलापन (Flexibility) है।

  • पुराने सिस्टम या तो सब कुछ एक विशाल दिमाग से करने की कोशिश करते थे (बहुत महंगा) या एक कठोर स्क्रिप्ट का पालन करते थे (बहुत कम बुद्धिमान)।
  • Uno-Orchestra एक जैज़ संगीतकार की तरह है। वह जानता है कि कब एक सरल, एकल नोट बजाना है (एक सीधा उत्तर) और कब एक पूरे बैंड को बुलाना है (कार्य को विभाजित करना), और वह जानता है कि प्रत्येक नोट के लिए किस वाद्य यंत्र (AI मॉडल) की आवश्यकता है।

संक्षेप में

Uno-Orchestra एक ऐसा सिस्टम है जो एक स्मार्ट प्रोजेक्ट मैनेजर बनना सीखता है। यह केवल प्रश्नों को रूट नहीं करता; यह तय करता है कि उन्हें कैसे तोड़ना है और किसे सौंपना है, और यह सब एक सख्त बजट बनाए रखते हुए करता है। यह साबित करता है कि सबसे कठिन समस्याओं को हल करने के लिए आपको सबसे महंगे AI की आवश्यकता नहीं है; आपको बस सही समय पर सही काम के लिए सही AI की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →