← नवीनतम पेपर
🤖 AI

LLMs as Orchestrators: Constraint-Compliant Multi-Agent Optimization for Recommendation Systems

यह शोध पत्र DualAgent-Rec को प्रस्तुत करता है, जो एक LLM-समन्वित दोहरी-एजेंट रूपरेखा (dual-agent framework) है, जो विशेष शोषण (exploitation) और अन्वेषण (exploration) एजेंटों को अनुकूल रूप से ऑर्केस्ट्रेट करके ई-कॉमर्स अनुशंसा प्रणालियों में 100% बाधा संतुष्टि (constraint satisfaction) और बेहतर बहु-उद्देश्य प्रदर्शन प्राप्त करता है।

मूल लेखक: Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल ऑनलाइन स्टोर चला रहे हैं। आपका लक्ष्य ग्राहकों को 10 ऐसे उत्पादों की सूची दिखाना है जिन्हें वे पसंद करेंगे। लेकिन आपका काम कठिन है: आपको एक साथ तीन चीजों को संतुलित करना है।

  1. सटीकता (Accuracy): उन्हें वे चीजें दिखाएं जो वे वास्तव में चाहते हैं।
  2. विविधता (Diversity): उन्हें केवल 10 लाल जूते न दिखाएं; उन्हें जूते, टोपी और बैग दिखाएं।
  3. कठोर नियम (Hard Rules): आपको सख्त व्यावसायिक कानूनों का पालन करना ही होगा। उदाहरण के लिए, "आप केवल एक ही विक्रेता के सामान नहीं दिखा सकते," "आपको कम से कम एक बिल्कुल नया उत्पाद शामिल करना चाहिए," और "आप वस्तुओं की किसी एक श्रेणी को बहुत अधिक महत्व नहीं दे सकते।"

अतीत में, कंप्यूटर सिस्टम इसे हल करने का प्रयास करते थे जहाँ "कठोर नियमों" को नरम सुझावों के रूप में माना जाता था। वे कहते थे, "नियमों का पालन करने की कोशिश करें, लेकिन यदि आपको कोई बहुत अच्छा उत्पाद मिलता है जो नियम तोड़ता है, तो यह ठीक है।" वास्तविक दुनिया में, यह एक आपदा है। यदि सिस्टम एक बार भी नियम तोड़ता है, तो व्यवसाय को नुकसान हो सकता है या विश्वास खोना पड़ सकता है।

शोध पत्र "LLMs as Orchestrators" इस समस्या को ठीक करने के लिए DualAgent-Rec नामक एक नया सिस्टम पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग करते हैं:

1. दो विशिष्ट टीमें (The Dual Agents)

एक बड़ी टीम के रूप में जो एक साथ सब कुछ करने की कोशिश करती है, इसके बजाय, यह सिस्टम काम को दो विशिष्ट समूहों में विभाजित करता है, जैसे कि एक निर्माण स्थल पर दो अलग-अलग दल:

  • "एक्सप्लोइटेशन" टीम (The Refiners - परिष्कृत करने वाले): यह टीम एक मास्टर शेफ की तरह है जो केवल उन व्यंजनों को पकाता है जो पहले से ही स्वादिष्ट और सुरक्षित ज्ञात हैं। उनका काम सर्वोत्तम, नियम-पालक सिफारिशों को लेकर उन्हें पूरी तरह से निखारना है। वे बहुत सावधान होते हैं और कभी भी नियम नहीं तोड़ते।
  • "एक्सप्लोरेशन" टीम (The Adventurers - साहसी): यह टीम जंगली आविष्कारकों के एक समूह की तरह है। उन्हें पागल संयोजन आजमाने और अस्थायी रूप से नियमों को तोड़ने की अनुमति है। वे एक सूची सुझा सकते हैं जिसमें एक ही विक्रेता के बहुत अधिक आइटम हों, लेकिन ऐसा करने में, वे गलती से एक छिपा हुआ रत्न या उत्पादों को मिलाने का एक नया तरीका खोज सकते हैं जिसे "रिफाइनर्स" कभी नहीं सोच पाएंगे।

2. LLM कंडक्टर (The Orchestrator - संचालक)

अतीत में, इन दो टीमों को एक कठोर कार्यक्रम (जैसे, "रिफाइनर्स पर 70% समय और एडवेंचरर्स पर 30% समय खर्च करें") द्वारा प्रबंधित किया जाता था।

यह शोध पत्र एक लार्ज लैंग्वेज मॉडल (LLM) को कंडक्टर या मैनेजर के रूप में पेश करता है।

  • कंडक्टर दोनों टीमों को वास्तविक समय में देखता है।
  • यदि "एडवेंचरर्स" नए और शानदार विचार खोज रहे हैं लेकिन "रिफाइनर्स" अटक गए हैं, तो कंडक्टर कहता है, "एडवेंचरर्स को अधिक समय दें!"
  • यदि "रिफाइनर्स" बहुत अच्छा कर रहे हैं और "एडवेंचर्स" केवल गलतियाँ कर रहे हैं, तो कंडक्टर कहता है, "काम पूरा करने के लिए रिफाइनर्स पर अधिक ध्यान केंद्रित करें।"
  • कंडक्टर केवल एक स्क्रिप्ट का पालन नहीं करता है; वह प्रगति के बारे में सोचता है और गतिशील रूप से निर्णय लेता है कि प्रत्येक टीम को कितनी ऊर्जा देनी है।

3. "सॉफ्टनिंग" सेफ्टी नेट (Adaptive Relaxation - अनुकूलनशील ढील)

कल्पना कीजिए कि आप एक चौकोर टुकड़े को गोल छेद में फिट करने की कोशिश कर रहे हैं। यदि आप तुरंत ज़बरदस्ती करेंगे, तो वह फिट नहीं होगा।
सिस्टम Adaptive Relaxation नामक एक तरकीब का उपयोग करता है।

  • शुरुआत में: सिस्टम ऐसा व्यवहार करता है जैसे नियम थोड़े "नरम" हों। यह "एडवेंचरर्स" को ऐसे समाधान आज़माने की अनुमति देता है जो लगभग सही हैं। यह उन्हें बिना तुरंत फंसें अधिक स्वतंत्र रूप से अन्वेषण करने में मदद करता है।
  • बाद में: जैसे-जैसे सिस्टम अंतिम उत्तर के करीब पहुँचता है, नियम धीरे-धीरे वापस अपने सख्त, मूल रूप में "कठोर" होते जाते हैं।
  • परिणाम: जब तक सिस्टम समाप्त होता है, हर एक सिफारिश सूची 100% नियमों के अनुरूप होती है, लेकिन सिस्टम ने बेहतर समाधान खोजे क्योंकि शुरुआत में उसे थोड़ा लचीला होने की अनुमति दी गई थी।

उन्होंने क्या पाया?

शोधकर्ताओं ने अमेज़न समीक्षाओं (सौंदर्य, इलेक्ट्रॉनिक्स और कपड़ों को कवर करते हुए) के एक विशाल डेटासेट पर इसका परीक्षण किया।

  • 100% नियम अनुपालन: अन्य सिस्टमों के विपरीत जो कभी-कभी नियमों को तोड़ते हैं, इस सिस्टम ने हर एक व्यावसायिक बाधा का पूरी तरह से पालन किया।
  • बेहतर संतुलन: इसने सटीक वस्तुओं और विविध वस्तुओं को दिखाने के बीच पिछले तरीकों की तुलना में बेहतर संतुलन बनाया।
  • LLM ने मदद की: "कंडक्टर" (LLM) वाला सिस्टम निश्चित कार्यक्रम वाले सिस्टम की तुलना में थोड़ा बेहतर प्रदर्शन करता है, जिससे यह सिद्ध होता है कि एक AI मैनेजर काम को विभाजित करने के बारे में स्मार्ट निर्णय ले सकता है।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र दिखाता है कि हम AI का उपयोग न केवल उत्पाद चुनने के लिए, बल्कि उत्पाद चुनने की प्रक्रिया को प्रबंधित करने के लिए भी कर सकते हैं। एक "सुरक्षित टीम" और एक "जोखिम भरी टीम" में काम को विभाजित करके, और एक AI मैनेजर को नियमों को धीरे-धीरे सख्त करते हुए संतुलन बनाने का निर्णय लेने देकर, हम ऐसी सिफारिश सूचियाँ बना सकते हैं जो उच्च गुणवत्ता वाली और व्यावसायिक कानूनों के प्रति सख्ती से अनुपालन करने वाली होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →