← नवीनतम पेपर
🔢 mathematics

OptiLoop: Coordination-in-the-Loop Verification and Repair for LLM-Generated Optimization Agents

यह शोध पत्र OptiLoop को प्रस्तुत करता है, जो एक समन्वय-इन-द-लूप (coordination-in-the-loop) सत्यापन और मरम्मत पाइपलाइन है जो LLM-जनित अनुकूलन एजेंटों में सिमेंटिक त्रुटियों का पता लगाने और उन्हें ठीक करने के लिए ADMM-शैली के सर्वसम्मति रन (consensus runs) का उपयोग करता है, जो अलग-थलग स्थानीय सत्यापन की तुलना में वैश्विक उद्देश्यों और सामाजिक परिणामों के साथ उनके संरेखण में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yujia Xu, Zhiheng Wang, Thi Dinh

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yujia Xu, Zhiheng Wang, Thi Dinh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, विकेंद्रीकृत (decentralized) आपूर्ति श्रृंखला (supply chain) के प्रबंधक हैं। आपके पास दर्जनों स्वतंत्र विक्रेता हैं, जिनमें से प्रत्येक की अपनी निजी फैक्ट्रियां, लागत और नियम हैं। वे नहीं चाहते कि वे अपने गुप्त नुस्खे या वित्तीय डेटा आपके साथ साझा करें। हालांकि, पूरी प्रणाली को सुचारू रूप से चलाने के लिए उन सभी को एक साझा योजना (जैसे कि कितनी वस्तुएं भेजी जानी चाहिए) पर सहमत होने की आवश्यकता है।

परंपरागत रूप से, विक्रेताओं को सहमत करने के लिए एक मानव विशेषज्ञ को प्रत्येक के लिए जटिल कंप्यूटर कोड लिखना पड़ता है, जो उनके व्यावसायिक नियमों को गणितीय सूत्रों में अनुवादित करता है। यह प्रक्रिया धीमी, महंगी और मानवीय त्रुटियों के प्रति संवेदनशील है।

नया विचार: AI को कोडिंग करने दें
यह शोध पत्र प्रस्तावित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग किया जाए—वही AI जो निबंध लिखता है या चैट करता है—विकेंडरों के लिए स्वचालित रूप से कोड लिखने के लिए। आप बस AI को बताते हैं, "यहाँ मेरा वेयरहाउस नियम है: मैं एक दिन में केवल 100 बॉक्स भेज सकता हूँ," और AI अनुकूलन (optimization) प्रोग्राम लिख देता है।

समस्या: "मूक" बग (The "Silent" Bug)
यहाँ पेच यह है: केवल इसलिए कि AI द्वारा लिखा गया कोड बिना क्रैश हुए चल जाता है, इसका मतलब यह नहीं है कि वह सही है।

इसे एक शेफ को भोजन बनाने के निर्देश देने जैसा समझें।

  • स्थानीय जाँच (Local Check): आप शेफ से सूप चखने के लिए कहते हैं। वे कहते हैं, "यह ठीक लग रहा है!" और बर्तन फटता नहीं है। कोड "कंपाइल" होता है और चलता है।
  • असली परीक्षण (The Real Test): आप उस ग्राहक को सूप परोसते हैं जिसकी विशिष्ट आहार संबंधी आवश्यकताएं हैं। शेफ, रेसिपी की एक सूक्ष्म गलतफहमी के कारण, एक छिपी हुई सामग्री डाल देता है जो ग्राहक को बीमार कर देती है। सूप "एग्जीक्यूटेबल" (executable) था, लेकिन वह अर्थपूर्ण रूप से गलत (semantically wrong) था।

इस शोध पत्र की दुनिया में, एक AI-जनरेटेड एजेंट अकेले तो बेहतरीन तरीके से चल सकता है, लेकिन वह लागत या किसी बाधा (constraint) को गलत समझ सकता है। उसे लग सकता है कि "शिपिंग लागत" एक निश्चित शुल्क है, न कि प्रति वस्तु लगने वाला शुल्क। जब वह केंद्रीय प्रणाली के साथ समन्वय करने की कोशिश करता है, तो वह गलत निर्णय लेता है जो खुद के लिए तो तार्किक लगते हैं, लेकिन समग्र योजना को बिगाड़ देते हैं। ये त्रुटियाँ तब तक अदृश्य रहती हैं जब तक कि एजेंट एक-दूसरे से बात करना शुरू नहीं करते।

समाधान: ऑप्टिलूप (OptiLoop - "रिहर्सल" सिस्टम)
लेखकों ने इस समस्या को ठीक करने के लिए OptiLoop नामक एक प्रणाली बनाई है। केवल यह जाँचने के बजाय कि कोड चलता है या नहीं, वे एजेंट को लाइव होने से पहले एक "रिहर्सल" से गुजरने के लिए रखते हैं।

OptiLoop कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

  1. स्क्रिप्ट (Generation): AI आपके लिखित निर्देशों के आधार पर कोड लिखता है।
  2. ड्रेस रिहर्सल (In-Loop Verification): वास्तविक आपूर्ति श्रृंखला में शामिल होने से पहले, एजेंट को एक "विश्वसनीय साथी" (एक स्थिर, सटीक कंप्यूटर प्रोग्राम) के साथ एक संक्षिप्त, सिम्युलेटेड समन्वय खेल (coordination game) के लिए जोड़ा जाता है। वे एक योजना पर सहमत होने का प्रयास करते हैं।
  3. आलोचना (Evidence Extraction): इस रिहर्सल के दौरान, सिस्टम यह देखता है कि AI एजेंट कैसे प्रतिक्रिया देता है।
    • क्या कीमत बढ़ने पर वह गुस्सा हो जाता है? (उसे अधिक उत्पादन करने के लिए सस्ता होना चाहिए)।
    • क्या वह योजना से सहमत होता है, या वह लगातार "नहीं!" चिल्लाता रहता है?
    • क्या वह एक तर्कसंगत व्यवसाय की तरह व्यवहार कर रहा है, या वह अजीब व्यवहार कर रहा है?
    • सिस्टम उन "व्यवहार संबंधी रेड फ्लैग्स" (behavioral red flags) को देखता है जिन्हें स्टेटिक कोड चेक नहीं पकड़ पाते।
  4. सुधार (Repair):
    • मामूली गड़बड़ी: यदि कोड में केवल कोई टाइपो या कोई संख्या गायब है, तो सिस्टम इसे जल्दी से पैच कर देता है (जैसे स्पेल-चेक)।
    • बड़ी गलतफहमी: यदि AI ने मौलिक रूप से व्यावसायिक तर्क को गलत समझा है (जैसे, उसे लगता है कि शिपिंग मुफ्त है), तो सिस्टम वर्तमान लॉजिक को हटा देता है और AI को रिहर्सल से प्राप्त फीडबैक का उपयोग करके पूरी गणितीय "रेसिपी" को फिर से लिखने के लिए कहता है।
  5. स्मृति (Learning): सिस्टम पिछली गलतियों का एक "नोटबुक" रखता है। यदि वह फिर से कोई समान भ्रमित करने वाला निर्देश देखता है, तो उसे याद रहता है, "ओह, पिछली बार AI 'साझा क्षमता' (shared capacity) से भ्रमित हुआ था, इसलिए मैं इस बार भी इसे चेतावनी दूँगा।"

परिणाम
शोधकर्ताओं ने इसका परीक्षण 40 अलग-अलग जटिल आपूर्ति श्रृंखला परिदृश्यों पर किया।

  • OptiLoop के बिना: AI एजेंट लगभग 66% बार सही उत्तर प्राप्त करते थे।
  • OptiLoop के साथ: सफलता दर बढ़कर 93% हो गई।

इससे भी महत्वपूर्ण बात यह है कि जब AI ने गलती की, तो खराब योजना और आदर्श योजना के बीच का "अंतर" नाटकीय रूप से कम हो गया। सिस्टम ने केवल कोड को ठीक नहीं किया; इसने कोड के पीछे के लॉजिक को ठीक किया।

निष्कर्ष (The Bottom Line)
यह शोध पत्र तर्क देता है कि एक टीम में निर्णय लेने वाले AI एजेंटों के लिए, आप केवल यह जाँच नहीं सकते कि वे "चल" सकते हैं या नहीं। आपको यह देखना होगा कि वे वास्तव में दूसरों के साथ काम करते समय कैसा व्यवहार करते हैं। OptiLoop एक ऐसी प्रणाली है जो AI को अपनी भूमिका का "अभ्यास" (rehearse) करने के लिए मजबूर करती है, उस रिहर्सल के दौरान होने वाली सूक्ष्म गलतफहमियों को पकड़ती है, और वास्तविक काम शुरू होने से पहले उन्हें ठीक करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →