← नवीनतम पेपर
🤖 AI

WorkflowPerturb: Calibrated Stress Tests for Evaluating Multi-Agent Workflow Metrics

यह शोध पत्र WorkflowPerturb को प्रस्तुत करता है, जो लगभग 5,000 गोल्डन वर्कफ़्लो और 44,000 से अधिक ग्रेडेड परटर्बेशन्स (क्रमिक परिवर्तनों) से युक्त एक नियंत्रित बेंचमार्क है, जिसका उपयोग प्रोडक्शन अपडेट के दौरान मल्टी-एजेंट LLM वर्कफ़्लो में होने वाले परिवर्तनों का पता लगाने और उनकी गंभीरता को मापने के लिए मेट्रिक्स का मूल्यांकन और अंशांकन करने के लिए किया जाता है।

मूल लेखक: Madhav Kanda, Sharad Agarwal, Rodrigo Fonseca, Alok Gautam Kumbhare, Pedro Las-Casas

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Madhav Kanda, Sharad Agarwal, Rodrigo Fonseca, Alok Gautam Kumbhare, Pedro Las-Casas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट चलाने वाले शेफ हैं। आपके पास एक प्रसिद्ध व्यंजन के लिए एक "गोल्डन रेसिपी" (स्वर्ण नुस्खा) है जिसे टेस्ट किया गया है और जिसे मंजूरी दी गई है। हर दिन, आपको शायद अपने किचन को अपडेट करने की आवश्यकता हो सकती है: शायद आप पुराने चूल्हे को नए से बदल देते हैं, शेफ के निर्देशों में थोड़ा बदलाव करते हैं, या बस किचन से उसी व्यंजन को फिर से बनाने के लिए कहते हैं।

समस्या यह है कि जब आप किचन को वह व्यंजन फिर से बनाने के लिए कहते हैं, तो परिणाम अक्सर अलग दिखता है। शायद वे कोई स्टेप भूल गए, शायद उन्होंने दो स्टेप्स को मिलाकर एक कर दिया, या शायद उन्होंने बस एक ही क्रिया को वर्णित करने के लिए अलग शब्दों का उपयोग किया।

बड़ा सवाल: आप यह कैसे जानेंगे कि नया व्यंजन परोसने के लिए सुरक्षित है, या यह एक बड़ी आपदा बनने वाला है?

यह ठीक वही समस्या है जिसे WORKFLOWPERTURB पेपर हल करता है, लेकिन एक किचन के बजाय, यह AI एजेंट्स (कंप्यूटर प्रोग्राम) के बारे में है जो क्लाउड कंप्यूटिंग, कस्टमर सपोर्ट और वैज्ञानिक अनुसंधान जैसी चीजों के लिए जटिल "रेसिपी" (वर्कफ़्लो) बनाते हैं।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: AI अपडेट का "ब्लैक बॉक्स"

जब कंपनियाँ अपने AI सिस्टम को अपडेट करती हैं (जैसे कि AI मॉडल को बदलना या निर्देश फिर से लिखना), तो AI अक्सर एक नई "रेसिपी" बनाता है जो पुरानी, स्वीकृत रेसिपी से थोड़ी अलग दिखती है।

  • जोखिम: इंजीनियरों को अनुमान लगाना पड़ता है: "क्या यह नई रेसिपी केवल एक हानिरहित पुनर्व्यख्या है, या क्या AI ने गलती से एक महत्वपूर्ण स्टेप हटा दिया है जिससे सिस्टम क्रैश हो सकता है?"
  • विफलता: इन रेसिपीज़ की जांच करने के लिए उपयोग किए जाने वाले उपकरण (जिन्हें "मेट्रिक्स" कहा जाता है) खराब थर्मामीटर की तरह हैं। वे आपको एक संख्या (जैसे 0.85 का स्कोर) देते हैं, लेकिन वे आपको यह नहीं बताते कि स्कोर क्यों गिरा। क्या स्कोर इसलिए गिरा क्योंकि AI ने ओवन चालू करना भूल गया (एक गंभीर विफलता), या सिर्फ इसलिए क्योंकि उसने "ओवन" को "ovvn" लिख दिया (एक मामूली टाइपो)?

2. समाधान: "स्ट्रेस टेस्ट" किचन

इसे ठीक करने के लिए, लेखकों ने एक विशाल परीक्षण क्षेत्र बनाया जिसे WORKFLOWPERTURB कहा जाता है। इसे एक "स्ट्रेस टेस्ट किचन" के रूप में सोचें जहाँ वे नियंत्रित तरीकों से रेसिपी को जानबूझकर बिगाड़ते हैं ताकि यह देखा जा सके कि जाँच उपकरण कितनी अच्छी तरह प्रदर्शन करते हैं।

उन्होंने 4,973 परफेक्ट "गोल्डन रेसिपीज़" लीं और उनके 44,757 बिगड़े हुए संस्करण बनाए। उन्होंने उन्हें तीन विशिष्ट तरीकों से बिगाड़ा:

  • मिसिंग स्टेप्स (खोया हुआ घटक): उन्होंने रेसिपी से पूरे स्टेप्स हटा दिए (जैसे, "ओवन का तापमान चेक करें" को हटा देना)।
  • कंप्रेस्ड स्टेप्स (विलय किए गए निर्देश): उन्होंने दो अलग-अलग स्टेप्स को एक अस्पष्ट स्टेप में मिला दिया (जैसे, "प्याज काटें" और "प्याज भूनें" को बदलकर सिर्फ "प्याज पकाएं" कर देना)।
  • डिस्क्रिप्शन में बदलाव (शब्दकोश परीक्षण): उन्होंने स्टेप्स को बिल्कुल वैसा ही रखा लेकिन शब्द बदल दिए (जैसे, "चेक द ओवन" को "इन्स्पेक्ट द हीटिंग यूनिट" में बदलना)।

3. प्रयोग: "जजों" का परीक्षण

इसके बाद लेखकों ने इन बिगड़ी हुई रेसिपीज़ को विभिन्न "जजों" (मूल्यांकन उपकरणों) के माध्यम से चलाया ताकि यह देखा जा सके कि स्कोर कैसे बदलते हैं। वे यह देखना चाहते थे कि क्या उपकरण कैलिब्रेटेड (सटीक) थे—यानी, यदि उन्होंने रेसिपी को 50% बिगाड़ा, तो क्या स्कोर भी 50% गिर गया?

उन्हें क्या मिला:

  • कुछ जज गायब सामग्री के प्रति अंधे हैं: कुछ उपकरण (जैसे "लेक्सिकल मेट्रिक्स") शब्द परिवर्तनों को पकड़ने में बहुत अच्छे हैं लेकिन यह नोटिस करने में बहुत खराब हैं कि क्या कोई पूरा स्टेप गायब है। वे एक ऐसी रेसिपी को उच्च स्कोर दे सकते हैं जिसने सबसे महत्वपूर्ण स्टेप भूल जाने के बावजूद, केवल इसलिए क्योंकि शब्द समान दिख रहे थे।
  • कुछ जज पुनर्व्यवस्था से भ्रमित हो जाते हैं: अन्य उपकरण (जैसे "स्ट्रक्चरल मेट्रिक्स") यह देखने में माहिर हैं कि क्या स्टेप्स सही क्रम में हैं, लेकिन वे परेशान हो जाते हैं यदि आप केवल शब्दों को बदल देते हैं, भले ही अर्थ वही हो।
  • "LLM-as-Judge" एक अच्छा जनरलइस्ट है: एक स्मार्ट AI का उपयोग करना जो रेसिपी को पढ़ता है और मानव जैसा स्कोर देता है, अच्छा काम करता है, लेकिन यह महंगा और धीमा है।

4. निष्कर्ष: आपको उपकरणों के एक "बंडल" की आवश्यकता है

पेपर निष्कर्ष निकालता है कि कोई भी एक उपकरण पूर्ण नहीं है। केवल एक स्कोर पर भरोसा करना कार की सुरक्षा को केवल उसके रंग की जांच करके आंकने जैसा है।

इसके बजाय, वे एक "कैलिब्रेटेड बंडल" (उपकरणों का एक विशिष्ट संयोजन) का प्रस्ताव करते हैं जो सुरक्षा जाल के रूप में कार्य करता है:

  • यदि आप मिसिंग स्टेप्स के बारे में चिंतित हैं, तो एक ऐसा टूल उपयोग करें जो स्ट्रक्चर की जांच करता है (Graph F1)।
  • यदि आप मर्ज किए गए स्टेप्स के बारे में चिंतित हैं, तो क्रम की जांच करने वाले टूल का उपयोग करें (Kendall's τ)।
  • यदि आप शब्द परिवर्तनों के बारे में चिंतित हैं, तो टेक्स्ट की जांच करने वाले टूल का उपयोग करें (BLEU)।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, यदि कोई AI वर्कफ़्लो क्लाउड सर्वर या मेडिकल डेटा को प्रबंधित करने के लिए उपयोग किया जाता है, तो एक "साइलेंट रिग्रेशन" (एक सूक्ष्म गलती जो कागज़ पर ठीक दिखती है) एक बड़े आउटेज या खतरनाक त्रुटि का कारण बन सकती है।

यह पेपर उस रूलर और स्ट्रेस टेस्ट को प्रदान करता है जिसकी आवश्यकता यह सुनिश्चित करने के लिए है कि जब कोई AI सिस्टम बदलता है, तो नया संस्करण वास्तव में सुरक्षित रूप से शिप करने योग्य है, न कि केवल दिखने में अलग है। यह उद्योग को "अनुमान लगाने" से "जानने" की ओर ले जाता है कि क्या परिवर्तन सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →