Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness
यह शोध पत्र "लेयर-आइसोलेटेड इवैल्यूएशन" (Layer-Isolated Evaluation) को प्रस्तुत करता है, जो एक नियत (deterministic), बिना-LLM वाला टेस्ट हारनेस है जो एक प्रोडक्शन LLM एजेंट को निश्चित परतों में विभाजित करता है ताकि उन प्रतिगमनों (regressions) को सटीक रूप से स्थानीयकृत किया जा सके जिन्हें समग्र एंड-टू-एंड मेट्रिक्स पहचानने में विफल रहते हैं, जैसा कि नियंत्रित इंजेक्शन प्रयोगों द्वारा प्रदर्शित किया गया है जो न्यूनतम समग्र पास दरों द्वारा छिपे हुए महत्वपूर्ण प्रति-स्लाइस प्रदर्शन गिरावट को दर्शाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त, हाई-टेक रेस्टोरेंट चलाते हैं जहाँ एक रोबोट शेफ (AI एजेंट) ऑर्डर लेता है, मेनू चेक करता है, कीमतों की गणना करता है और किचन में खाना भेजता है।
समस्या: "पास/फेल" का रहस्य
अभी, यदि आप जानना चाहते हैं कि आपका रोबोट शेफ ठीक से काम कर रहा है या नहीं, तो आप आमतौर पर पूछते हैं: "क्या ग्राहक को उसका खाना मिला?"
- हाँ: बहुत बढ़िया!
- नहीं: ओह उह। कुछ टूट गया।
लेकिन यदि उत्तर "नहीं" है, तो आपको पता नहीं चलेगा कि क्या टूटा है। क्या रोबोट ग्राहक का नाम भूल गया? क्या उसने मेनू गलत पढ़ लिया? क्या उसने गलत कीमत की गणना की? क्या वह किसी विशेष अनुरोध से भ्रमित हो गया? यह पता लगाने के लिए, आपको घंटों तक रोबोट को काम करते हुए देखना होगा, जो धीमा, महंगा और निराशाजनक है। यह कार के इंजन को केवल उस शोर को सुनकर ठीक करने की कोशिश करने जैसा है जो तब आता है जब वह शुरू नहीं होती।
समाधान: "लेयर-आइसोलेटेड" (परत-पृथक) टेस्ट
यह पेपर आपके रोबोट शेफ का परीक्षण करने का एक नया तरीका पेश करता है। पूरे भोजन को शुरू से अंत तक देखने के बजाय, वे रोबोट के मस्तिष्क को विशिष्ट "परतों" या चरणों में तोड़ देते हैं, जैसे कि एक रेसिपी:
- समझना (Understanding): क्या उसने "मुझे एक लाटे चाहिए" को सही ढंग से सुना?
- रूटिंग (Routing): क्या उसे पता था कि उस अनुरोध को कॉफी मशीन के पास भेजना है, न कि ग्रिल के पास?
- सुरक्षा (Safety): क्या उसने ध्यान दिया कि ग्राहक को नट्स (मेवे) से एलर्जी है?
- स्मृति (Memory): क्या उसे याद रहा कि ग्राहक को एक्स्ट्रा झाग (extra foam) चाहिए?
उन्होंने एक विशेष टेस्टिंग मशीन बनाई जो प्रत्येक परत को व्यक्तिगत रूप से जांचती है।
- दिमाग की जरूरत नहीं: सबसे अच्छी बात यह है कि इस टेस्ट के लिए वास्तव में "दिमाग" (AI/LLM) का उपयोग नहीं किया जाता है। यह यह जांचने के लिए सरल, पूर्व-लिखित नियमों (एक कैलकुलेटर की तरह) का उपयोग करता है कि रोबलेट का तर्क (logic) सही है या नहीं।
- सुपर फास्ट: क्योंकि यह केवल सरल नियमों की जांच कर रहा है, यह लगभग 2.4 सेकंड में चलता है। आप इसे हर बार चला सकते हैं जब कोई डेवलपर कोड में एक छोटा सा बदलाव करता है।
- "प्योर" मोड: यह एक फ्लाइट सिम्युलेटर की तरह है। यह विमान को उड़ाता नहीं है; यह केवल यह जांचता है कि उपकरण सही रीडिंग दे रहे हैं या नहीं।
बड़ी खोज: "मास्किंग" (छिपाने वाला) प्रभाव
लेखकों ने एक दिलचस्प प्रयोग किया। उन्होंने जानबूझकर एक विशिष्ट परत को बिगाड़ दिया (जैसे कि रोबोट को एलर्जी को अनदेखा करने के लिए मजबूर करना) और टेस्ट चलाए।
- पुराना तरीका (एग्रीगेट स्कोर): यदि आप "कुल सफलता दर" को देखते, तो यह बहुत कम बदलती। शायद यह 2% गिर जाती। आप सोचते, "ओह, यह सामान्य शोर है।" समस्या मास्क (छिपी) हुई थी (अन्य हिस्सों के सही काम करने के कारण)।
- नया तरीका (लेयर टेस्ट): जब उन्होंने विशिष्ट "एलर्जी लेयर" को देखा, तो स्कोर 100% से गिरकर 10% हो गया। यह एक बहुत बड़ा, स्पष्ट रेड फ्लैग (चेतावनी) था।
उपमा: घर का निरीक्षण
AI एजेंट को एक घर की तरह समझें।
- पुराना तरीका: आप घर में घूमते हैं और पूछते हैं, "क्या घर रहने योग्य है?" यदि लाइटें जल रही हैं और दरवाजा खुल रहा है, तो आप कहते हैं "हाँ।" लेकिन प्लंबिंग लीक हो सकती है, और आपको तब तक पता नहीं चलेगा जब तक फर्श सड़ नहीं जाता।
- नया तरीका: आपके पास हर कमरे के लिए एक चेकलिस्ट है।
- किचन: 100% ठीक।
- बाथरूम: 0% ठीक (पाइप टूटे हुए हैं!)।
- बेडरूम: 100% ठीक।
भले ही घर "काफी हद तक" रहने योग्य हो, नया तरीका तुरंत आपको बताता है कि रिसाव कहाँ है ताकि आप उसे तुरंत ठीक कर सकें।
यह क्यों मायने रखता है
- गति और लागत: क्योंकि यह टेस्ट महंगे AI दिमाग का उपयोग नहीं करता है, इसलिए इसे चलाना लगभग मुफ्त है। आप इसे दिन में हजारों बार चला सकते हैं।
- ईमानदारी: यह सिस्टम "कवरेज-ऑनेस्ट" (कवरेज-ईमानदार) है। यदि रोबोट का कोई हिस्सा (जैसे कि एक विशिष्ट मेमोरी फीचर) अभी तक टेस्ट नहीं किया गया है, तो सिस्टम उसे नकली "100%" नहीं देता है। यह कहता है, "हमने अभी तक इसकी जांच नहीं की है।" यह डेवलपर्स को अनटेस्ट किए गए कोड को ग्रीन लाइट के पीछे छिपाने से रोकता है।
- सटीकता: जब कुछ टूटता है, तो आपको अनुमान नहीं लगाना पड़ता। टेस्ट सीधे टूटी हुई परत की ओर इशारा करता है, जिससे घंटों की डिबगिंग बच जाती है।
वे क्या दावा नहीं करते
लेखक सावधानी बरतते हुए कहते हैं कि यह अंतिम "क्या ग्राहक को उसका खाना मिला?" टेस्ट का स्थान नहीं लेता है। यह केवल डेवलपर्स को उन्हें बनाने के दौरान रोबोट को ठीक करने में मदद करता है। साथ ही, वे स्वीकार करते हैं कि रोबोट के कुछ हिस्से (जैसे रचनात्मक लेखन या जटिल बातचीत) साधारण नियमों के साथ टेस्ट करना बहुत कठिन है और उनके लिए अभी भी "असली" AI की आवश्यकता होती है।
संक्षेप में:
उन्होंने एक सुपर-फास्ट, नियम-आधारित चेकलिस्ट बनाई है जो एक जटिल AI को छोटे, टेस्ट करने योग्य टुकड़ों में तोड़ देती है। यह छोटे एरर्स को एक "काफी हद तक काम करने वाले" सिस्टम के अंदर छिपने से रोकता है, जिससे डेवलपर्स को वास्तविक ग्राहक तक पहुँचने से पहले ही बग्स को तुरंत पकड़ने और ठीक करने में मदद मिलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।