ORCA-bench: How Ready Are Language Model Agents for Oncall?
यह शोध पत्र ORCA-bench प्रस्तुत करता है, जो ऑन-कॉल रूट कॉज एनालिसिस (मूल कारण विश्लेषण) कार्यों पर भाषा मॉडल एजेंटों के मूल्यांकन के लिए एक प्रोडक्शन-फिडेलिटी बेंचमार्क है, जो यह प्रकट करता है कि सबसे उन्नत फ्रंटियर मॉडल भी वर्तमान में कम सटीकता (मध्यम कठिनाई पर 25.3%) प्राप्त करते हैं और मतिभ्रम (hallucinations) के साथ संघर्ष करते हैं, जो यह संकेत देता है कि उन्हें वास्तविक दुनिया की उत्पादन विश्वसनीयता के लिए सुरक्षित रूप से भरोसेमंद बनाने से पहले एक महत्वपूर्ण अंतर मौजूद है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप आकाशगंगा के बीच से गुजर रहे एक विशाल, उच्च-तकनीकी अंतरिक्ष यान के कप्तान हैं। अचानक, जहाज का कंप्यूटर अजीब व्यवहार करने लगता है: लाइटें टिमटिमाती हैं, गुरुत्वाकर्षण गड़बड़ा जाता है, और कॉफी मशीन से चिंगारियां निकलने लगती हैं। आप नहीं जानते कि वास्तव में क्या गलत हुआ है, लेकिन आप जानते हैं कि जहाज मुसीबत में है। वास्तविक दुनिया में, ये अंतरिक्ष यान वे वेबसाइट और ऐप्स हैं जिनका हम हर दिन उपयोग करते हैं, और इनके "कप्तान" साइट रिलायबिलिटी इंजीनियर्स (SREs) नामक विशेष इंजीनियर होते हैं। उनका काम यह पता लगाना है कि चीजें क्यों खराब हुईं, जो अक्सर "चेकआउट बटन काम नहीं कर रहा है" या "साइट धीमी है" जैसी अस्पष्ट शिकायत से शुरू होता है। उन्हें डिजिटल सुरागों के पहाड़ों—जैसे ट्रैफिक लॉग, एरर मैसेज और कोड—के माध्यम से खुदाई करनी पड़ती है ताकि पूरे जहाज के क्रैश होने से पहले उस एक टूटे हुए हिस्से को खोजा जा सके।
लंबे समय से, लोग कंप्यूटर को यह जासूसी कार्य करने के लिए सिखाने की कोशिश कर रहे हैं, विशेष रूप से आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करके, जो लार्ज लैंग्वेज मॉडल्स (LLMs) हैं। ये वही स्मार्ट कंप्यूटर हैं जो कहानियाँ लिख सकते हैं, सवालों के जवाब दे सकते हैं और यहाँ तक कि कोड लिखने में भी मदद कर सकते हैं। बड़ा सवाल जो हर कोई पूछ रहा है वह यह है: "क्या ये AI जासूस हमारे वास्तविक दुनिया के सिस्टमों को संभालने और चीजें गलत होने पर उन्हें ठीक करने के लिए तैयार हैं?" यह एक उच्च-दांव वाला खेल है क्योंकि यदि AI गलत अनुमान लगा लेता है, तो यह एक छोटी सी तकनीकी खराबी को एक बड़ी आपदा में बदल सकता है।
यह शोध पत्र, जिसका शीर्षक ORCA-BENCH है, ठीक इसी बात का परीक्षण करने के लिए एक विशाल, यथार्थवादी प्रशिक्षण मैदान तैयार करता है। शोधकर्ताओं ने एक नकली लेकिन अविश्वसनीय रूप से विस्तृत ऑनलाइन स्टोर (जिसे "एस्ट्रोनॉमी शॉप" कहा गया है) बनाया जो छह दिनों तक चलता है, जिससे एक व्यस्त वेबसाइट की तरह भारी मात्रा में डिजिटल शोर उत्पन्न होता है। फिर उन्होंने 1,079 अलग-अलग "रहस्यमय घटनाओं" का निर्माण किया जहाँ उन्होंने गुप्त रूप से सिस्टम में चीजों को खराब कर दिया और पांच सबसे बुद्धिमान उपलब्ध AI एजेंटों से इस मामले को सुलझाने के लिए कहा। उन्होंने AI को वही उपकरण दिए जो एक मानव इंजीनियर के पास होते हैं: लाइव डेटा स्ट्रीम, सोर्स कोड और एक अस्पष्ट उपयोगकर्ता शिकायत तक पहुंच।
परिणाम? AI जासूस अभी भी प्रशिक्षण के दौर में हैं। यहाँ तक कि सबसे अच्छे AI मॉडल भी केवल लगभग 25% "मध्यम कठिनाई" वाले मामलों को सही ढंग से हल कर सके, और कठिनतम मामलों में वे केवल 10% ही सफल रहे। इसे इस संदर्भ में देखें कि यदि एक मानव इंजीनियर एक टेस्ट में 10% स्कोर प्राप्त करता, तो उसे नौकरी से निकाल दिया जाता; इन AI के लिए, यह वर्तमान अत्याधुनिक स्थिति (state of the art) है। शोध में पाया गया कि जब AI सोर्स कोड नहीं देख पा रहा था, तो उनका प्रदर्शन और भी खराब हो गया। शायद सबसे चिंताजनक बात यह है कि AI अक्सर "हैलुसिनेट" (hallucinate) करता था, जिसका अर्थ है कि उन्होंने आत्मविश्वास के साथ समस्याओं के ऐसे नकली कारण गढ़ दिए जो अस्तित्व में ही नहीं थे। एक मामले में, एक AI ने एक टेस्ट टूल में ब्राउज़र क्रैश के लिए दोष मढ़ा, जबकि असली कारण कुछ और था, जिससे वह असली अपराधी को पहचानने में पूरी तरह विफल रहा।
लेखकों का निष्कर्ष है कि हालांकि ये AI एजेंट कोड लिखने में प्रभावशाली हैं, लेकिन वे अभी वास्तविक, लाइव सिस्टम की सुरक्षा के भरोसे किए जाने के लिए तैयार नहीं हैं। एक नियंत्रित परीक्षण में AI जो कर सकता है और इंटरनेट को सुरक्षित रूप से चलाने के लिए जो आवश्यक है, उसके बीच का अंतर अभी भी बहुत बड़ा है। शोध पत्र सुझाव देता है कि इससे पहले कि हम AI को "ऑन-कॉल" शिफ्ट संभालने दें, हमें उन्हें विश्वसनीय बनाने के लिए बहुत अधिक इंजीनियरिंग कार्य करने की आवश्यकता है, क्योंकि अभी, उनके द्वारा समस्या सुलझाने की तुलना में गलत अनुमान लगाने की संभावना अधिक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।