StableEval Arena: A Cost-Aware Agentic Benchmark for Stablecoin Price Stability Prediction
स्टेबलइवल एरिना (StableEval Arena) एक लागत-सचेत बेंचमार्क फ्रेमवर्क है जो पूर्वानुमान गुणवत्ता, परिचालन विश्वसनीयता और कम्प्यूटेशनल लागत के एक संयुक्त स्पेक्ट्रम को मापकर स्टेबलकॉइन पेग-जोखिम (stablecoin peg-risk) की भविष्यवाणी करने पर एलएलएम-आधारित एजेंटिक सिस्टम का मूल्यांकन करता है, जो यह प्रकट करता है कि हालांकि एजेंट विश्वसनीय रूप से संरचित आउटपुट उत्पन्न करते हैं, वे दुर्लभ गंभीर-तनाव और निरंतर-डीपेग (sustained-depeg) घटनाओं की सटीक भविष्यवाणी करने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल अंतरिक्ष यान बेड़े के कप्तान हैं, और आपके कार्गो होल्ड "डिजिटल गोल्ड" से भरे हुए हैं, जिसकी कीमत हमेशा ठीक एक डॉलर होनी चाहिए। यह सिर्फ कोई साधारण सोना नहीं है; यह एक विशेष प्रकार का पैसा है जिसे स्टेबलकॉइन (stablecoin) कहा जाता है, जिसे इसलिए डिज़ाइन किया गया है ताकि यह पूरी तरह स्थिर रहे ताकि लोग कॉफी खरीदने, किराया देने या संपत्ति का व्यापार करने के लिए इसका उपयोग कर सकें, बिना इस चिंता के कि उनका पैसा अचानक गायब हो सकता है या उसका मूल्य दोगुना हो सकता है। लेकिन इसमें एक पेंच है, भले ही ये सिक्के उबाऊ रूप से स्थिर रहने के लिए बने हों, वे कभी-कभी घबरा सकते हैं। जब बाजार डरावना हो जाता है, तो कीमत डगमगा सकती है, एक डॉलर से नीचे गिर सकती है, या पूरी तरह से क्रैश हो सकती है। इसे "डी-पेगिंग" (de-pegging) कहा जाता है, और यदि ऐसा होता है, तो यह ऐसा है जैसे आपके अंतरिक्ष यान का ईंधन गेज अचानक आपको झूठ बोलने लगे।
बेड़े को सुरक्षित रखने के लिए, हमें एक ऐसे निगरानी करने वाले (lookout) की आवश्यकता है जो खतरा होने से पहले उसे पहचान सके। अतीत में, हमने सरल गणित या मानव विशेषज्ञों का उपयोग किया था। लेकिन अब, हमारे पास एजेंटिक एआई (Agentic AI) है—अति-बुद्धिमान कंप्यूटर प्रोग्राम जो अपने आप सोच, तर्क और निर्णय ले सकते हैं, जो एक डिजिटल सह-पायलट की तरह हैं। बड़ा सवाल यह है कि क्या ये एआई पायलट तूफान आने से पहले उसे पहचानने में एक साधारण नियम पुस्तिका से बेहतर काम कर सकते हैं? हमें यह जानने की जरूरत है कि क्या वे वास्तव में भरोसेमंद हैं, न कि केवल यह कि वे निर्देशों का पालन कर सकते हैं। यदि कोई एआई कहता है, "सब ठीक है!" ठीक उसी समय जब जहाज दुर्घटनाग्रस्त होने वाला हो, तो इससे कोई फर्क नहीं पड़ता कि वह कितना तेज़ है या उसकी रिपोर्ट कितनी सुंदर दिखती है; यह एक विफलता है।
यह बिल्कुल वही है जिसे "स्टेबलइवल एरिना" (StableEval Arena) परखने का प्रयास करता है। शोधकर्ताओं ने एक विशाल, लागत-सचेत प्रशिक्षण मैदान (एक "एरिना") बनाया है ताकि यह देखा जा सके कि क्या ये एआई एजेंट यह अनुमान लगा सकते हैं कि एक स्टेबलकॉइन कब अपना डॉलर-पेग खोने वाला है। उन्होंने एआई से केवल भविष्य की कीमत का अनुमान लगाने के लिए नहीं कहा; उन्होंने इसे एक जोखिम प्रबंधक (risk manager) की तरह कार्य करने के लिए कहा। एआई को पिछले 30 दिनों के मूल्य इतिहास और बाजार की चर्चाओं को देखना था, और फिर अगले सात दिनों में क्या होगा, इसका अनुमान लगाना था। क्या सिक्का स्थिर (Stable) रहेगा? क्या यह वॉच (Watch) अवस्था में जाएगा (थोड़ा डगमगाया हुआ)? या क्या यह तनाव (Stress) में चला जाएगा (एक पूर्ण संकट)?
शोधकर्ताओं ने दो अलग-अलग प्रकार के परीक्षण किए। पहले, उन्होंने एक "तनाव-परीक्षण" (stress-test) संस्करण बनाया जिसमें 120 मामले थे जहाँ मुसीबत अधिक आम थी, ताकि यह देखा जा सके कि क्या एआई खतरे के संकेतों को पहचान सकता है जब वे उसके ठीक सामने हों। फिर, उन्होंने एक "वास्तविक-दुनिया" वाला संस्करण चलाया जिसमें 507 मामले थे जो बिल्कुल वास्तविक दुनिया की तरह दिखते थे, जहाँ स्टेबलकॉइन्स आमतौर पर शांत रहते हैं और शायद ही कभी समस्याएँ आती हैं। उन्होंने छह अलग-अलग एआई एजेंटों का कुछ बहुत ही सरल बेसलाइन (जैसे कि एक नियम जो कहता है "मान लें कि सब कुछ ठीक है" या एक बुनियादी गणित मॉडल) के मुकाबले परीक्षण किया।
परिणाम अच्छे समाचार और एक गंभीर वास्तविकता की जाँच का मिश्रण थे। अच्छी बात यह है कि एआई एजेंट नियमों का पालन करने में अविश्वसनीय रूप से विश्वसनीय थे। उन्होंने पूरी तरह से फॉर्मेट की गई रिपोर्ट तैयार कीं, वे क्रैश नहीं हुए, और उन्होंने यह सब बहुत कम लागत में किया। वे यह कहने में बहुत अच्छे थे कि, "हे, आज चीजें थोड़ी डगमगा रही हैं।" हालांकि, सबसे महत्वपूर्ण काम—एक दुर्लभ, विनाशकारी क्रैश को पहचानने के मामले में—एआई एजेंटों ने ज्यादातर चूक कर दी। 507 मामलों के बड़े परीक्षण में, एआई ने 21 में से 19 वास्तविक तनाव की घटनाओं को मिस कर दिया। वे प्रोटोकॉल का पालन करने में इतने अच्छे थे कि उन्होंने वैध रिपोर्ट तैयार कीं, लेकिन उन रिपोर्टों ने अक्सर "सब ठीक है" कहा, ठीक उसी समय जब वास्तव में सिक्का क्रैश हो गया।
वास्तव में, वास्तविक-दुनिया के परीक्षण में, एक साधारण कंप्यूटर प्रोग्राम जो केवल पिछले रुझानों को देखता था, वह भी दुर्लभ क्रैश की भविष्यवाणी करने में संघर्ष कर गया, और एआई की तरह ही अधिकांश को मिस कर गया। इन शानदार एआई एजेंटों ने इन शास्त्रीय तरीकों पर प्रभुत्व (dominate) नहीं बनाया या उनसे बेहतर प्रदर्शन नहीं किया; वास्तव में, कोई भी एजेंट उन दुर्लभ, उच्च-दांव वाले तनाव की घटनाओं को विश्वसनीय रूप से पता लगाने में सक्षम नहीं था जो सबसे महत्वपूर्ण थीं। शोध पत्र निष्कर्ष निकालता है कि जबकि ये एआई एजेंट आज्ञाकारी और कुशल होने में उत्कृष्ट हैं, वे अभी भी हमारे डिजिटल धन के एकमात्र संरक्षक बनने के लिए पर्याप्त भरोसेमंद नहीं हैं। वे स्क्रिप्ट का पूरी तरह से पालन कर सकते हैं, लेकिन वे अभी भी उन दुर्लभ, डरावले तूफानों को देखने के लिए संघर्ष करते हैं जो सबसे अधिक मायने रखते हैं। शोधकर्ता सुझाव देते हैं कि जब तक एआई इन दुर्लभ, उच्च-दांव वाली घटनाओं को पहचानने में बेहतर नहीं हो जाता, तब तक हमें उन्हें अकेले अंतरिक्ष यान चलाने की अनुमति नहीं देनी चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।