CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis
यह शोध पत्र CryptoAnalystBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और मूल्यांकन ढांचा है जिसे उच्च-घनत्व वाले क्रिप्टो और DeFi डेटा पर जटिल, मल्टी-टूल विश्लेषण करने के दौरान अत्याधुनिक LLM एजेंटों में महत्वपूर्ण विफलता मोड को उजागर करने और वर्गीकृत करने के लिए डिज़ाइन किया गया है, जो अंततः दीर्घकालिक विश्लेषणात्मक तर्क (long-form analytical reasoning) में सुधार के लिए एक परिष्कृत वर्गीकरण और स्केलेबल फीडबैक तंत्र प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने पैसे के प्रबंधन में मदद करने के लिए "CryptoBot" नामक एक सुपर-स्मार्ट, अथक रिसर्च असिस्टेंट को काम पर रखा है। आप उससे एक जटिल सवाल पूछते हैं जैसे, "क्या मुझे अगली तिमाही में अपनी बचत एथेरियम (Ethereum) से सोलाना (Solana) में स्थानांतरित कर देनी चाहिए, और इसके जोखिम क्या हैं?"
इसका उत्तर देने के लिए, CryptoBot केवल अनुमान नहीं लगाता। यह एक जासूस की तरह काम करता है: यह हजारों सबूत जुटाने के लिए 20 अलग-अलग टूल्स (जैसे लाइव स्टॉक कीमतें देखना, ब्लॉकचेन लेजर पढ़ना, समाचार लेख खोजना और कोड का विश्लेषण करना) का उपयोग करता है। फिर, यह आपके लिए एक लंबा, विस्तृत रिपोर्ट लिखता है।
समस्या:
"CryptoAnalystBench" नामक शोध पत्र एक डरावना सवाल पूछता है: क्या होता है जब यह सुपर-स्मार्ट जासूस अत्यधिक जानकारी के बोझ तले दब जाता है?
लेखकों ने पाया कि यहाँ तक कि सबसे उन्नत AI मॉडल (यानी "फ्रंटियर" मॉडल) भी अक्सर सूक्ष्म और खतरनाक तरीकों से विफल हो जाते हैं जब उन्हें एक साथ बहुत सारी जानकारी को संभालना पड़ता है। वे तथ्यों को सही तो पकड़ सकते हैं लेकिन संदर्भ (context) को समझने में चूक कर सकते हैं, या वे दो अलग-अलग सत्य के स्रोतों को आपस में मिला सकते हैं और एक भ्रमित करने वाला ढेर बना सकते हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके शोध पत्र के निष्कर्षों का विवरण दिया गया है:
1. "बहुत अधिक जानकारी" का जाल
कल्पना कीजिए कि आप एक जटिल व्यंजन बनाने की कोशिश कर रहे हैं, लेकिन आपको रेसिपी देने के बजाय, आपको 50 अलग-अलग कुकबुक्स, खाद्य कीमतों के बारे में 10 लाइव न्यूज़ फीड और सब्जियों को काटने वाले शेफ का एक लाइव वीडियो थमा दिया जाता है।
- चुनौती: AI को यह सब पढ़ना होगा, यह समझना होगा कि कौन सी जानकारी ताज़ा है (पिछले साल की नहीं), और इसे एक आदर्श भोजन में बदलना होगा।
- विफलता: AI प्याज तो काट सकता है (डेटा प्राप्त कर सकता है) लेकिन चूल्हा जलाना भूल सकता है (समयिंग मिस कर सकता है), या यह 2020 की रेसिपी को 2025 की सामग्री के साथ मिला सकता है, जिससे परिणाम गलत स्वाद वाला होगा।
2. नया "रिपोर्ट कार्ड" (CryptoAnalystBench)
लेखकों ने CryptoAnalystBench नामक एक विशेष परीक्षण बनाया है। इसे AI के लिए एक "ड्राइवर एजुकेशन" कोर्स की तरह समझें, लेकिन कार चलाने के बजाय, AI एक तूफान के बीच हाई-स्पीड वित्तीय जहाज चला रहा है।
- परीक्षण: उन्होंने 198 वास्तविक दुनिया के प्रश्न बनाए हैं जो वास्तविक क्रिप्टो निवेशक वास्तव में पूछते हैं।
- लक्ष्य: यह देखना कि क्या AI बिना क्रैश हुए रियल-टाइम डेटा को संभालने में सक्षम है।
3. AI विश्लेषकों के "सात महापाप" (Seven Deadly Sins)
शोधकर्ताओं ने पाया कि AI केवल साधारण गणितीय गलतियाँ नहीं करता है। यह "उच्च-क्रम" (higher-order) की गलतियाँ करता है जिन्हें पहचानना कठिन होता है। उन्होंने इन गलतियों को समझाने के लिए एक "विफलता का वर्गीकरण" (Taxonomy of Failure) बनाया है:
- "बासी ब्रेड" की त्रुटि (Staleness): AI आपको पिछले सप्ताह की कीमत देता है, जबकि बाजार घंटों पहले ही बदल चुका है। यह किसी को यह बताने जैसा है कि मौसम धूप वाला है जबकि वास्तव में मूसलाधार बारिश हो रही है।
- "सिज़ोफ्रेनिक" त्रुटि (Inconsistent Claims): AI कहता है, "बिटकॉइन 10% ऊपर है," और तीन वाक्यों के बाद कहता है, "बिटकॉइन 5% नीचे है," बिना यह महसूस किए कि उसने खुद का ही विरोध किया है।
- **"भ्रमित अनुवादक" की त्रुटि (Source Reconciliation):ic AI दो अलग-अलग न्यूज़ साइट्स को देखता है। एक कहता है कि एक कॉइन की कीमत 12। यह कहने के बजाय कि "इन स्रोतों में असहमति है," AI उनमें से एक को चुन लेता है और झूठ बोलता है, यह दावा करते हुए कि यही परम सत्य है।
- "सतही स्तर" की त्रुटि (Shallow Synthesis): AI 10 तथ्य सूचीबद्ध करता है लेकिन यह नहीं समझाता कि वे क्यों महत्वपूर्ण हैं। यह एक छात्र की तरह है जो सामग्री की सूची तो देता है लेकिन यह नहीं बताता कि केक कैसे बनाया जाता है।
- "चेतावनी लेबल की कमी" की त्रुटि (Missing Risk): AI आपको बताता है कि आप कितना पैसा कमा सकते हैं लेकिन यह बताना भूल जाता है कि आप सब कुछ खो भी सकते हैं।
- "अति-आत्मविश्वासी जुआरी" की त्रुटि (Overconfident Prediction): AI पूरी निश्चितता के साथ भविष्य की भविष्यवाणी करता है ("यह कॉइन दोगुना हो जाएगा!") जबकि वास्तव में कोई भी यह नहीं जान सकता।
- "गलत प्रश्न" की त्रुटि (Partial/Misframed): आपने "जोखिमों" के बारे में पूछा था, और AI ने आपको उस कॉइन की स्थापना का इतिहास बता दिया।
4. "जज" की समस्या
AI की रिपोर्टों को ग्रेड करने के लिए, लेखकों ने एक अन्य AI को "जज" के रूप में उपयोग किया।
- मुद्दा: जज AI बड़ी गलतियों को पकड़ने में अच्छा है, लेकिन वह पूर्ण नहीं है। यह एक ऐसे शिक्षक की तरह है जो यह बता सकता है कि निबंध "अच्छा" है या "बुरा", लेकिन सटीक स्कोर पर मानव विशेषज्ञ से असहमत हो सकता है।
- समाधान: लेखकों ने महसूस किया कि AI जज को 1-10 का सटीक स्कोर देने के बजाय, इसका उपयोग विशिष्ट त्रुटियों को फ्लैग करने (जैसे "यह हिस्सा पुराना है" या "यह एक विरोधाभास है") के लिए करना बेहतर है। यह सुधार के लिए बहुत अधिक उपयोगी है।
5. मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि केवल "तथ्यात्मक रूप से सही" होना पर्याप्त नहीं है।
वित्त और क्रिप्टो की दुनिया में, एक AI 99% सही हो सकता है लेकिन फिर भी आपको गलत सलाह दे सकता है यदि वह समय (timing) को मिस कर देता है, जोखिमों को अनदेखा करता है, या विरोधाभासी डेटा को सुलझाने में विफल रहता है।
उपमा:
एक GPS नेविगेशन सिस्टम की कल्पना करें।
- पुराना AI: "500 फीट में बाएं मुड़ें।" (यह सही हो सकता है, लेकिन अगर सड़क बंद है, तो आप दुर्घटनाग्रस्त हो जाएंगे।)
- नया AI (लक्ष्य): "500 फीट में बाएं मुड़ें, लेकिन सावधान रहें: निर्माण कार्य के कारण सड़क बंद है, और ट्रैफिक भारी है। यहाँ एक वैकल्पिक मार्ग है।"
लेखक कह रहे हैं: हमें केवल यह जांचना बंद करना होगा कि क्या AI तथ्यों को जानता है। हमें यह जांचना शुरू करना होगा कि क्या AI उन तथ्यों के पीछे की कहानी, समय (timing), और जोखिमों को समझता है। उन्होंने अपना टेस्ट सुइट जारी कर दिया है ताकि डेवलपर्स हमारे पैसे के भरोसे में आने से पहले इन "सात महापापों" को ठीक कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।