MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning
MoCA-Agent एक मार्केट-ऑफ-क्लेम्स कोड एजेंट है जो प्रश्नों को विशेषज्ञ सत्यापन के लिए परमाणु दावों (atomic claims) में विघटित करके, बाजार-समर्थित साक्ष्यों से निष्पादन योग्य कोड को संश्लेषित करके, और अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कठोर सत्यापन लागू करके वित्तीय और संख्यात्मक तर्क क्षमता को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही जटिल गणितीय समस्या को हल करने की कोशिश कर रहे हैं जो एक अव्यवस्थित स्प्रेडशीट पर आधारित है। यदि आप एक मानक AI से इसके बारे में पूछते हैं, तो वह एक लंबा, आत्मविश्वास से भरा दिखने वाला किस्सा लिख सकता है जो गलत संख्या की ओर ले जाता है। यह उस छात्र की तरह है जो एक बेहतरीन निबंध तो लिखता है लेकिन अंतिम चरण में गलती से शून्य से विभाजित (divide by zero) कर देता है—निबंध शानदार दिखता है, लेकिन उत्तर गलत होता है।
यह पेपर MoCA-Agent को पेश करता है, जो एक नए प्रकार का AI है जिसे विशेष रूप से इन "मौन गलतियों" (silent mistakes) को रोकने के लिए डिज़ाइन किया गया है जो वित्तीय और संख्यात्मक कार्यों में होती हैं। साधारण AI को केवल बातचीत करने देने के बजाय, MoCA-Agent इस समस्या को एक तथ्यों के शेयर बाजार (stock market for facts) की तरह देखता है।
यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग करके बताया गया है:
1. "क्लेम कैटलॉग" (इसे तोड़ना)
AI से "समस्या हल करने" के लिए कहने के बजाय, MoCA-Agent पहले प्रश्न को छोटे, परमाणु टुकड़ों में तोड़ देता है जिन्हें दावे (claims) कहा जाता है।
- उपमा: कल्पना कीजिए कि आप एक घर बना रहे हैं। "घर बनाओ" कहने के बजाय, आप हर एक ईंट, बीम और कील की सूची बनाते हैं।
- पेपर में: यदि प्रश्न है "लाभ क्या था?", तो सिस्टम ऐसे दावे सूचीबद्ध करेगा जैसे: "राजस्व (Revenue) $100 है," "व्यय (Expenses) $20 है," "लाभ का अर्थ है राजस्व घटा व्यय," और "चिह्न (sign) सकारात्मक होना चाहिए।"
2. "व्यापारियों का बाजार" (बहस)
यही मुख्य नवाचार है। सिस्टम केवल एक AI से सोचने के लिए नहीं कहता। यह चार अलग-अलग "विशेषज्ञ व्यापारियों" को इस बात पर दांव लगाने के लिए काम पर रखता है कि प्रत्येक छोटा दावा सत्य है या असत्य।
- व्यापारी:
- एक्सट्रैक्टर (The Extractor): यह जाँचता है कि क्या संख्याएँ मूल दस्तावेज़ से मेल खाती हैं।
- फॉर्मूला विशेषज्ञ (The Formula Expert): यह जाँचता है कि क्या गणितीय तर्क (logic) सही है।
- अकाउंटेंट (The Accountant): यह जाँचता है कि क्या इकाइयाँ (डॉलर, प्रतिशत) और चिह्न (धनात्मक/ऋणात्मक) सही हैं।
- संशयवादी (The Skeptic): यह सक्रिय रूप से त्रुटियाँ खोजने और संदिग्ध दिखने वाले दावों को "बेचने" (अस्वीकार करने) की कोशिश करता है।
- बाजार: प्रत्येक व्यापारी हर दावे पर "खरीद" या "बिक्री" का ऑर्डर लगाता है। यदि अकाउंटेंट और संशयवादी दोनों एक दावे को "बेचते" हैं (यानी उसे गलत बताते हैं), तो उस दावे की बाजार कीमत गिर जाती है, और उसे खारिज कर दिया जाता है। यदि सभी सहमत होते हैं, तो कीमत बढ़ जाती है, और दावे को स्वीकार कर लिया जाता है।
- यह क्यों मायने रखता है: सामान्य AI बहसों में, यदि तीन AI एक गलत उत्तर पर सहमत होते हैं, तो वे सभी बहुत आत्मविश्वासी लगते हैं। यहाँ, भले ही "फॉर्मूला विशेषज्ञ" आश्वस्त हो, लेकिन यदि संख्याएँ मेल नहीं खाती हैं, तो "संशयवादी" पूरे मामले को बाधित कर सकता है।
3. "सिंथेसाइज़र" (प्रोग्राम बनाना)
एक बार जब बाजार स्पष्ट हो जाता है (यह तय कर लेता है कि कौन से दावे स्वीकृत हैं), तो एक "सिंथेसाइज़र" एजेंट एक पायथन (Python) कंप्यूटर प्रोग्राम लिखता है।
- नियम: सिंथेसाइज़र को सख्ती से किसी भी ऐसे दावे का उपयोग करने से मना किया जाता है जिसे बाजार ने खारिज कर दिया हो। वह केवल "अनुमोदित ईंटों" से ही निर्माण कर सकता है।
- उपमा: यह एक निर्माण फोरमैन की तरह है जिसे केवल उन्हीं ब्लूप्रिंट्स का उपयोग करने की अनुमति है जो सुरक्षा निरीक्षण में पास हुए हैं। यदि कोई ब्लूप्रिंट खारिज कर दिया गया है, तो वे उसका उपयोग नहीं कर सकते, भले ही वे वास्तव में ऐसा करना चाहते हों।
4. "वेरिफायर" (सुरक्षा निरीक्षक)
अंतिम उत्तर देने से पहले, एक "कोड-जागरूक वेरिफायर" (Code-Aware Verifier) उस प्रोग्राम को चलाता है।
- जाँच: यह केवल यह नहीं देखता कि कोड बिना क्रैश हुए चल रहा है या नहीं; यह जाँचता है कि क्या कोड बाजार के तर्क से मेल खाता है। क्या प्रोग्राम ने गलती से चिह्न बदल दिया? क्या इसने 100 से गुणा किया जबकि इसे विभाजित करना चाहिए था?
- मरम्मत: यदि वेरिफायर कोई मौन त्रुटि (जैसे गलत चिह्न) पाता है, तो वह प्रोग्राम को मरम्मत के लिए एक दौर के लिए वापस भेजता है, विशेष रूप रूप से गलती की ओर इशारा करते हुए ताकि सिंथेसाइज़र उसे ठीक कर सके।
5. "कॉन्फ्लिक्ट आर्बिटर" (टाई-ब्रेकर)
कभी-कभी, बाजार भ्रमित होता है, या प्रोग्राम कमजोर होता है। ऐसे मामलों में, एक "कमेटी" बाजार के उत्तर की तुलना एक मानक, गैर-मार्केट AI उत्तर से करती है। यदि वे असहमत होते हैं, तो एक विशेष "आर्बिटर" एक तीसरा, हाइब्रिड उत्तर बनाता है जो दोनों के सर्वोत्तम हिस्सों को जोड़ता है।
परिणाम: यह क्यों काम करता है
लेखकों ने परीक्षण किया कि यह सिस्टम 10 कठिन बेंचमार्क पर काम करता है जिसमें वित्तीय रिपोर्ट, जटिल तालिकाएं और चार्ट शामिल हैं।
- परिणाम: MoCA-Agent ने अन्य शीर्ष-स्तरीय AI मॉडल (GPT-4o और विशेष वित्तीय मॉडल सहित) को लगातार पीछे छोड़ दिया।
- गुप्त मंत्र: यह केवल इसलिए बेहतर नहीं हुआ क्योंकि इसके पास बड़ा दिमाग था; यह इसलिए बेहतर हुआ क्योंकि इसने AI को आत्मविश्वास से भरे लेकिन गलत नंबरों का "भ्रम" (hallucination) करने से रोक दिया। गणित करने से पहले हर एक छोटे तथ्य पर AI को सहमत होने के लिए मजबूर करके, इसने त्रुटियों को काफी कम कर दिया।
सीमाएं (बारीक विवरण)
पेपर इस बारे में ईमानदार है कि यह सिस्टम अभी क्या नहीं कर सकता:
- यह महंगा है: इस बाजार प्रणाली को चलाने के लिए एक साधारण AI चैट की तुलना में बहुत अधिक कंप्यूटर "विचारों" (API कॉल्स) की आवश्यकता होती है, जिससे इसे चलाना लगभग 5 गुना अधिक महंगा हो जाता है।
- इसे अंग्रेजी की आवश्यकता है: यह सिस्टम वर्तमान में अंग्रेजी वित्तीय भाषा के लिए ट्यून किया गया है। यह अन्य भाषाओं या जीव विज्ञान जैसे गैर-वित्तीय क्षेत्रों में संघर्ष कर सकता है।
- एक-चरणीय दृष्टि (One-Step Vision): यदि इनपुट एक चार्ट इमेज है, तो सिस्टम इमेज को पढ़ने के लिए एक टूल का उपयोग करता है। यदि वह टूल लेबल को गलत पढ़ लेता है, तो "व्यापारियों" को उस पर दोबारा दांव लगाने का मौका नहीं मिलता; त्रुटि छिपकर निकल जाती है।
संक्षेप में: MoCA-Agent एक वित्तीय ऑडिट फर्म की तरह है जो किसी के भी शब्द पर तब तक विश्वास नहीं करता जब तक कि उन्होंने हर एक संख्या पर हस्ताक्षर न कर दिए हों। यह "मुक्त-रूप बातचीत" को एक संरचित, साक्ष्य-आधारित बाजार से बदल देता है ताकि यह सुनिश्चित हो सके कि अंतिम गणित वास्तव में सही है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।