← नवीनतम पेपर
📈 economics

Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research

यह शोधपत्र आर्थिक सिद्धांत अनुसंधान में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के उपयोग के लिए एक सत्यापन-प्रथम प्रोटोकॉल का प्रस्ताव करता है, जो एक एकल कार्य-उदाहरण के माध्यम से यह प्रदर्शित करता है कि बाहरी प्रतिकूल सत्यापन (एडवर्सरियल वेरिफिकेशन) और संरचित बहु-एजेंट जाँचें कठोरता सुनिश्चित करने के लिए आवश्यक हैं, क्योंकि केवल मॉडल की प्रवाहपूर्णता गणितीय शुद्धता की गारंटी नहीं देती है।

मूल लेखक: Moran Koren

प्रकाशित 2026-06-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Moran Koren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल मशीन बनाने की कोशिश कर रहे हैं, जैसे कि एक क्लॉकवर्क इंजन, लेकिन आपके पास एक बहुत ही प्रतिभाशाली, आत्मविश्वासी रोबोट सहायक है जो आपके लिए ब्लूप्रिंट लिख सकता है और गणित कर सकता है। समस्या यह है कि यह रोबोट एक "स्मूथ टॉकर" (मीठी बातें करने वाला) है। यह एक ऐसा आदर्श दिखने वाला ब्लूप्रिंट लिख सकता है जो वास्तव में काम नहीं करता है। यह कह सकता है, "यहाँ वह गियर है जो वजन को संतुलित करता है!" जबकि वास्तव में, वह गियर केवल एक चित्र मात्र है।

यह शोध पत्र इस बारे में एक मार्गदर्शिका है कि उस रोबोट सहायक का उपयोग कैसे करें ताकि उसकी अत्यधिक आत्मविश्वास से मूर्ख न बन जाएं।

समस्या: "स्मूथ टॉकर" का जाल

अर्थशास्त्र के सिद्धांत की दुनिया में, शोधकर्ता आमतौर पर एक खाली पन्ने से शुरुआत करते हैं और सारा कठिन गणित खुद ही करना पड़ता है। अब, AI (लार्ज लैंग्वेज मॉडल्स) के साथ, रोबोट गणित कर सकता है और प्रमाण (proof) लिख सकता है। लेकिन रोबोट में एक दोष है: वह बहुत अधिक आत्मविश्वासी है। वह एक गलत प्रमेय (theorem) को भी उतनी ही सहजता से सिद्ध करेगा जितनी सहजता से वह एक सही प्रमेय को करता है। यह एक ऐसे छात्र की तरह है जिसने उत्तर कुंजी (answer key) रट ली है लेकिन गणित को समझा नहीं है; यदि आप उससे कठिन प्रश्न पूछते हैं, तो वह शायद केवल सही लगने वाला उत्तर अनुमान लगा देता है।

लेखक, मोरन कोरन, पूछते हैं: हम वास्तविक आर्थिक सिद्धांत के लिए इस रोब सहित बिना आँख मूंदकर भरोसा किए इसका उपयोग कैसे करें?

समाधान: "वेरिफिकेशन टूलबॉक्स" (सत्यापन उपकरण)

यह पत्र रोबोट को स्मार्ट बनाने की कोशिश नहीं करता है। इसके बजाय, यह रोबोट के काम को जांचने के तीन अलग-अलग तरीके प्रस्तावित करता है। इन्हें अपने क्लॉकवर्क इंजन को बनाने के लिए एक टीम को काम पर रखने के तीन अलग-अलग तरीकों के रूप में समझें।

विधि 1: एकल कलाकार (द सिंगल पास)

आप रोबोट को एक बार में पूरा काम करने के लिए कहते हैं। वह प्रमाण लिखता है, अपने काम की जांच करता है, और आपको अंतिम पेपर सौंप देता है।

  • उपमा: यह एक अकेले, बहुत आत्मविश्वासी वास्तुकार (architect) को पुल डिजाइन करने के लिए कहने जैसा है। वे अपने गणित की जांच करते हैं, और यदि यह साफ-सुथरा दिखता है, तो वे इस पर हस्ताक्षर कर देते हैं।
  • परिणाम: आउटपुट सुंदर और पूर्ण दिखता है। लेकिन क्योंकि किसी और ने इसकी जांच नहीं की थी, इसमें छिपी हुई दरारें हो सकती हैं। शोध पत्र में, इस विधि ने सबसे "सुंदर" पेपर तैयार किया, लेकिन यह सबसे कम सत्यापित था।

विधि 2: बहस करने वाले (द एडवर्सरियल पेयर)

आप दो रोबोटों को काम पर रखते हैं। एक निर्माता (Builder) है (जो गणित सिद्ध करने की कोशिश करता है), और दूसरा विरोधी (Hater) है (जिसका एकमात्र काम निर्माता के काम को तोड़ने की कोशिश करना है)। एक मानव रेफरी के रूप में कार्य करता है।

  • उपमा: एक अदालत की कल्पना करें। निर्माता एक मामला प्रस्तुत करता है। विरोधी एक वकील है जिसका काम निर्माता के तर्क को ध्वस्त करने के लिए एक भी खामी ढूंढना है। यदि विरोधी को कोई खामी नहीं मिलती है, तो मानव रेफरी साक्ष्यों की जांच करता है।
  • परिणाम: इस विधि ने उन तीन प्रमुख त्रुटियों को पकड़ा जिन्हें "एकल कलाकार" ने छोड़ दिया था। उदाहरण के लिए, निर्माता ने दावा किया कि एक मशीन संतुलित है, लेकिन विरोधी ने सिद्ध किया कि विशिष्ट परिस्थितियों में यह ढह जाएगी। विरोधी ने टीम को यह स्वीकार करने के लिए मजबूर किया, "ठीक है, हम उस हिस्से के बारे में गलत थे।"

विधि 3: अनुसंधान प्रयोगशाला (द मल्टी-एजेंट प्रोजेक्ट)

आप विशिष्ट भूमिकाओं के साथ रोबोटों की एक पूरी टीम स्थापित करते हैं: एक साहित्य (literature) देखता है, एक गणित करता है, एक कोड लिखता है, और एक सख्त समीक्षक (Reviewer) है जो एक गेटकीपर के रूप में कार्य करता है। जब तक समीक्षक अपनी सहमति न दे दे, कुछ भी प्रकाशित नहीं किया जा सकता।

  • उपमा: यह एक कठोर वैज्ञानिक प्रयोगशाला की तरह है। हर कदम का दस्तावेजीकरण किया जाता है। यदि कोई रोबोट अनुमान लगाता है, तो उसे एक बड़ा लाल झंडा लगाना होगा जिस पर लिखा हो, "मैंने अभी तक इसे सिद्ध नहीं किया है।" समीक्षक परियोजना को रोक देता है यदि कोई चरण ठोस नहीं होता है।
  • परिणाम: इसने सबसे अव्यवस्थित दिखने वाला दस्तावेज़ तैयार किया। यह लाल झंडों, "हमें यह अभी नहीं पता" वाली टिप्पणियों और खारिज किए गए विचारों से भरा था। लेकिन क्योंकि यह अपनी अनिश्चितताओं के बारे में इतना ईमानदार था, इसलिए यह वास्तव में सबसे अधिक विश्वसनीय था।

परीक्षण: "ग्रेड इन्फ्लेशन" (ग्रेड मुद्रास्फीति) पहेली

इन तीन विधियों का परीक्षण करने के लिए, लेखक ने उन्हें ग्रेड इन्फ्लेशन के बारे में एक बहुत कठिन, अनसुलझी पहेली दी।

  • पहेली: एक विश्वविद्यालय की कल्पना करें जहाँ छात्र विभिन्न पाठ्यक्रम लेते हैं। कुछ पाठ्यक्रम आसान हैं, कुछ कठिन। आप एक छात्र की वास्तविक क्षमता को मापने के लिए एक निष्पक्ष प्रणाली कैसे बना सकते हैं, चाहे उन्होंने कौन से कक्षाएं ली हों?
  • लक्ष्य: रोबोटों को एक ऐसी प्रणाली (एक "मैकेनिज्म") डिजाइन करनी थी जो छात्रों और शिक्षकों को बेहतर ग्रेड पाने के लिए सिस्टम के साथ धोखाधड़ी करने से रोक सके।

क्या हुआ?

लेखक ने इस समान पहेली पर तीनों विधियों को चलाया। यहाँ उन्होंने क्या पाया:

  1. अभिसरण खोज (द "आहा!" मोमेंट): दो विधियों ने, जिन्होंने कभी एक-दूसरे से बात नहीं की थी, स्वतंत्र रूप से बिल्कुल एक ही गणितीय सूत्र की खोज की। यह ऐसा था जैसे दो अलग-अलग जासूस एक अपराध को सुलझा रहे हों और एक ही छिपे हुए सुराग को ढूंढ रहे हों। इससे लेखक को विश्वास हुआ कि वह सुराग वास्तविक था, न कि केवल एक भाग्यशाली अनुमान।
  2. विरोधी (Hater) अनिवार्य है: "डेबेटर" विधि (विधि 2) ने तीन विशिष्ट झूठ पकड़े जिन्हें "एकल कलाकार" (विधि 1) तथ्यों के रूप में प्रकाशित कर देता। विरोधी ने दिन बचा लिया क्योंकि उसने सिद्ध किया कि मशीन दावे के अनुसार काम नहीं करेगी।
  3. चमक (Polish) प्रमाण नहीं है: सबसे सुंदर, पूर्ण दिखने वाला पेपर (विधि 1) सबसे खतरनाक था क्योंकि इसमें कोई सुरक्षा जांच नहीं थी। सबसे अव्यवस्थित पेपर (विधि 3), जो "मुझे यकीन नहीं है" वाले झंडों से भरा था, सबसे सुरक्षित था क्योंकि इसने अपनी सीमाओं के बारे में सच बताया।

मुख्य निष्कर्ष

पत्र यह निष्कर्ष निकालता है कि आप काम की जांच कैसे करते हैं, यह इस बात से अधिक महत्वपूर्ण है कि रोबोट कितना स्मार्ट है।

यदि आप गंभीर आर्थिक सिद्धांत के लिए AI का उपयोग करना चाहते हैं, तो आपको केवल "प्रमाण लिखने" के लिए नहीं कहना चाहिए। आपको एक ऐसी प्रणाली स्थापित करने की आवश्यकता है जहाँ:

  • कोई प्रमाण को तोड़ने की कोशिश करे।
  • कोई उन चीजों की सूची रखे जिन्हें अभी तक सिद्ध नहीं किया गया है।
  • आप एक ही समस्या को दो बार चलाएं ताकि देखें कि क्या आपको एक ही उत्तर मिलता है।

यह पत्र ग्रेड इन्फ्लेशन की समस्या को पूरी तरह से हल करने का दावा नहीं करता है। इसके बजाय, यह दावा करता है कि इसने एक उपकरण (Toolkit) (एक "थ्योरिस्ट टूलबॉक्स") बनाया है जो शोधकर्ताओं को AI का सुरक्षित रूप से उपयोग करने का तरीका दिखाता है। वास्तविक परिणाम ग्रेड के बारे में गणित नहीं है; यह उस प्रोटोकॉल के बारे में है कि एक ऐसी मशीन पर भरोसा कैसे किया जाए जो इतनी कुशलता से झूठ बोल सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →