← नवीनतम पेपर
💬 NLP

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

यह शोध पत्र TaxPraBen को प्रस्तुत करता है, जो 13 चीनी कर अभ्यास कार्यों—जिसमें जोखिम रोकथाम और रणनीति योजना जैसे वास्तविक परिदृश्य शामिल हैं—पर लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला स्केलेबल बेंचमार्क है—जो मॉडल्स के बीच प्रदर्शन में महत्वपूर्ण असमानताओं को प्रकट करता है और कानूनी रूप से विनियमित डोमेन में विशेष मूल्यांकन की आवश्यकता पर प्रकाश डालता है।

मूल लेखक: Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yu

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट को एक टैक्स अकाउंटेंट (कर लेखाकार) बनना सिखाने की कोशिश कर रहे हैं।

आप सोच सकते हैं, "कोई समस्या नहीं है! इस रोबोट ने पूरा इंटरनेट पढ़ लिया है। यह भाषा, गणित और तर्क के बारे में सब कुछ जानता है।" लेकिन यहाँ एक पेंच है: टैक्स केवल पढ़ने या गणित के बारे में नहीं है; यह नियमों, संख्याओं और वास्तविक दुनिया के परिणामों के एक बारूदी खेल (minefield) में रास्ता खोजने के बारे में है।

यह शोध पत्र TaxPraBen पेश करता है, जो एक नया "ड्राइविंग टेस्ट" है जिसे विशेष रूप से यह देखने के लिए डिज़ाइन किया गया है कि क्या AI रोबोट वास्तव में टैक्स कार चलाने के लिए तैयार हैं, या वे केवल ड्राइवर मैनुअल को रटने में अच्छे हैं।

यहाँ इसका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "टेक्स्टबुक" बनाम "सड़क"

पहले, शोधकर्ता AI का परीक्षण उन टैक्स प्रश्नों पर करते थे जो बहुविकल्पीय क्विज़ (multiple-choice quizzes) की तरह थे।

  • पुराना तरीका: "कार के लिए टैक्स दर क्या है?" (उत्तर: 10%)।
  • वास्तविकता: एक असली टैक्स विशेषज्ञ केवल दर नहीं जानता। उन्हें एक अस्त-व्यस्त व्यावसायिक परिदृश्य को देखना होता है, सटीक देय टैक्स की गणना करनी होती है, यह पता लगाना होता है कि क्या व्यवसाय कानून तोड़ रहा है, और कानूनी रूप से पैसा बचाने के लिए एक रणनीति का सुझाव देना होता है।

लेखकों ने महसूस किया कि वर्तमान AI मॉडल उन छात्रों की तरह हैं जो लिखित परीक्षा में तो टॉप कर जाते हैं लेकिन ड्राइविंग के पहले ही दिन कार क्रैश कर देते हैं। वे कानूनों को रट सकते हैं (ज्ञान/Knowledge) लेकिन जब उन्हें किसी अव्यवस्थित, वास्तविक दुनिया की स्थिति पर उन्हें लागू करने के लिए कहा जाता है (अनुप्रयोग/Application), तो वे विफल हो जाते हैं।

2. समाधान: "TaxPraBen" ड्राइविंग स्कूल

टीम ने TaxPraBen नामक एक नया बेंचमार्क बनाया। इसे एक सिम्युलेटर के रूप में समझें जो AI को मानव सीखने के तरीके (ब्लूम के टैक्सोनॉमी - Bloom's Taxonomy) के आधार पर तीन कठिनाई स्तरों के माध्यम से परखता है:

  • स्तर 1: फ्लैशकार्ड्स (याद करना/Memorization)

    • कार्य: "टैक्स कानून के अनुच्छेद 111 का सटीक पाठ सुनाएं।"
    • उपमा: क्या रोबोट डिक्शनरी पढ़ सकता है और "कटौती" (deduction) की परिभाषा को पूरी तरह से दोहरा सकता है?
    • परिणाम: अधिकांश बड़े AI मॉडल इसमें अच्छे हैं। उनकी याददाश्त अच्छी है।
  • स्तर 2: पठन बोध (समझना/Understanding)

    • कार्य: "एक नए टैक्स नियम के बारे में यह 5 पन्नों का समाचार लेख पढ़ें और मुख्य बिंदु का सारांश दें।"
    • उपमा: क्या रोबोट नियम के पीछे की कहानी को समझ सकता है, न कि केवल शब्दों को?
    • परिणाम: सामान्य अंग्रेजी मॉडलों की तुलना में चीनी-विशिष्ट AI मॉडल (जैसे Qwen) यहाँ बेहतर प्रदर्शन करते हैं, क्योंकि वे स्थानीय "बोली" (dialect) के टैक्स कानूनों को बेहतर समझते हैं।
  • स्तर 3: वास्तविक दुनिया का संकट (अनुप्रयोग/Application)

    • कार्य: "यहाँ एक कंपनी का अस्त-व्यस्त वित्तीय डेटा है। उनका टैक्स कैलकुलेट करें, उनके जोखिम खोजें, और उन्हें बिना गिरफ्तार हुए पैसे बचाने का तरीका बताएं।"
    • उपमा: यह फाइनल एग्जाम है। रोबोट को गणित भी करना है और एक कानूनी रणनीति भी लिखनी है—वह भी एक साथ
    • परिणाम: यहाँ हर कोई संघर्ष कर रहा था। यहाँ तक कि सबसे स्मार्ट AI (जैसे GPT-4o) भी गणित में गलती कर गए या खतरनाक सलाह दी। वे बात करने में बहुत अच्छे हैं, लेकिन वास्तविक गणना करने में बहुत खराब हैं।

3. "मैजिक फिल्टर" (संरचित मूल्यांकन/Structured Evaluation)

AI का परीक्षण करने में सबसे बड़ी सिरदर्दी यह है कि वे बहुत अव्यवस्थित होते हैं। आप एक नंबर मांगते हैं, और वे आपको टेक्स्ट का एक पैराग्राफ देते हैं जिसमें नंबर कहीं छिपा होता है।

लेखकों ने एक "मैजिक फिल्टर" (एक संरचित मूल्यांकन पाइपलाइन) बनाया।

  • उपमा: कल्पना कीजिए कि आप एक शेफ से रेसिपी मांगते हैं। एक अव्यवस्थित पैराग्राफ मिलने के बजाय, AI को एक सख्त फॉर्म (JSON) भरने के लिए मजबूर किया जाता है।
  • यदि AI कहता है, "टैक्स 500 डॉलर है," तो फ़िल्टर केवल "500" निकालता है और जाँचता है कि क्या वह सही है। यदि AI कहता है, "टैक्स शायद लगभग 500 है, शायद थोड़ा अधिक," तो फ़िल्टर इसे गलत मार्क कर देता है।
  • यह सुनिश्चित करता है कि परीक्षण निष्पक्ष हो और इसे स्वचालित रूप से ग्रेड किया जा सके, ठीक वैसे ही जैसे कंप्यूटर गणित के टेस्ट को ग्रेड करता है।

4. बड़े आश्चर्य

जब उन्होंने 19 अलग-अलग AI मॉडल पर परीक्षण चलाया, तो उन्हें कुछ दिलचस्प बातें पता चलीं:

  • बड़ा बेहतर है (लेकिन हमेशा नहीं): विशाल, क्लोज्ड-सोर्स मॉडल (जैसे ERNIE-3.5 और GPT-4) आम तौर पर सबसे अच्छा प्रदर्शन करते हैं। उनके पास बहुत सारा ज्ञान रखने वाला एक बड़ा "दिमाग" है।
  • स्थानीय ज्ञान की जीत: चीनी डेटा पर विशेष रूप से प्रशिक्षित AI मॉडल (जैसे Qwen2.5) चीनी टैक्स कार्यों पर वैश्विक मॉडलों को पछाड़ देते हैं। यह एक स्थानीय गाइड की तरह है जो मानचित्र वाले पर्यटक की तुलना में शॉर्टकट को बेहतर जानता है।
  • विशेष प्रशिक्षण सफलता की गारंटी नहीं देता: एक मॉडल, YaYi2, को विशेष रूप से टैक्स डेटा पर प्रशिक्षित किया गया था। आप सोचेंगे कि यह चैंपियन होगा, लेकिन इसने खराब प्रदर्शन किया।
    • क्यों? यह उस छात्र की तरह है जिसने पुराने टेक्स्टबुक को रट लिया था, लेकिन टेस्ट नए कानूनों पर था। जिस डेटा पर उन्हें प्रशिक्षित किया गया था, वह पर्याप्त विविध नहीं था या वास्तविक दुनिया के टेस्ट प्रश्नों से मेल नहीं खाता था।
  • गणित का अंतर (The Math Gap): सभी AI के लिए सबसे कठिन हिस्सा गणित था। वे टैक्स प्लानिंग के बारे में एक सुंदर निबंध लिख सकते हैं, लेकिन यदि आप उनसे सटीक डॉलर राशि की गणना करने के लिए कहते हैं, तो वे अक्सर विफल हो जाते हैं।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि हम अभी अपने टैक्स के लिए AI पर भरोसा नहीं कर सकते।

यदि आप AI को कविता लिखने के लिए कहते हैं, तो यह अद्भुत है। यदि आप इसे अपना टैक्स रिटर्न कैलकुलेट करने के लिए कहते हैं, तो यह आपको एक ऐसा नंबर दे सकता है जो दिखने में सही लगता है लेकिन वास्तव में गलत है, जिससे जुर्माना या ऑडिट हो सकता है।

TaxPraBen वह उपकरण है जिसकी हमें "हाइप" (hype) को रोकने और "वास्तविकता की जांच" शुरू करने के लिए आवश्यकता है। यह AI डेवलपर्स को केवल टैक्स के बारे में बात करने वाले मॉडल बनाने के बजाय ऐसे मॉडल बनाने के लिए मजबूर करता है जो वास्तव में काम कर सकें।

संक्षेप में: हमने एक बहुत ही स्मार्ट रोबोट बनाया है जो टैक्स कोड पढ़ सकता है। लेकिन जब तक वह TaxPraBen का ड्राइविंग टेस्ट पास नहीं कर लेता, हमें उसे कार चलाने के लिए नहीं छोड़ना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →