← नवीनतम पेपर
🤖 AI

An LLM Agentic Approach for Legal-Critical Software: A Case Study for Tax Prep Software

यह शोध पत्र एक एजेंटिक एलएलएम (LLM) फ्रेमवर्क प्रस्तावित करता है जो अमेरिकी टैक्स कोड के निष्पादन योग्य सॉफ्टवेयर में अनुवाद को स्वचालित करता है और टेस्ट जनरेशन के लिए उच्च-क्रम के मेटाबॉर्फिक संबंधों (higher-order metamorphic relations) का उपयोग करता है, यह प्रदर्शित करते हुए कि एक छोटा मॉडल (GPT-4o-mini) मजबूत, भरोसेमंद कानूनी-महत्वपूर्ण सॉफ्टवेयर प्राप्त करने में फ्रंटियर मॉडल्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Sina Gogani-Khiabani, Ashutosh Trivedi, Diptikalyan Saha, Saeid Tizpaz-Niari

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sina Gogani-Khiabani, Ashutosh Trivedi, Diptikalyan Saha, Saeid Tizpaz-Niari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसा रोबोट बनाने की कोशिश कर रहे हैं जो आपके टैक्स (कर) भर सके। यह सिर्फ कोई साधारण रोबोट नहीं है; यह एक ऐसा रोबोट है जिसे कानून का बिल्कुल सटीक पालन करना होगा। अगर इससे छोटी सी भी गलती हुई, तो आपको ऑडिट का सामना करना पड़ सकता है, जुर्माना भरना पड़ सकता है, या आप उस पैसे से वंचित रह सकते हैं जिसके आप हकदार हैं।

समस्या यह है कि टैक्स कानून "लीगलज़" (Legalese) में लिखे जाते हैं—जो एक भ्रमित करने वाली, अस्पष्ट भाषा है जिसमें अपवादों, विशेष परिस्थितियों और निरंतर अपडेट्स का अंबार लगा होता है। यदि आप किसी मानक AI (एक लार्ज लैंग्वेज मॉडल या LLM) से बस "टैक्स कानून के लिए कोड लिखें" कहते हैं, तो वह अक्सर भ्रमित हो जाता है (अपनी ओर से बातें बना लेता है) या तर्क को गलत कर देता है, जैसे कि आपकी आय के गलत हिस्से पर टैक्स दर लागू कर देना।

यह पेपर इस "टैक्स रोबोट" को बनाने का एक नया तरीका पेश करता है जिसे Synedrion कहा गया है। एक ही सुपर-स्मार्ट AI से सब कुछ करने के बजाय, उन्होंने विशेषज्ञ AI एजेंटों की एक टीम बनाई है जो एक मानव सॉफ्टवेयर कंपनी की तरह मिलकर काम करती है।

सरल उपमाओं (analogies) का उपयोग करके इसका विवरण यहाँ दिया गया है:

1. समस्या: "ओरेकल" (Oracle) का रहस्य

सामान्य सॉफ्टवेयर टेस्टिंग में, आप काम शुरू करने से पहले ही उत्तर जानते हैं। यदि आप कैलकुलेटर से 2 + 2 पूछते हैं, तो आप जानते हैं कि उत्तर 4 है। इसे "ओरेकल" कहा जाता है।

लेकिन टैक्स सॉफ्टवेयर में, किसी को भी पहले से सटीक उत्तर नहीं पता होता जब तक कि कोई मानव विशेषज्ञ कानून को न देख ले। यदि एक व्यक्ति 50,000कमाताहै,तोटैक्स50,000 कमाता है, तो टैक्स 7,200 है या $7,250? यह दर्जनों सूक्ष्म नियमों पर निर्भर करता है। यही "ओरेकल की समस्या" (Oracle Problem) है। आप केवल यह जाँच नहीं सकते कि रोबोट सही है या नहीं क्योंकि आप स्वयं सही उत्तर नहीं जानते।

2. समाधान: "सिनेड्रियन" (Synedrion) टीम

लेखकों ने AI एजेंटों की एक टीम बनाई है, जिसमें प्रत्येक का एक विशिष्ट कार्य है, जो एक वास्तविक दुनिया की लॉ फर्म और इंजीनियरिंग टीम की नकल करता है:

  • टैक्स एक्सपर्ट (अनुवादक - The Translator):
    • उपमा: एक सख्त वकील की कल्पना करें जो उलझे हुए टैक्स कोड को पढ़ता है और उसे एक साफ, संरचित रेसिपी कार्ड (JSON फॉर्मेट) में बदल देता है।
    • कार्य: वे कोड नहीं लिखते; वे बस भ्रमित करने वाले कानूनों को स्पष्ट, चरण-दर-चरण निर्देशों में अनुवादित करते हैं जिन्हें कंप्यूटर समझ सके।
  • कोडर (निर्माता - The Builders):
    • उपमा: ये निर्माण श्रमिक (construction workers) हैं। वे "टैक्स एक्सपर्ट" से प्राप्त "रेसिपी कार्ड" लेते हैं और वास्तविक सॉफ्टवेयर बनाते हैं।
    • कार्य: वे पायथन (Python) कोड लिखते हैं। इसमें दो लोग हैं: एक पहला ड्राफ्ट बनाता है, और एक "सीनियर कोडर" (मैनेजर) उसकी समीक्षा करता है। यदि ड्राफ्ट खराब है, तो मैनेजर उसे सुधार के लिए वापस भेज देता है।
  • मेटाबॉर्फिक एजेंट (गुणवत्ता निरीक्षक - The Quality Inspector):
    • उपमा: यह सबसे रचनात्मक हिस्सा है। एक जासूस की कल्पना करें जिसे गणित की समस्या का सटीक उत्तर तो नहीं पता, लेकिन उसे खेल के नियम पता हैं।
    • कार्य: यह एजेंट यह पूछने के बजाय कि "क्या टैक्स $7,200 है?", यह पूछता है: "यदि मैं रोबोट को अधिक आय वाला व्यक्ति दूँ, तो क्या टैक्स बढ़ना चाहिए?" या "यदि मैं किसी को दृष्टिहीन बना दूँ, तो क्या उनका टैक्स कम होना चाहिए?"
    • "हायर-ऑर्डर" ट्विस्ट: इस पेपर का बड़ा नवाचार यह है कि यह एजेंट केवल "ऊपर या नीचे" के सरल नियमों की जाँच नहीं करता। यह परिवर्तन की दरों (rates of change) की जाँच करता है।
      • सरल जाँच: "यदि आय बढ़ती है, तो टैक्स बढ़ता है।" (एक बुरा रोबोट जो सब कुछ पर फ्लैट 20% वसूलता है, इस टेस्ट में पास हो जाएगा)।
      • हायर-ऑर्डर जाँच: "यदि आय 40kसे40k से 41k होती है, तो टैक्स थोड़ा बढ़ जाना चाहिए क्योंकि आपने एक ब्रैकेट पार किया है। लेकिन यदि यह 41kसे41k से 42k होती है, तो उछाल (jump) बड़ा होना चाहिए।"
      • यह उन "फ्लैट-रेट" बग्स को पकड़ लेता है जिन्हें साधारण जाँच मिस कर देती है।

3. आश्चर्य: छोटे कुत्ते बनाम बड़े शेर

आमतौर पर, AI में, बड़े मॉडल (जैसे GPT-4o या Claude-3.5) छोटे मॉडलों की तुलना में अधिक स्मार्ट होते हैं। आप उम्मीद करेंगे कि "बड़ा शेर" जीतेगा।

पेपर ने इसके विपरीत पाया:
जब इस टीम दृष्टिकोण का उपयोग किया गया, तो एक छोटा, सस्ता AI मॉडल (GPT-4o-mini) अकेले काम करने वाले विशाल और महंगे मॉडलों की तुलना में वास्तव में बेहतर प्रदर्शन करता है।

  • क्यों? विशाल मॉडल एक साथ सब कुछ करने की कोशिश करते हैं और जटिलता से भ्रमित हो जाते हैं। छोटा मॉडल, जब "टैक्स एक्सपर्ट" द्वारा निर्देशित और "इंस्पेक्टर" द्वारा जांचा जाता है, तो वह केंद्रित रहता है और कम गलतियाँ करता है। यह एक केंद्रित प्रशिक्षु (apprentice) की तरह है जो एक महान गुरु के मार्गदर्शन में, एक विचलित प्रतिभाशाली व्यक्ति (distracted genius) से बेहतर काम कर रहा है।

4. परिणाम: "फ्लैट रेट" के जाल को पकड़ना

टीम ने अपने सिस्टम का छह अलग-अलग टैक्स परिदृश्यों पर परीक्षण किया, जिसमें साधारण कटौती से लेकर जटिल रिटायरमेंट वितरण तक शामिल थे।

  • टीम के बिना: यहाँ तक कि सर्वश्रेष्ठ AI मॉडल भी कठिन कार्यों में विफल रहे (15% से कम उत्तर सही पाए)।
  • टीम के साथ: छोटा मॉडल, एजेंटों द्वारा निर्देशित होने पर, 45% से 88% तक सही उत्तर प्राप्त करने में सफल रहा (जटिलता के आधार पर)।
  • "इंस्पेक्टर" प्रभाव: "मेटाबॉर्फिक एजेंट" (जासूस) को जोड़ना महत्वपूर्ण था। इसने उन व्यवस्थित त्रुटियों को खोज निकाला जिन्हें बिल्डर्स ने मिस कर दिया था, जिससे सफलता दर और बढ़ गई।

सारांश

यह पेपर तर्क देता है कि महत्वपूर्ण कानूनी कार्यों (जैसे टैक्स) के लिए सॉफ्टवेयर बनाने के लिए, हमें केवल एक सुपर-इंटेलिजेंट AI से "इसे करने" के लिए नहीं कहना चाहिए। इसके बजाय, हमें एक सहयोगात्मक टीम बनानी चाहिए:

  1. एक कानून का अनुवाद करने के लिए।
  2. एक कोड बनाने के लिए।
  3. एक जासूस के रूप में कार्य करने के लिए, यह जाँचने के लिए कि दबाव में तर्क (logic) कैसे टिकता है।

इस "एजेंटिक" दृष्टिकोण का उपयोग करके, छोटे, सस्ते AI मॉडल भी अकेले काम करने वाले सबसे शक्तिशाली मॉडलों की तुलना में अधिक सुरक्षित, सटीक और भरोसेमंद सॉफ्टवेयर बना सकते हैं। यह कानूनी टेक्स्ट से कोडिंग की अराजक प्रक्रिया को एक संरचित, विश्वसनीय असेंबली लाइन में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →