← नवीनतम पेपर
💬 NLP

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

यह शोध पत्र पॉलिसीबेंच (PolicyBench) को पेश करता है, जो स्मृति (memorization), समझ (understanding) और अनुप्रयोग (application) के माध्यम से नीति बोध (policy comprehension) के मूल्यांकन के लिए एक बड़े पैमाने का क्रॉस-सिस्टम बेंचमार्क है, और पॉलिसीमोई (PolicyMoE) का प्रस्ताव करता है, जो एक विशिष्ट मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जो संरचित तर्क (structured reasoning) और अनुप्रयोग-उन्मुख नीति कार्यों पर उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chawla, Yanfang Ye, Xiangliang Zhang

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chawla, Yanfang Ye, Xiangliang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान लाइब्रेरियन है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है। इस लाइब्रेरियन ने अस्तित्व में मौजूद लगभग हर किताब, लेख और वेबसाइट को पढ़ा है। वे कविता लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं और तुरंत भाषाओं का अनुवाद कर सकते हैं।

लेकिन एक पेच है: पब्लिक पॉलिसी (सार्वजनिक नीति) एक बहुत ही अलग तरह की किताब है। यह केवल तथ्यों के बारे में नहीं है; यह नियमों, मूल्यों, इस बारे में है कि किसे क्या मिलता है, और सरकारें वास्तव में कैसे काम करती हैं। यदि यह लाइब्रेरियन आपको टैक्स कानून या स्वास्थ्य सेवा के नियम पर गलत सलाह देता है, तो वास्तविक लोगों के घर या स्वास्थ्य छिन सकते हैं।

आपने जो पेपर साझा किया है, "PolicyLLM", वह इस लाइब्रेरियन के लिए एक रिपोर्ट कार्ड और एक नया प्रशिक्षण मैनुअल (training manual) है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: लाइब्रेरियन अनुमान लगा रहा है

शोधकर्ताओं ने महसूस किया कि जबकि ये AI मॉडल सामान्य ज्ञान में बहुत अच्छे हैं, वे पब्लिक पॉलिसी के मामले में अक्सर लड़खड़ा जाते हैं।

  • मुद्दा: यदि आप AI से पूछते हैं, "यह कानून किस तारीख को पारित हुआ था?" तो वह अनुमान लगा सकता है। यदि आप पूछते हैं, "यह कानून एक विशिष्ट शहर में एक छोटे व्यवसाय की मदद कैसे करता है?" तो वह एक विश्वसनीय लगने वाला लेकिन गलत उत्तर बना सकता है।
  • जोखिम: वास्तविक दुनिया में, एक गलत अनुमान केवल एक बुरा ग्रेड नहीं है; यह एक बुरा निर्णय है जो समाज को प्रभावित करता है।

2. समाधान भाग 1: "पॉलिसी जिम" (PolicyBench)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक विशाल जिम बनाया जिसे PolicyBench कहा जाता है। इसे एक विशाल बाधा दौड़ (obstacle course) के रूप में समझें जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि एक AI सरकारी नियमों को कितनी अच्छी तरह समझता है।

  • दायरा: उन्होंने केवल एक देश को नहीं देखा। उन्होंने दो बहुत अलग दुनियाओं से बाधाओं वाला एक कोर्स बनाया: संयुक्त राज्य अमेरिका और चीन। यह परीक्षण करता है कि क्या AI सरकार की विभिन्न शैलियों और भाषा को संभाल सकता है।
  • कठिनाई के तीन स्तर (Bloom's Taxonomy):
    • स्तर 1: फ्लैशकार्ड ड्रिल (याद करना/रटना)।
      • उपमा: "'डबल रिडक्शन' नीति कब हस्ताक्षरित हुई थी?"
      • लक्ष्य: क्या AI सटीक तथ्यों को याद रख सकता है?
    • स्तर 2: जासूसी कार्य (समझना)।
      • उपमा: "सरकार ने यह नियम क्यों लिखा? वे किसकी मदद करने की कोशिश कर रहे हैं, और वे किन मूल्यों की रक्षा कर रहे हैं?"
      • लक्ष्य: क्या AI शब्दों को ही नहीं, बल्कि नियम के पीछे की भावना और तर्क को भी समझ सकता है?
    • स्तर 3: वास्तविक जीवन का सिमुलेशन (अनुप्रयोग/लागू करना)।
      • उपमा: "एक विशिष्ट शहर में एक छोटा व्यवसायी मालिक एक समस्या का सामना कर रहा है। इस नीति के आधार पर, उन्हें आगे क्या करना चाहिए? उन्हें कितना पैसा मिल सकता है?"
      • लक्ष्य: क्या AI उस नियम को ले सकता है और उसे एक जटिल, वास्तविक दुनिया की स्थिति में लागू कर सकता है?

परिणाम: उन्होंने पाया कि AI मॉडल स्तर 1 (याद करने) की तुलना में स्तर 3 (अनुप्रयोग) में वास्तव में बेहतर हैं!

  • क्यों? यह एक ऐसे छात्र की तरह है जो रटने में बुरा है लेकिन पहेलियाँ सुलझाने में बहुत अच्छा है। AI तार्किक तर्क (पहेली सुलझाना) में अच्छा है लेकिन कभी-कभी सटीक तारीख (एक तथ्य) भूल जाता है। हालाँकि, वे अभी भी अमूर्त अवधारणाओं और नीतियों के पीछे के गहरे "क्यों" को समझने में संघर्ष करते हैं।

3. समाधान भाग 2: "विशेषज्ञ टीम" (PolicyMoE)

शोधकर्ताओं ने महसूस किया कि एक विशाल मस्तिष्क से सब कुछ करने (तथ्य याद रखने, गहरे विचार समझने और समस्याओं को हल करने) की अपेक्षा करना अक्षम है। यह एक अकेले शेफ से एक मास्टर बेकर, ग्रिल विशेषज्ञ और पेस्ट्री शेफ तीनों होने की अपेक्षा करने जैसा है।

इसलिए, उन्होंने PolicyMoE (Mixture of Experts) बनाया।

  • उपमा: एक विशाल मस्तिष्क के बजाय, उन्होंने मिलकर काम करने वाले तीन विशेषज्ञों की एक टीम बनाई:
    1. द आर्काइविस्ट (अभिलेखागार विशेषज्ञ): यह केवल सटीक तारीखों, नामों और नंबरों को याद रखने में माहिर है।
    2. द फिलोसोफर (दार्शनिक): यह कानूनों के पीछे के विचारों, मूल्यों और "क्यों" को समझने में माहिर है।
    3. द स्ट्रैटेजिस्ट (रणनीतिकार): यह उन कानूनों को लेने और वास्तविक जीवन के परिदृश्य में क्या करना है, यह तय करने में माहिर है।
  • द राउटर (मार्गदर्शक): एक स्मार्ट "मैनेजर" (राउटर) है जो आपके प्रश्न को देखता है। यदि आप एक तारीख पूछते हैं, तो वह इसे आर्काइविस्ट के पास भेज देता है। यदि आप सलाह मांगते हैं, तो वह इसे स्ट्रैटेजिस्ट के पास भेज देता है।

परिणाम: यह टीम दृष्टिकोण "एक ही आकार सबके लिए उपयुक्त" (one-size-fits-all) वाले मॉडलों की तुलना में बहुत बेहतर रहा। विशेषज्ञ टीम ने कम गलतियाँ कीं और अधिक विश्वसनीय सलाह दी, विशेष रूप से जटिल कार्यों के लिए।

4. मुख्य निष्कर्ष

यह पेपर हमें दो मुख्य बातें सिखाता है:

  1. हमें बेहतर परीक्षणों की आवश्यकता है: हम केवल यह देखने के लिए AI से "2+2 क्या है?" नहीं पूछ सकते कि क्या वह सरकारी काम के लिए तैयार है। हमें विशिष्ट परीक्षणों (जैसे PolicyBench) की आवश्यकता है जो यह जाँचते हैं कि क्या वह नियमों, मूल्यों और वास्तविक दुनिया के परिणामों को समझता है।
  2. विशेषज्ञता जीतती है: पब्लिक पॉलिसी के लिए AI को वास्तव में उपयोगी बनाने के लिए, हमें केवल मॉडलों को "बड़ा" नहीं बनाना चाहिए। हमें उन्हें एक सामान्य विशेषज्ञ के बजाय विशेषज्ञों की एक टीम की तरह विशेष भूमिकाएँ देकर अधिक स्मार्ट बनाना चाहिए।

संक्षेप में: शोधकर्ताओं ने एक कठोर परीक्षण बनाया कि AI सरकारी नियमों को कितनी अच्छी तरह समझता है, पाया कि AI समस्याओं को हल करने में अच्छा है लेकिन तथ्यों को याद रखने में बुरा है, और फिर एक "विशेषज्ञों की टीम" प्रणाली का आविष्कार किया ताकि AI को वास्तविक दुनिया के नीतिगत निर्णयों के लिए बहुत अधिक विश्वसनीय बनाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →