💬 NLP

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

यह शोध पत्र AdvancedMathBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क सुइट है जिसमें उन्नत गणितीय प्रमाण निर्माण के मूल्यांकन के लिए ProverBench और प्रमाण सत्यापन के आकलन के लिए VerifierBench के साथ-साथ एक विशेष स्वचालित सत्यापन पाइपलाइन शामिल है, ताकि यह प्रकट किया जा सके कि वर्तमान अत्याधुनिक लार्ज लैंग्वेज मॉडल्स अभी भी स्नातक और डॉक्टरेट स्तर पर कठोर प्रमाणों के निर्माण और सत्यापन में काफी संघर्ष करते हैं।

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao (…)2026-07-14
💬 NLP

A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol

यह शोध पत्र स्पेनिश डेटा पर विषयगत वर्गीकरण में अग्रणी मॉडलों की उत्कृष्टता को प्रदर्शित करते हुए, एक शिक्षण-फीडबैक वर्गीकरण प्रोटोकॉल की स्थायित्वता और क्रॉस-लैंग्वेज ट्रांसफर को प्रमाणित करता है, क्योंकि यह दर्शाता है कि सेंटीमेंट एनालिसिस के लिए मॉडल का चयन एक कार्यान्वयन संबंधी निर्णय है न कि एक पद्धतिगत आवश्यकता, क्योंकि सरल मॉडल स्पेनिश और अंग्रेजी दोनों संदर्भों में तुलनीय प्रदर्शन करते हैं।

Esteban U. Vega Barajas2026-07-14
💬 NLP

Beyond LLMs: A Linguistic Approach to Causal Graph Generation from Narrative Texts

यह शोध पत्र एक नवीन, व्याख्यात्मक ढांचे को प्रस्तुत करता है जो नैरेटिव टेक्स्ट से उच्च-गुणवत्ता वाले कॉज़ल ग्राफ (causal graphs) उत्पन्न करने के लिए LLM-आधारित सारांशीकरण को भाषाई रूप से सूचित "एक्सपर्ट इंडेक्स" और STAC वर्गीकरण के साथ जोड़ता है, जो सटीकता और पठनीयता में GPT-4o और Claude 3.5 जैसे अग्रणी मॉडलों से बेहतर प्रदर्शन करता है।

Zehan Li, Ruhua Pan, Xinyu Pi2026-07-13
💬 NLP

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

यह शोध पत्र ज्यामितीय विस्थापन (geometric shifting) और सहप्रसरण हेरफेर (covariance manipulation) को एलएलएम (LLMs) में व्हाइट-बॉक्स मॉनिटर से बचने के लिए सक्षम करने वाले प्रमुख तंत्रों के रूप में पहचानता है और सेफ्टीनेट (SafetyNet) का प्रस्ताव करता है, जो एक सुदृढ़ एंसेम्बल रक्षा (robust ensemble defense) है जो कई मॉडल परिवारों और बेंचमार्क में लगभग पूर्ण डिटेक्शन प्रदर्शन प्राप्त करता है।

Maheep Chaudhary, Fazl Barez2026-07-13
💬 NLP

REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression

यह शोध पत्र REAL को प्रस्तुत करता है, जो एक नवीन KV कैश इविक्शन विधि है जो सफल और विफल तर्क पैटर्न (reasoning patterns) दोनों का विश्लेषण करने के लिए एक अटेंशन बिहेवियर मैट्रिक्स का लाभ उठाती है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम मेमोरी ओवरहेड के साथ अत्याधुनिक लॉन्ग-कॉन्टेक्स्ट प्रदर्शन प्राप्त होता है।

Mengjie Li, Yuan Feng, Xike Xie, William J. Song2026-07-13
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

यह शोध पत्र Deco-G को प्रस्तुत करता है, जो एक ऐसा डिकोडिंग फ्रेमवर्क है जो एक समर्पित फॉर्मेट एस्टीमेशन मॉड्यूल के माध्यम से समस्या-समाधान को कठोर फॉर्मेटिंग आवश्यकताओं से अलग करके जटिल कार्यों पर लार्ज लैंग्वेज मॉडल के प्रदर्शन में सुधार करता है, जो तर्क करने में बाधा डाले बिना अनुपालन सुनिश्चित करता है।

Haikang Deng, Po-Nien Kung, Nanyun Peng2026-07-13
💬 NLP

Contrastive Weak-to-strong Generalization

यह शोध पत्र कॉन्ट्रास्टिव वीक-टू-स्ट्रॉन्ग जनरलाइजेशन (ConG) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संरेखित (aligned) कमजोर मॉडलों से उच्च गुणवत्ता वाले प्रशिक्षण नमूने उत्पन्न करने के लिए इम्प्लिसिट रिवॉर्ड्स और कॉन्ट्रास्टिव डिकोडिंग के बीच संरचनात्मक समानता का लाभ उठाता है, जिससे मानव फीडबैक के बिना बड़े भाषा मॉडलों के स्केलिंग की मजबूती और प्रभावशीलता बढ़ती है।

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng2026-07-13
💬 NLP

Leveraging Multi-Agent System (MAS) and Fine-Tuned Small Language Models (SLMs) for Automated Telecom Network Troubleshooting

यह शोध पत्र एक मल्टी-एजेंट सिस्टम का प्रस्ताव करता है जो रेडियो एक्सेस और कोर नेटवर्क डोमेन में रूट-कॉज़ डायग्नोसिस (मूल कारण निदान) को त्वरित करने और मैनुअल विशेषज्ञ हस्तक्षेप पर निर्भरता को महत्वपूर्ण रूप से कम करने के लिए विशेष उपकरणों और एक फाइन-ट्यून किए गए स्मॉल लैंग्वेज मॉडल को समन्वित करता है ताकि टेलीकॉम नेटवर्क ट्रबलशूटिंग को स्वचालित किया जा सके।

Chenhua Shi, Bhavika Jalli, Gregor Macdonald, John Zou, Wanlu Lei, Mridul Jain, Joji Philip2026-07-13
💬 NLP

Reasoning Up the Instruction Ladder for Controllable Language Models

यह शोधपत्र VerIH प्रस्तुत करता है, जो एक प्रशिक्षण डेटासेट और सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण है जो निर्देश पदानुक्रम समाधान (instruction hierarchy resolution) को एक तर्क कार्य के रूप में पुनर्गठित करता है, जिससे भाषा मॉडल परस्पर विरोधी निर्देशों को प्रभावी ढंग से प्राथमिकता देने में सक्षम होते हैं और निर्देश पालन एवं सुरक्षा हमलों के विरुद्ध मजबूती में महत्वपूर्ण सुधार करते हैं।

Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar2026-07-13
💬 NLP

A Shared Geometry of Difficulty in Multilingual Language Models

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स समस्या की कठिनाई को एक द्वि-चरणीय प्रतिनिधित्व पदानुक्रम (two-stage representational hierarchy) के माध्यम से संसाधित करते हैं, जहाँ उथले स्तरों (shallow layers) में भाषा-निरपेक्ष संकेत उभरते हैं ताकि क्रॉस-लिंगुअल सामान्यीकरण सक्षम हो सके, जबकि गहरे स्तरों (deeper layers) में भाषा-विशिष्ट संकेत एक ही भाषा के भीतर सटीकता को अनुकूलित करते हैं।

Stefano Civelli, Pietro Bernardelle, Nicolò Brunello, Gianluca Demartini2026-07-13