💬 NLP

CAPER: Clause-Aligned Process Supervision for Text-to-SQL

यह शोध पत्र CAPER को प्रस्तुत करता है, जो क्लॉज-स्तरीय पर्यवेक्षण (clause-level supervision) उत्पन्न करने के लिए SQL एब्स्ट्रैक्ट सिंटैक्स ट्री पर काउंटरफैक्चुअल इंटरवेंशन का लाभ उठाता है, जिससे एक हल्के रिवॉर्ड मॉडल को प्रशिक्षित करना सक्षम होता है जो मौजूदा विधियों की तुलना में टेक्स्ट-टू-एसक्यूएल निष्पादन सटीकता और विफलता स्थानीयकरण (failure localization) दोनों में महत्वपूर्ण सुधार करता है।

Lujie Ban, Jiasheng Shi, Jinyang Li, Xiaolin Han, Tsz Nam Chan, Chenhao Ma2026-06-03
💬 NLP

Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection

Lingo_Research_Group का शोध पत्र SemEval-2026 टास्क 9 के लिए Gemma3-27B मॉडल का उपयोग करते हुए बारह प्रॉम्प्ट वेरिएंट्स का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह दर्शाता है कि जबकि प्रॉम्प्ट-आधारित दृष्टिकोण 22 भाषाओं में मोटे तौर पर (coarse-grained) ध्रुवीकरण का प्रभावी ढंग से पता लगाते हैं, उन्हें सूक्ष्म (fine-grained) और बहु-लेबल समाजशास्त्रीय वर्गीकरण में बढ़ती चुनौतियों का सामना करना पड़ता है।

Pritam Kadasi, Anuj Tiwari, Mayank Singh2026-06-03
💬 NLP

The Unsampled Truth: Psychometrics in SLMs Measure Prompt Artifacts, Not Psychological Constructs

यह शोध पत्र प्रदर्शित करता है कि लघु भाषा मॉडलों (small language models) का उपयोग करके किए जाने वाले साइकोमेट्रिक मूल्यांकन अक्सर वास्तविक अर्थपूर्ण तर्क के बजाय प्रॉम्प्ट आर्टिफैक्ट्स (prompt artifacts) और अनुपालन द्वारा संचालित होते हैं, हालांकि लेखक भविष्य के अनुसंधान के लिए इन आर्टिफैक्ट्स को अलग करने हेतु एक नैदानिक ढांचे का प्रस्ताव करते हैं।

Nils Schwager, Christoph Hau, Simon Münker, Achim Rettinger2026-06-03
💬 NLP

EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge

यह शोध पत्र EntSQL को प्रस्तुत करता है, जो पाँच व्यावसायिक डोमेन में 1,066 उदाहरणों वाला एक नया चीनी-अंग्रेजी बेंचमार्क है, जिसे लंबे-संदर्भ वाले उद्यम ज्ञान (long-context enterprise knowledge) में टेक्स्ट-टू-एसक्यूएल (Text-to-SQL) जनरेशन की चुनौतियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जहाँ वर्तमान मॉडल मालिकाना व्यावसायिक समझ की आवश्यकता के कारण उच्च सटीकता प्राप्त करने में संघर्ष करते हैं।

Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi W (…)2026-06-03
🤖 machine learning

When Model Merging Breaks Routing: Training-Free Calibration for MoE

यह शोध पत्र हेसियन-अवेयर राउटर कैलिब्रेशन (HARC) को प्रस्तुत करता है, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो मर्ज किए गए राउटरों को पुनर्गठित करने के लिए सेकंड-ऑर्डर कर्वेचर जानकारी का उपयोग करता है और 'राउटिंग ब्रेकडाउन' की घटना को प्रभावी ढंग से कम करता है जो मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल मर्जिंग में प्रदर्शन में गिरावट का कारण बनती है।

Canbin Huang, Tianyuan Shi, Xiaojun Quan, Jingang Wang, Jianfei Zhang, Qifan Wang2026-06-03
💬 NLP

Causal Evidence of Stack Representations in Modeling Counter Languages Using Transformers

यह शोधपत्र कारणिक साक्ष्य प्रदान करता है कि काउंटर भाषाओं पर प्रशिक्षित ट्रांसफॉर्मर एक विशिष्ट स्टैक प्रतिनिधित्व (stack representation) को सीखते हैं और उस पर निर्भर रहते हैं, क्योंकि पहचाने गए मुख्य दिशा (principal direction) को हटाने से अनुक्रमिक सटीकता (sequential accuracy) लगभग शून्य तक गिर जाती है।

Nishit Singh2026-06-03
💬 NLP

Lexicons and grammars for language processing: industrial or handcrafted products?

यह शोध पत्र समृद्ध, हस्तनिर्मित शब्दकोशों और व्याकरणों के निर्माण के लिए मानव-चालित, भाषाविद्-संचालित दृष्टिकोण बनाम भाषा संसाधनों के औद्योगिक, स्वचालित उत्पादन के बीच के तनाव का विश्लेषण करता है, जिसका उद्देश्य यह निर्धारित करना है कि कौन सा दृष्टिकोण या संयोजन भाषा प्रसंस्करण के लिए सबसे प्रभावी परिणाम देता है।

Eric Laporte2026-06-03
💬 NLP

Large Language Models Are Overconfident in Their Own Responses

यह शोध पत्र प्रकट करता है कि चैट टेम्पलेट्स एक "स्वामित्व पूर्वाग्रह" (ownership bias) के माध्यम से इंस्ट्रक्शन-ट्यून्ड एलएलएम (LLMs) के अति-आत्मविश्वास को बढ़ा देते हैं जहाँ मॉडल समान उपयोगकर्ता-प्रदान किए गए आउटपुट की तुलना में अपने स्वयं के आउटपुट पर अधिक भरोसा करते हैं, और मॉडल के उत्तरों को उपयोगकर्ता इनपुट के रूप में फ्रेम करने की एक रिट्रेनिंग-मुक्त अनुमान रणनीति का प्रस्ताव करता है जो अंशांकन (calibration) में महत्वपूर्ण सुधार करती है।

Mario Sanz-Guerrero, Manuel Mager, Katharina von der Wense2026-06-03
💬 NLP

BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language

यह शोध पत्र BaltiVoice को प्रस्तुत करता है, जो बाल्टी भाषा के लिए पहला सार्वजनिक रूप से उपलब्ध स्पीच कॉर्पस और फाइन-ट्यून्ड Whisper ASR मॉडल है, जो Mozilla Common Voice से प्राप्त 16.8-घंटे के डेटासेट पर 182.18% के ज़ीरो-शॉट बेसलाइन से वर्ड एरर रेट को घटाकर 30.07% कर देता है।

Muhammad Ali2026-06-03✓ Author reviewed
💬 NLP

Can LLM Rerankers Predict Their Own Ranking Performance?

यह शोध पत्र इस बात की जांच करता है कि क्या LLM रीरैंकर्स आंतरिक रूप से अपनी रैंकिंग गुणवत्ता का पूर्वानुमान लगा सकते हैं, जो यह प्रदर्शित करता है कि प्रशिक्षण-मुक्त स्व-संगति (self-consistency) विधियाँ अत्याधुनिक दृष्टिकोणों के साथ प्रतिस्पर्धी हैं और साथ ही LLM के अन्यथा अति-आत्मविश्वासी मौखिक आत्मविश्वास (verbalized confidence) को कैलिब्रेट करने के लिए पर्यवेक्षित तकनीकों का प्रस्ताव करती हैं।

Shiyu Ni, Keping Bi, Jiafeng Guo, Jingtong Wu, Zengxin Han, Xueqi Cheng2026-06-03