💬 NLP

LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model

यह शोध पत्र LegalMidm को प्रस्तुत करता है, जो एक व्यवस्थित, उपयोग-मामला-संचालित प्रशिक्षण ढांचे के माध्यम से विकसित एक कोरियाई कानूनी-डोमेन लार्ज लैंग्वेज मॉडल है, जो वास्तविक दुनिया के कानूनी अनुप्रयोगों में सटीकता और व्यावहारिक उपयोगिता को बढ़ाने के लिए कानूनी पेशेवरों के साथ सहयोग और कठोर डेटा क्यूरेशन को प्राथमिकता देता है।

Youngjoon Jang, Chanhee Park, Hyeonseok Moon, Young-kyoung Ham, Jiwon Moon, Jinhyeon Kim, JuKyung Jung, Heuiseok Lim2026-04-29
💬 NLP

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

यह शोधपत्र Faithfulness-QA को प्रस्तुत करता है, जो लगभग 100,000 काउंटरफैक्टुअली (counterfactually) संशोधित QA नमूनों का एक बड़े पैमाने का डेटासेट है, जिसे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) मॉडलों को आंतरिक पैरामीट्रिक मेमोरी के बजाय रिट्रीव किए गए संदर्भ को प्राथमिकता देने के लिए प्रशिक्षित और मूल्यांकित करने हेतु डिज़ाइन किया गया है, जिससे अनफेथफुल (unfaithful) जनरेशन की महत्वपूर्ण समस्या का समाधान किया जा सके।

Li Ju, Junzhe Wang, Qi Zhang2026-04-29
💬 NLP

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

यह शोध पत्र Cutscene Agent को प्रस्तुत करता है, जो एक मल्टी-एजेंट LLM फ्रेमवर्क है जो द्वि-दिशीय गेम इंजन एकीकरण (bidirectional game engine integration), विजुअल फीडबैक वाले एक पदानुक्रमित ऑर्केस्ट्रेशन सिस्टम और जटिल, लॉन्ग-होरिजन टूल ऑर्केस्ट्रेशन का मूल्यांकन करने के लिए डिज़ाइन किए गए एक नए पदानुक्रमित बेंचमार्क (CutsceneBench) के माध्यम से एंड-टू-एंड 3D कटसीन जनरेशन को स्वचालित करता है।

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan (…)2026-04-29
💬 NLP

R3^3-SQL: Ranking Reward and Resampling for Text-to-SQL

R³-SQL एक नवीन Text-to-SQL फ्रेमवर्क है जो कार्यात्मक रूप से समान SQL समूहों की सुसंगत रैंकिंग के लिए एक एकीकृत रिवॉर्ड मैकेनिज्म और सही क्वेरीज़ को तब पुनः प्राप्त करने के लिए एक एजेंटिक रीसैंपलिंग रणनीति पेश करके निष्पादन सटीकता में सुधार करता है जब वे शुरू में कैंडिडेट पूल से गायब होती हैं, जिससे BIRD-dev बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Hojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He2026-04-29
💬 NLP

Wiki Dumps to Training Corpora: South Slavic Case

यह शोध पत्र सात दक्षिण स्लाव भाषाओं के लिए कई विकी परियोजनाओं से पाठ को व्यवस्थित रूप से निकालकर और निम्न-गुणवत्ता वाले, पुनरावृत्ति वाले लेखों को हटाने के लिए n-ग्राम-आधारित फ़िल्टरिंग का उपयोग करके, कच्चे विकिमीडिया डंप को उच्च-गुणवत्ता वाले, भाषाई रूप से समृद्ध प्रशिक्षण कॉर्पोरा में बदलने के लिए एक भाषा-अज्ञेय (language-agnostic) कार्यप्रणाली प्रस्तुत करता है।

Mihailo Škorić2026-04-29
💬 NLP

Benchmarking PyCaret AutoML Against IndoBERT Fine-Tuning for Sentiment Analysis on Indonesian IKN Twitter Data

यह शोध पत्र प्रदर्शित करता है कि इंडोबर्ट (IndoBERT) मॉडल को फाइन-ट्यून करना शास्त्रीय पायकेरेट (PyCaret) ऑटोएमएल (AutoML) दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है, जो इबु कोटा नुसंतारा (IKN) के संबंध में अनौपचारिक इंडोनेशियाई ट्विटर टिप्पणियों के बाइनरी सेंटीमेंट विश्लेषण के लिए 77.57% के मुकाबले 89.59% सटीकता प्राप्त करता है।

Mutia Alfi Mayzaroh, Dwi Fitria Ningsih, Nindi Destriani, Martin C. T. Manullang2026-04-29
💬 NLP

Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer

यह शोध पत्र मैक्सिमल अपडेट पैरामीट्रिज़ेशन (muP) पर आधारित एक कुशल क्रॉस-स्केल हाइपरपैरामीटर ट्रांसफर पद्धति प्रस्तुत करता है जो प्रोबेबिलिस्टिक ट्रांसफॉर्मर को 0.4B पैरामीटर्स तक स्केल करने में सक्षम बनाता है और समान पैरामीटर बजट के तहत मास्क लैंग्वेज मॉडलिंग कार्यों पर मानक ट्रांसफॉर्मर्स को लगातार पछाड़ता है।

Penghao Kuang, Haoyi Wu, Kewei Tu2026-04-29
⚡ electrical engineering

Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost

प्रैक्सी वॉयस (Praxy Voice), स्क्रिप्ट रूपांतरण के लिए ब्राह्मी एकीकृत फोनीम स्पेस (Brahmic Unified Phonym Space - BUPS), लाइसेंस प्राप्त डेटा पर प्रशिक्षित एक टेक्स्ट-ओनली लोरा (LoRA) एडॉप्टर और एक विशिष्ट वॉयस-प्रॉम्ट सैंपलिंग रेसिपी को संयोजित करके, बिना किसी व्यावसायिक प्रशिक्षण डेटा या ध्वनिक डिकोडर पुन:\प्रशिक्षण की आवश्यकता के, तेलुगु, तमिल और हिंदी के लिए व्यावसायिक-श्रेणी का टेक्स्ट-टू-स्पीच प्रदर्शन प्राप्त करता है।

Venkata Pushpak Teja Menta2026-04-29
💬 NLP

Navigating Global AI Regulation: A Multi-Jurisdictional Retrieval-Augmented Generation System

यह शोध पत्र एक बहु-क्षेत्राधिकार (multi-jurisdictional) रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम प्रस्तुत करता है जो एकल और बहु-क्षेत्राधिकार संबंधी कानूनी प्रश्नों के उत्तर देने में उच्च सटीकता प्राप्त करने के लिए टाइप-विशिष्ट चंकिंग और कंडीशनल रिट्रीवल रूटिंग जैसी विशिष्ट तकनीकों का उपयोग करके जटिल वैश्विक एआई नियमों के बीच नेविगेट करता है।

Courtney Ford, Ojas Rane, Susan Leavy2026-04-29
💬 NLP

Benchmarking Logistic Regression, SVM, and LightGBM Against BiLSTM with Attention for Sentiment Analysis on Indonesian Product Reviews

यह शोध पत्र इंडोनेशियाई सेंटीमेंट एनालिसिस के लिए एक BiLSTM विद अटेंशन मॉडल के विरुद्ध पारंपरिक मशीन लर्निंग एल्गोरिदम (लॉजिस्टिक्स रिग्रेशन, SVM, और LightGBM) का बेंचमार्किंग करता है, जिसमें यह पाया गया कि सबसे अच्छा प्रदर्शन करने वाला ML मॉडल (लॉजिस्टिक्स रिग्रेशन) डीप लर्निंग दृष्टिकोण से थोड़ा बेहतर प्रदर्शन करता है और साथ ही अधिक कम्प्यूटेशनल दक्षता प्रदान करता है।

Razin Hafid Hamdi, Ivana Margareth Hutabarat, Hanna Gresia Sinaga, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manulla (…)2026-04-29