💬 NLP

MAPLE: Metadata Augmented Private Language Evolution

यह शोध पत्र MAPLE का प्रस्ताव करता है, जो एक नवीन ढांचा है जो इनिशियलाइजेशन बाधाओं को दूर करने के लिए डिफरेंशियल प्राइवेट टैबुलर मेटाडेटा और इन-कॉन्टेक्स्ट लर्निंग का लाभ उठाकर API-एक्सेसिबल LLMs के लिए डिफरेंशियल प्राइवेट लैंग्वेज इवोल्यूशन को बढ़ाता है, जिससे मौजूदा तरीकों की तुलना में बेहतर प्राइवेसी-यूटिलिटी ट्रेड-ऑफ, तेज़ कन्वर्जेंस और कम API लागत प्राप्त होती है।

Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz2026-03-23
💬 NLP

Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis

यह शोध पत्र ब्रीज़ ताइगी (Breeze Taigi) का परिचय देता है, जो एक व्यापक ढांचा है जिसमें मानकीकृत बेंचमार्क, क्यूरेटेड डेटासेट और ओपन-सोर्स मॉडल शामिल हैं जो ताइवानी होकिएन भाषण पहचान और संश्लेषण को महत्वपूर्ण रूप से आगे बढ़ाने के लिए सिंथेटिक डेटा और मंदारिन-ताइगी समानांतर संसाधनों का लाभ उठाते हैं।

Yu-Siang Lan, Chia-Sheng Liu, Yi-Chang Chen, Po-Chun Hsu, Allyson Chiu, Shun-Wen Lin, Da-shan Shiu, Yuan-Fu Liao2026-03-23
💬 NLP

Significance-Gain Pair Encoding for LLMs: A Statistical Alternative to Frequency-Based Subword Merging

यह शोध पत्र सिग्निफिकेंस-गेन बीपीई (Significance-Gain BPE) का प्रस्ताव करता है, जो मानक आवृत्ति-आधारित सबवर्ड मर्जिंग का एक सांख्यिकीय रूप से आधारित विकल्प है जो युग्म सामंजस्य (pair cohesion) को मापने के लिए एक ज़ेड-सांख्यिकी (z-statistic) का उपयोग करता है, और WikiText-103 डेटासेट पर भाषा मॉडल के लिए पर्प्लेक्सिटी (perplexity) और बिट्स प्रति कैरेक्टर (bits per character) में महत्वपूर्ण सुधार प्रदर्शित करता है।

Azam Nouri2026-03-23
💬 NLP

The {\alpha}-Law of Observable Belief Revision in Large Language Model Inference

यह शोध पत्र α\alpha-लॉ (Law) को प्रस्तुत करता है, जो एक गुणक स्केलिंग नियम (multiplicative scaling law) है कि कैसे बड़े भाषा मॉडल पुनरावृत्ति अनुमान (iterative inference) के दौरान विश्वासों में संशोधन करते हैं, जो यह प्रदर्शित करता है कि एक से कम घातांक (exponent) अनंत स्थिरता (asymptotic stability) सुनिश्चित करता है और विविध मॉडलों एवं बेंचमार्क में लगभग-बेशियन अपडेट व्यवहारों (near-Bayesian update behaviors) को प्रकट करता है।

Mike Farmer, Abhinav Kochar, Yugyung Lee2026-03-23
💬 NLP

Generative Active Testing: Efficient LLM Evaluation via Proxy Task Adaptation

यह शोध पत्र जेनेरेटिव एक्टिव टेस्टिंग (GAT) का परिचय देता है, जो एक अनिश्चितता-जागरूक ढांचा है जो जेनेरेटिव QA कार्यों के बेंचमार्किंग के लिए नमूनों को कुशलतापूर्वक चुनने हेतु LLMs को सरोगेट के रूप में और एक नवीन स्टेटमेंट अडैप्टेशन मॉड्यूल का उपयोग करता है, जिससे विशेषज्ञ लेबलिंग की लागत को कम करते हुए पारंपरिक सैंपलिंग विधियों की तुलना में अनुमान त्रुट को लगभग 40% तक कम किया जा सकता है।

Aashish Anantha Ramakrishnan, Ardavan Saeedi, Hamid Reza Hassanzadeh, Fazlolah Mohaghegh, Dongwon Lee2026-03-23
💬 NLP

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

यह शोधपत्र दहन विज्ञान (combustion science) के लिए पहले फुल-स्टैक डोमेन-एन्हांस्ड वर्कफ़्लो को प्रस्तुत करता है जो भ्रम (hallucinations) को समाप्त करने और भौतिक नियमों के पालन को सुनिश्चित करने के लिए स्वचालित कॉर्पस निर्माण, इंक्रीमेंटल प्री-ट्रेनिंग, इंस्ट्रक्शन फाइन-ट्यूनिंग और सत्यापन योग्य रिवॉर्ड-आधारित सुदृढीकरण लर्निंग (reinforcement learning) को एकीकृत करता है, जिसे नए फ्लेमबेंच (FlameBench) बेंचमार्क द्वारा मान्य किया गया है जो अत्याधुनिक मॉडलों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen2026-03-23
💬 NLP

Autonoma: A Hierarchical Multi-Agent Framework for End-to-End Workflow Automation

यह शोध पत्र ऑटोनोमा (Autonoma) को प्रस्तुत करता है, जो एक पदानुक्रमित बहु-एजेंट ढांचा (hierarchical multi-agent framework) है जो ऑर्केस्ट्रेशन लॉजिक को विशिष्ट निष्पादन से अलग करके प्राकृतिक भाषा के प्रॉम्प्ट्स को सुदृढ़, एंड-टू-एंड वर्कफ़्लो में अनुवादित करता है, जिससे मल्टी-मोडल और द्विभाषी समर्थन के साथ उच्च विश्वसनीयता, स्केलेबिलिटी और समावेशिता प्राप्त होती है।

Eslam Reda, Maged Yasser, Sara El-Metwally2026-03-23
💬 NLP

Improving Automatic Summarization of Radiology Reports through Mid-Training of Large Language Models

यह शोध पत्र प्रदर्शित करता है कि बड़े पैमाने पर नैदानिक पाठ (clinical text) का उपयोग करने वाली एक "प्री-ट्रेनिंग, मिड-ट्रेनिंग, फाइन-ट्यूनिंग" रणनीति रेडियोलॉजी रिपोर्ट के स्वचालित सारांशीकरण में महत्वपूर्ण सुधार करती है, जो पारंपरिक प्रत्यक्ष फाइन-ट्यूनिंग दृष्टिकोणों की तुलना में पाठ की गुणवत्ता और तथ्यात्मकता दोनों में बेहतर प्रदर्शन करती है।

Mengxian Lyu, Cheng Peng, Ziyi Chen, Mengyuan Zhang, Jieting Li Lu, Yonghui Wu2026-03-23
💬 NLP

URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models

यह शोध पत्र URAG को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जो ओपन-एंडेड RAG कार्यों को कॉन्फॉर्मल प्रेडिक्शन के माध्यम से सिद्धांतिक अनिश्चितता परिमाणीकरण (uncertainty quantification) को सक्षम करने के लिए बहुविकल्पीय प्रश्नों में पुनर्गठित करता है, जो इस बारे में महत्वपूर्ण अंतर्दृष्टि प्रकट करता है कि रिट्रीवल नॉइज़, विधि की जटिलता और डोमेन कारक, रिट्रीवल-ऑगमेंटेड लार्ज लैंग्वेज मॉडल्स की सटीकता और विश्वसनीयता को कैसे प्रभावित करते हैं।

Vinh Nguyen, Cuong Dang, Jiahao Zhang, Hoa Tran, Minh Tran, Trinh Chau, Thai Le, Lu Cheng, Suhang Wang2026-03-23
💬 NLP

Automated Motif Indexing on the Arabian Nights

यह शोध पत्र स्वचालित मोटिफ इंडेक्सिंग के लिए पहले कम्प्यूटेशनल दृष्टिकोण को प्रस्तुत करता है, जिसमें एल-शमी के मोटिफ इंडेक्स के साथ 'अरेबियन नाइट्स' के एक मैन्युअल रूप से एनोटेट किए गए कॉर्पस का उपयोग करके यह प्रदर्शित किया गया है कि एक फाइन-ट्यून्ड लामा3 (Llama3) मॉडल 0.85 के F1 स्कोर के साथ मोटिफ अभिव्यक्तियों का प्रभावी ढंग से पता लगा सकता है।

Ibrahim H. Alyami, Mark A. Finlayson2026-03-23