💬 NLP

Distilling Formal Logic into Neural Spaces: A Kernel Alignment Approach for Signal Temporal Logic

यह शोधपत्र एक नवीन ढांचे का प्रस्ताव करता है जो कर्नेल संरेखण (kernel alignment) के माध्यम से सिग्नल टेम्पोरल लॉजिक (Signal Temporal Logic) के ज्यामितीय अर्थविज्ञान (geometric semantics) को एक ट्रांसफॉर्मर एनकोडर में निष्कर्षित करता है, जिससे कुशल, व्युत्क्रमणीय (invertible) और अर्थपूर्ण न्यूरल निरूपण सक्षम होते हैं जो प्रतीकात्मक कर्नेल की कम्प्यूटेशनल सीमाओं और वाक्य-आधारित एम्बेडिंग की संरचनात्मक कमियों को दूर करते हैं।

Sara Candussio, Gabriele Sarti, Gaia Saveri, Luca Bortolussi2026-03-06
💬 NLP

Core-based Hierarchies for Efficient GraphRAG

यह शोध पत्र एक नियत और कुशल GraphRAG ढांचे का प्रस्ताव करता है जो वैश्विक अर्थबोध (sensemaking), उत्तर की व्यापकता और विविधता में सुधार करने तथा विविध वास्तविक दुनिया के डेटासेटों में टोकन लागत को कम करने के लिए गैर-पुनरुत्पादनीय लीडेन क्लस्टरिंग (Leiden clustering) को k-कोर अपघटन (k-core decomposition) और हल्के ह्यूरिस्टिक्स (heuristics) से बदलता है।

Jakir Hossain, Ahmet Erdem Sarıyüce2026-03-06
🤖 AI

Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding

यह शोध पत्र स्पेक्युलेटिव डिकोडिंग के लिए एक वोकैबुलरी ट्रिमिंग रणनीति प्रस्तावित करता है जो टोकन कवरेज और लेटेंसी के बीच संतुलन बनाने के लिए ड्राफ्ट मॉडल वोकैबुलरी चयन को एक कन्सट्रेंड ऑप्टिमाइज़ेशन समस्या के रूप में तैयार करता है, जिससे डोमेन-विशिष्ट वर्कलोड के अनुरूप वोकैबुलरी को अनुकूलित करके महत्वपूर्ण थ्रूपुट सुधार और लेटेंसी में कमी प्राप्त होती है।

Ofir Ben Shoham2026-03-06
💬 NLP

VietJobs: A Vietnamese Job Advertisement Dataset

यह शोध पत्र VietJobs को प्रस्तुत करता है, जो 48,092 वियतनामी नौकरी विज्ञापनों का पहला बड़े पैमाने पर सार्वजनिक कॉर्पस है, और वियतनामी एनएलपी (NLP) और श्रम बाजार विश्लेषण को आगे बढ़ाने के लिए नौकरी वर्गीकरण और वेतन अनुमान जैसे कार्यों पर जनरेटिव लार्ज लैंग्वेज मॉडल्स का बेंचमार्क निर्धारित करता है।

Hieu Pham Dinh, Hung Nguyen Huy, Mo El-Haj2026-03-06
💬 NLP

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner एक सुदृढीकरण शिक्षण (reinforcement learning) आधारित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो एक जनरेटिव रिवॉर्ड मॉडल और ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के साथ ड्यूल-ट्रैक डिस्टिलेशन रणनीति का उपयोग करता है ताकि फाउंडेशन मॉडल्स में मजबूत ऑडियो-विजुअल व्यंग्य तर्क (sarcasm reasoning) को महत्वपूर्ण रूप से बढ़ाया जा सके और मतिभ्रम (hallucinations) को कम किया जा सके।

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler2026-03-06
🤖 AI

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

यह शोध पत्र Med-V1 को प्रस्तुत करता है, जो सिंथेटिक डेटा पर प्रशिक्षित 3-बिलियन-पैरामीटर वाले कुशल स्मॉल लैंग्वेज मॉडल्स का एक परिवार है, जो बायोमेडिकल एविडेंस एट्रिब्यूशन और हैलुसिनेशन डिटेक्शन के लिए GPT-5 जैसे फ्रंटियर मॉडल्स के तुलनीय प्रदर्शन प्राप्त करते हैं, जबकि क्लिनिकल गाइडलाइन्स में साइटेशन वैधता के विश्लेषण और साक्ष्य मिसएट्रिब्यूशन की पहचान करने जैसे स्केलेबल अनुप्रयोगों को सक्षम बनाते हैं।

Qiao Jin, Yin Fang, Lauren He, Yifan Yang, Guangzhi Xiong, Zhizheng Wang, Nicholas Wan, Joey Chan, Donald C. Comeau, Rob (…)2026-03-06
🤖 AI

PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration

यह शोध पत्र PersianPunc पेश करता है, जो 17 मिलियन नमूनों का एक बड़े पैमाने का डेटासेट है, और एक फाइन-ट्यून्डेड ParsBERT मॉडल जो फारसी विराम चिह्न बहाली (punctuation restoration) के लिए 91.33% मैक्रो-एवरेज्ड F1 स्कोर प्राप्त करता है, जो वास्तविक समय के अनुप्रयोगों के लिए बड़े भाषा मॉडलों (large language models) का एक अधिक कुशल और सटीक विकल्प प्रदान करता है।

Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery2026-03-06
💬 NLP

A Multilingual Human Annotated Corpus of Original and Easy-to-Read Texts to Support Access to Democratic Participatory Processes

यह शोध पत्र स्पेनिश, कैटलन और इतालवी में मूल और मानव-एनोटेटेड 'ईज़ी-टू-रीड' (सरल पठन) ग्रंथों के एक मुक्त सुलभ, बहुभाषी संग्रह को प्रस्तुत करता है, जिसे स्वचालित पाठ सरलीकरण अनुसंधान का समर्थन करने और लोकतांत्रिक सहभागी प्रक्रियाओं तक पहुंच बढ़ाने के लिए डिज़ाइन किया गया है।

Stefan Bott, Verena Riegler, Horacio Saggion, Almudena Rascón Alcaina, Nouran Khallaf2026-03-06
💬 NLP

Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR

यह शोध पत्र मल्टी-डोमेन ASR के लिए फुल फाइन-ट्यूनिंग के एक स्केलेबल विकल्प के रूप में मॉडल मर्जिंग की जांच करता है, जिसमें 10 यूरोपीय पुर्तगाली डोमेन में 11 एल्गोरिदम का बेंचमार्किंग किया गया है और एक नवीन "BoostedTSV-M" विधि पेश की गई है जो आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन को बनाए रखते हुए फुल फाइन-ट्यूनिंग से बेहतर प्रदर्शन करती है।

Carlos Carvalho, Francisco Teixeira, Thomas Rolland, Alberto Abad2026-03-06
💬 NLP

DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning

यह शोधपत्र DiSCTT का प्रस्ताव करता है, जो एक कठिनाई-जागरूक (difficulty-aware), सर्वसम्मति-निर्देशित (consensus-guided) स्व-पाठ्यक्रम ढांचा है, जो तर्क संबंधी प्रक्षेप पथों (reasoning trajectories) के बीच इंस्टेंस-स्तरीय सहमति के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग या सुदृढीकरण शिक्षण (reinforcement learning) रणनीतियों को गतिशील रूप से आवंटित करता है, जिससे विषम तर्क कार्यों (heterogeneous reasoning tasks) पर बड़े भाषा मॉडलों के लिए अधिक स्थिर, कुशल और सटीक टेस्ट-टाइम अनुकूलन प्राप्त होता है।

Mohammad Mahdi Moradi, Sudhir Mudur2026-03-06