💬 NLP

Parallel Test-Time Scaling for Latent Reasoning Models

यह शोधपत्र अनिश्चितता-प्रेरित स्टोकेस्टिक सैंपलिंग रणनीतियों (मोंटे कार्लो ड्रॉपआउट और एडिटिव गॉसियन नॉइज़) और निरंतर वेक्टर स्पेस में प्रभावी ट्राजेक्टरी एग्रीगेशन को सुगम बनाने के लिए एक स्टेप-वाइज कॉन्ट्रास्टिव लेटेंट रिवॉर्ड मॉडल को पेश करके लेटेंट रीजनिंग मॉडल्स के लिए पैरेलल टेस्ट-टाइम स्केलिंग को सक्षम बनाता है।

Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li2026-04-21
💬 NLP

Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers

यह शोध पत्र इस धारणा को चुनौती देता है कि केवल उत्तर विकल्पों का उपयोग करके बहुविकल्पीय प्रश्नों पर बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की सफलता हमेशा एक सतही शॉर्टकट होती है, यह प्रदर्शित करते हुए कि टेस्ट-टाइम रीजनिंग अक्सर मामूली डेटा पूर्वाग्रहों पर निर्भर रहने के बजाय लुप्त प्रश्नों का अनुमान लगाने जैसी अधिक सुदृढ़ रणनीतियों के माध्यम से प्रदर्शन में सुधार करती है।

Nishant Balepur, Atrey Desai, Rachel Rudinger2026-04-21
💬 NLP

Logit Arithmetic Elicits Long Reasoning Capabilities Without Training

यह शोध पत्र ThinkLogit को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) डिकोडिंग-टाइम विधि है जो एक छोटे "गाइडर" (guider) मॉडल से एक बड़े गैर-तर्कसंगत लक्ष्य (non-reasoning target) में लंबी-श्रृंखला तर्क क्षमताओं (long-chain reasoning capabilities) को स्थानांतरित करने के लिए लॉजिट अंकगणित (logit arithmetic) का लाभ उठाता है, जिससे बिना किसी ग्रेडिएंट अपडेट की आवश्यकता के या पर्याप्त इन्फरेंस ओवरहेड के बिना गणित, विज्ञान और कोडिंग बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Yunxiang Zhang, Muhammad Khalifa, Lechen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu W (…)2026-04-21
💬 NLP

AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph Construction

AutoGraph-R1 एक नवीन फ्रेमवर्क है जो डाउनस्ट्रीम रिट्रीवल-ऑगमेंटेड जनरेशन प्रदर्शन के लिए नॉलेज ग्राफ निर्माण को सीधे अनुकूलित करने हेतु एंड-टू-एंड सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करता है, जिससे ग्राफ निर्माण और कार्य उपयोगिता के बीच के अंतर को पाटकर प्रश्न उत्तर प्रणालियों में महत्वपूर्ण लाभ प्राप्त किया जा सके।

Hong Ting Tsang, Jiaxin Bai, Haoyu Huang, Qiao Xiao, Tianshi Zheng, Baixuan Xu, Shujie Liu, Yangqiu Song2026-04-21
💬 NLP

Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning

यह शोध पत्र Privacy-R1 को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो गोपनीयता सुरक्षा और कार्य प्रदर्शन के बीच इष्टतम संतुलन बनाने के लिए प्रतिस्थापनीय (replaceable) और कार्य-महत्वपूर्ण (task-critical) संवेदनशील जानकारी के बीच अंतर करके टेक्स्ट चंक्स (text chunks) को स्थानीय और रिमोट LLMs के बीच गतिशील रूप से रूट करता है, जिससे एक नए उच्च-घनत्व वाले चिकित्सा डेटासेट पर अत्याधुनिक (state-of-the-art) परिणाम प्राप्त होते हैं।

Zheng Hui, Yijiang River Dong, Sanhanat Sivapiromrat, Ehsan Shareghi, Nigel Collier2026-04-21
💬 NLP

ToMMeR -- Efficient Entity Mention Detection from Large Language Models

ToMMeR एक हल्का मॉडल है जो यह प्रदर्शित करता है कि मेंशन डिटेक्शन स्वाभाविक रूप से लैंग्वेज मॉडलिंग से उभरता है और न्यूनतम मापदंडों के साथ शुरुआती ट्रांसफार्मर परतों से संरचित एंटिटी रिप्रजेंटेशन को कुशलतापूर्वक पुन: प्राप्त करके प्रतिस्पर्धी नेमड एंटिटी रिकग्निशन प्रदर्शन प्राप्त करता है।

Victor Morand, Nadi Tomeh, Josiane Mothe, Benjamin Piwowarski2026-04-21
⚡ electrical engineering

emg2speech: Synthesizing speech from electromyography using self-supervised speech models

यह शोध पत्र एक न्यूरोमस्कुलर स्पीच इंटरफेस प्रस्तुत करता है जो मौन उच्चारण से सीधे श्रव्य भाषण को संश्लेषित करने के लिए स्व-पर्यवेक्षित भाषण निरूपणों और इलेक्ट्रोमयोग्राफिक (EMG) संकेतों के बीच मजबूत रैखिक संबंध का लाभ उठाता है, जिसे एमियोट्रोफिक लेटरल स्क्लेरोसिस (ALS) से पीड़ित एक प्रतिभागी पर सफलतापूर्वक प्रदर्शित किया गया है।

Harshavardhana T. Gowda, Daniel C. Comstock, Lee M. Miller2026-04-21
💬 NLP

HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models

यह शोध पत्र HPLT 3.0 का परिचय देता है, जो लगभग 200 भाषाओं के लिए 30-ट्रिलियन-टोकन वाले बहुभाषी डेटासेट के साथ एक ओपन पहल है, जिसके साथ एक ओपन-सोर्स प्रोसेसिंग पाइपलाइन, नौ यूरोपीय भाषाओं के लिए व्यापक मूल्यांकन बेंचमार्क, और प्री-ट्रेंड मोनोलिंगुअल एवं पैरेलल मॉडल्स का एक समूह भी उपलब्ध है।

Stephan Oepen, Nikolay Arefev, Mikko Aulamo, Marta Bañón, Maja Buljan, Laurie Burchell, Lucas Charpentier, Pinzhen Chen (…)2026-04-21
💬 NLP

LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging

यह शोध पत्र LoRA on the Go (LoGo) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो एकल फॉरवर्ड पास (single forward pass) से प्राप्त संकेतों का उपयोग करके इन्फरेंस के दौरान इंस्टेंस स्तर पर LoRA एडेप्टर को गतिशील रूप से चुनता है और मर्ज करता है, जिससे बिना किसी अतिरिक्त लेबल किए गए डेटा या प्रशिक्षण के विविध NLP कार्यों में प्रतिस्पर्धी या बेहतर प्रदर्शन प्राप्त होता है।

Seungeon Lee, Soumi Das, Manish Gupta, Krishna P. Gummadi2026-04-21
💬 NLP

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining

यह शोध पत्र यह प्रदर्शित करके LLM प्रीट्रेनिंग में मेटाडेटा के दायरे को URL से आगे बढ़ाता है कि सूक्ष्म-स्तरीय गुणवत्ता संकेतक, रणनीतिक स्थिति (अपेंडिंग), और सीखने योग्य मेटा-टोकन प्रशिक्षण दक्षता को महत्वपूर्ण रूप से तेज कर सकते हैं और मॉडल की प्रभावशीलता को बढ़ा सकते हैं।

Dongyang Fan, Diba Hashemi, Sai Praneeth Karimireddy, Martin Jaggi2026-04-21