💬 NLP

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

यह शोध पत्र यह प्रदर्शित करता है कि जर्मन भाषा मॉडलिंग के लिए, फ़िल्टर किए गए डेटा के एक छोटे, उच्च-गुणवत्ता वाले उपसमुच्चय पर बार-बार प्रशिक्षण लेना, बड़े और विविध कॉर्पोरा पर सिंगल-पास प्रशिक्षण की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे काफी कम टोकन के साथ अत्याधुनिक प्रदर्शन सक्षम होता है।

Ansar Aynetdinov, Patrick Haller, Alan Akbik2026-05-01
💬 NLP

TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering

यह शोधपत्र TopBench प्रस्तुत करता है, जो सारणीबद्ध डेटा (tabular data) पर निहित भविष्यवाणात्मक तर्क (implicit predictive reasoning) पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल इरादे की पहचान (intent recognition) में संघर्ष करते हैं और अक्सर ऐतिहासिक पैटर्न से अप्रत्यक्ष उत्तरों का अनुमान लगाने के बजाय सरल लुकअप (lookups) पर ही निर्भर रहते हैं।

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye2026-05-01
💬 NLP

Mapping the Methodological Space of Classroom Interaction Research: Scale, Duration, and Modality in an Age of AI

यह शोध पत्र कक्षा संपर्क (क्लासरूम इंटरेक्शन) अनुसंधान के पद्धतिगत परिदृश्य को मानचित्रित करने के लिए पैमाना (स्केल), अवधि और मोडैलिटी का एक त्रि-आयामी ढांचा प्रस्तावित करता है, जो विरोधाभासी अध्ययनों के माध्यम से इसकी उपयोगिता को स्पष्ट करता है और भविष्य के अनुसंधान एवं एआई (AI) टूल डिजाइन के मार्गदर्शन हेतु इसके निहितार्थों पर चर्चा करता है।

Dorottya Demszky, Edith Bouton, Alison Twiner, Sara Hennessy, Richard Correnti2026-05-01
💬 NLP

On the Proper Treatment of Units in Surprisal Theory

यह शोध पत्र सरप्राइज़ल थ्योरी (surprisal theory) में भाषाई इकाइयों की परिभाषा को मूल्यांकन क्षेत्रों से अलग करने के लिए एक एकीकृत रूपरेखा प्रस्तावित करता है, और यह तर्क देता है कि मानव प्रसंस्करण प्रयास (human processing effort) के स्पष्ट और कठोर मॉडलिंग को सुनिश्चित करने के लिए टोकनाइज़ेशन को एक वैज्ञानिक मूल तत्व (scientific primitive) के बजाय एक कार्यान्वयन विवरण (implementation detail) के रूप में माना जाना चाहिए।

Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell2026-05-01
💬 NLP

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

यह शोध पत्र "सिंथेटिक कंप्यूटर्स एट स्केल" (Synthetic Computers at Scale) प्रस्तुत करता है, जो लंबी अवधि के उत्पादकता सिमुलेशन चलाने के लिए यथार्थवादी, सामग्री-समृद्ध वर्चुअल कंप्यूटर वातावरण उत्पन्न करने की एक कार्यप्रणाली है, जो समृद्ध अनुभवात्मक शिक्षण संकेतों के माध्यम से एजेंट के प्रदर्शन में महत्वपूर्ण सुधार करती है, और विविध व्यावसायिक संदर्भों में भविष्य के एजेंटिक सुदृढीकरण लर्निंग (agentic reinforcement learning) के लिए एक स्केलेबल आधार प्रदान करती है।

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao2026-05-01
💬 NLP

Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI

यह अध्ययन इस धारणा को चुनौती देता है कि मनुष्य एआई-जनित पाठ के बीच अंतर नहीं कर सकते, जो 16 बहुभाषी डेटासेट में 87.6% औसत पहचान सटीकता प्रदर्शित करके, वास्तविकता, सांस्कृतिक सूक्ष्मता और विविधता में प्रमुख अंतरों की पहचान करता है, और यह भी प्रकट करता है कि जब स्रोत संदिग्ध हो तो मनुष्य हमेशा मानव-लिखित पाठ को प्राथमिकता नहीं देते हैं।

Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Aba (…)2026-04-30
💬 NLP

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

यह शोध पत्र TinyR1-32B-Preview को प्रस्तुत करता है, जो एक नवीन 'ब्रांच-मर्ज डिस्टिलेशन' (Branch-Merge distillation) दृष्टिकोण के माध्यम से विकसित एक 32B-पैरामीटर वाला मॉडल है, जो विशिष्ट छात्र मॉडलों को चुनिंदा रूप से प्रशिक्षित करने और उन्हें मर्ज करने के माध्यम से गणित, कोडिंग और विज्ञान में मौजूदा डिस्टिल्ड समकक्षों से काफी बेहतर प्रदर्शन करता है और बड़े DeepSeek-R1 शिक्षक मॉडल के प्रदर्शन के बराबर पहुँच जाता है।

Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan T (…)2026-04-30
💬 NLP

Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में तथ्यात्मक ज्ञान की पुनरावृत्ति (रिकॉल) पर क्वांटाइजेशन के प्रभाव की जांच करता है, जिससे यह पता चलता है कि हालांकि क्वांटाइजेशन आम तौर पर सूचना की हानि और प्रदर्शन में गिरावट का कारण बनता है—विशेष रूप से छोटे मॉडलों में—यह हमेशा रिकॉल को बाधित नहीं करता है और कभी-कभी इसे बढ़ा भी सकता है, जिसमें BitSandBytes मूल क्षमताओं का उच्चतम संरक्षण प्रदर्शित करता है।

Qianli Wang, Mingyang Wang, Nils Feldhus, Simon Ostermann, Yuan Cao, Hinrich Schütze, Sebastian Möller, Vera Schmitt2026-04-30
💬 NLP

Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicine

यह स्थिति पत्र (position paper) तर्क देता है कि वास्तविक दुनिया के दावों को वैज्ञानिक साक्ष्यों से जोड़ने की मौलिक चुनौतियों के कारण एंड-टू-एंड तथ्य-जांच प्रणालियाँ चिकित्सा के लिए अनुपयुक्त हैं, और इसके बजाय यह प्रस्तावित करता है कि तथ्य-जांच को एक संवादात्मक संचार प्रक्रिया के रूप में पुनर्कल्पित किया जाना चाहिए।

Sebastian Joseph, Lily Chen, Barry Wei, Michael Mackert, Iain J. Marshall, Paul Pu Liang, Ramez Kouzy, Byron C. Wallace (…)2026-04-30
💬 NLP

LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation

LogitSpec एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले रिट्रीवल-आधारित स्पेक्युलेटिव डिकोडिंग विधि है जो पिछले टोकन के लॉजिट्स (logits) का उपयोग करके "नेक्स्ट-नेक्स्ट" टोकन का अनुमान लगाकर LLM इन्फरेंस को तेज़ करती है, जिससे रिट्रीवल रेंज का विस्तार होता है और 2.61× तक की गति वृद्धि और उच्च टोकन स्वीकृति दर प्राप्त होती है।

Tianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun2026-04-30