💬 NLP

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

यह शोध पत्र ReaLM-Retrieve को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रीजनिंग-स्टेप स्तर पर ज्ञान के अंतराल (knowledge gaps) का पता लगाकर बड़े रीजनिंग मॉडल्स के लिए रिट्रीवल टाइमिंग को अनुकूलित करता है, जो मानक और निश्चित-अंतराल वाले दृष्टिकोणों की तुलना में अनावश्यक रिट्रीवल कॉल्स को कम करते हुए उत्तर की सटीकता और रिट्रीवल दक्षता में उल्लेखनीय सुधार करता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-04-30
💬 NLP

Differentially-Private Text Rewriting reshapes Linguistic Style

यह शोध पत्र प्रदर्शित करता है कि विभेदक-गोपनीयता युक्त पाठ पुनर्लेखन (differentially-private text rewriting), अर्थपूर्ण सामग्री और व्याकरणिक सुसंगतता को बनाए रखते हुए भी, संवादात्मक संकेतकों और जटिल संरचनाओं को हटाकर भाषाई शैली को व्यवस्थित रूप से खराब कर देता है, जिससे विविध पाठ एक समरूप, गैर-संवादात्मक रजिस्टर में परिवर्तित हो जाते हैं।

Stefan Arnold2026-04-30
💬 NLP

Domain-Adapted Small Language Models for Reliable Clinical Triage

यह अध्ययन प्रदर्शित करता है कि एक डोमेन-अनुकूलित, फाइन-ट्यून्ड ओपन-सोर्स स्मॉल लैंग्वेज मॉडल (Qwen2.5-7B), क्लिनिकल ट्राइएज नैरेटिव्स से इमरजेंसी सेवेरिटी इंडेक्स स्कोर को सटीक रूप से असाइन करने में बेसलाइन मॉडल्स और उन्नत प्रोप्रायटरी लार्ज लैंग्वेज मॉडल्स दोनों से काफी बेहतर प्रदर्शन करता है, जो आपातकालीन विभागों के लिए एक विश्वसनीय और गोपनीयता-संरक्षण निर्णय-सहायता उपकरण प्रदान करता है।

Manar Aljohani, Brandon Ho, Kenneth McKinley, Dennis Ren, Xuan Wang2026-04-30
🤖 machine learning

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

यह शोध पत्र NeMo-RL के भीतर एक सिस्टम-एकीकृत स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क पेश करता है जो RL पोस्ट-ट्रेनिंग रोलआउट्स के लिए एक लॉसलेस एक्सेलेरेशन प्रिमिटिव के रूप में कार्य करता है, जो 8B स्केल पर 1.8x थ्रूपुट सुधार प्राप्त करता है और एसिंक्रोनस निष्पादन के साथ जुड़ने पर 235B स्केल पर 2.5x तक एंड-टू-एंड ट्रेनिंग स्पीडअप का अनुमान लगाता है।

Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Pu (…)2026-04-30
🤖 machine learning

Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data

यह शोध पत्र प्रदर्शित करता है कि यूनिफॉर्म-आधारित डिस्क्रीट डिफ्यूजन मॉडल (Uniform-based Discrete Diffusion Models) अनदेखे डेटा को पुनर्प्राप्त करने में सक्षम एसोसिएटिव मेमोरीज (associative memories) के रूप में कार्य करते हैं, जहाँ याद रखने (memorization) से सामान्यीकरण (generalization) की ओर संक्रमण प्रशिक्षण सेट के आकार द्वारा नियंत्रित होता है और इसे अनुमानित टोकन अनुक्रमों की कंडीशनल एंट्रॉपी (conditional entropy) के माध्यम से व्यावहारिक रूप से पहचाना जा सकता है।

Bao Pham, Mohammed J. Zaki, Luca Ambrogioni, Dmitry Krotov, Matteo Negri2026-04-30
💬 NLP

What Kind of Language is Easy to Language-Model Under Curriculum Learning?

यह अध्ययन इस बात की जांच करता है कि कैसे करिकुलम लर्निंग (पाठ्यचर्या शिक्षण), जो सरल-से-जटिल वाक्यों के क्रम से जुड़ा एक विकासात्मक रूप से प्रेरित प्रशिक्षण परिदृश्य है, भाषा मॉडलों के इंडक्टिव बायस (आगमनात्मक पूर्वाग्रहों) और भाषाई रूपात्मक पैटर्न को पुनरुत्पादित करने की उनकी क्षमता को महत्वपूर्ण रूप से परिवर्तित करती है।

Nadine El-Naggar, Tatsuki Kuribayashi, Ted Briscoe2026-04-30
💬 NLP

MoRFI: Monotonic Sparse Autoencoder Feature Identification

यह शोध पत्र MoRFI को प्रस्तुत करता है, जो नए ज्ञान पर फाइन-ट्यूनिंग के दौरान मतिभ्रम (hallucinations) के साथ निरंतर सह-संबंध रखने वाले लेटेंट दिशाओं (latent directions) की पहचान करने के लिए स्पार्स ऑटोएनकोडर्स (sparse autoencoders) का उपयोग करने वाली एक विधि है, जो यह प्रदर्शित करता है कि इन विशिष्ट विशेषताओं में हस्तक्षेप करके मॉडल की संग्रहीत ज्ञान को पुनः प्राप्त करने की क्षमता को बहाल किया जा सकता है।

Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas2026-04-30
💬 NLP

HealthNLP_Retrievers at ArchEHR-QA 2026: Cascaded LLM Pipeline for Grounded Clinical Question Answering

HealthNLP_Retrievers टीम ने Gemini 2.5 Pro द्वारा संचालित एक कैस्केड पाइपलाइन का उपयोग करके ArchEHR-QA 2026 साझा कार्य में प्रतिस्पर्धी परिणाम प्राप्त किए, जो इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से प्राप्त रोगी के प्रश्नों के सटीक, साक्ष्य-आधारित उत्तर देने के लिए क्वेरी पुनर्गठन, साक्ष्य स्कोरिंग, ग्राउंडेड प्रतिक्रिया निर्माण और संरेखण को एकीकृत करता है।

Md Biplob Hosen, Md Alomgeer Hussein, Md Akmol Masud, Omar Faruque, Tera L Reynolds, Lujie Karen Chen2026-04-30
💬 NLP

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

यह शोधपत्र ClassEval-Pro को प्रस्तुत करता है, जो एक LLM एन्सेम्बल और उच्च-कवरेज टेस्ट सूट्स द्वारा सत्यापित 300 क्लास-लेवल कोड जनरेशन कार्यों का एक कठोर, क्रॉस-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर LLMs लॉजिक और डिपेंडेंसी त्रुटियों के कारण कंपोजिशनल कोड क्रिएशन में संघर्ष करते हैं, और केवल 45.6% का सर्वश्रेष्ठ Pass@1 प्राप्त करते हैं।

Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu2026-04-30
💬 NLP

Select to Think: Unlocking SLM Potential with Local Sufficiency

यह शोध पत्र "सेलेक्ट टू थिंक" (S2T) का प्रस्ताव करता है, जो एक ऐसे ढांचे का उपयोग करता है जो इस अवलोकन का लाभ उठाता है कि लार्ज लैंग्वेज मॉडल्स के पसंदीदा टोकन अक्सर स्मॉल लैंग्वेज मॉडल्स के टॉप-K प्रेडिक्शन्स के भीतर स्थित होते हैं, ताकि चयन तर्क (selection logic) को डिस्टिल किया जा सके, जिससे स्मॉल मॉडल्स को उम्मीदवारों को स्वायत्त रूप से पुन: रैंक करने में सक्षम बनाया जा सके और महंगी बाहरी LLM कॉल्स पर निर्भर हुए बिना रीजनिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

Wenxuan Ye, Yangyang Zhang, Xueli An, Georg Carle, Yunpu Ma2026-04-30