💬 NLP

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

यह शोध पत्र MENTOR का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग की सामान्यीकरण सीमाओं और सख्त प्रक्षेपवक्र मिलान (trajectory matching) की बाधाओं को दूर करने के लिए एक लचीले, प्रक्रिया-जागरूक पुरस्कार संरचना का उपयोग करके बड़े भाषा मॉडलों से टूल-उपयोग क्षमताओं को छोटे भाषा मॉडलों में संकुचित (distill) करता है।

ChangSu Choi, Hoyun Song, Dongyeon Kim, WooHyeon Jung, Minkyung Cho, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim2026-06-19
💬 NLP

Toward Human-Centered AI-Assisted Terminology Work

यह शोध पत्र शब्दावली कार्य में एक मानव-केंद्रित एआई ढांचे की वकालत करता है जो सटीकता सुनिश्चित करने, मतिभ्रम (hallucinations) और पूर्वाग्रह जैसे जोखिमों को कम करने और विशिष्ट संचार की अखंडता को बनाए रखने के लिए पारिभाषिक विशेषज्ञों की आवश्यक एजेंसी और निरीक्षण को बनाए रखते हुए उनकी क्षमताओं को बढ़ाने के लिए जनरेटिव एआई का लाभ उठाता है।

Antonio San Martin2026-06-19
💬 NLP

OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report

यह शोध पत्र OpenLID-v3 प्रस्तुत करता है, जो एक उन्नत भाषा पहचान प्रणाली है जो विस्तारित प्रशिक्षण डेटा, विलय किए गए भाषा समूहों और एक समर्पित शोर लेबल के माध्यम से निकट संबंधी भाषाओं के लिए सटीकता और शोर का पता लगाने की क्षमता में सुधार करती है, साथ ही एनसेंबल दृष्टिकोणों में परिशुद्धता (precision) और कवरेज के बीच के समझौते को भी रेखांकित करती है।

Mariia Fedorova, Nikolay Arefyev, Maja Buljan, Jindřich Helcl, Stephan Oepen, Egil Rønningstad, Yves Scherrer2026-06-19
💬 NLP

Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU

यह शोध पत्र एक गोपनीयता-संरक्षित, एज-डिप्लॉयड (edge-deployed) संवादात्मक सहायक प्रस्तुत करता है जो प्रक्रियात्मक मैनुअल कार्यों के लिए वास्तविक समय में, सक्रिय मार्गदर्शन प्रदान करने हेतु केवल ऑडियो और IMU डेटा का उपयोग करता है, यह प्रदर्शित करते हुए कि एक लैंग्वेज मॉडल को फाइन-ट्यून करना अनावश्यक संवाद को सीमित करने में इसकी सटीकता (precision) और उपयोगकर्ता के प्रश्नों का उत्तर देने में इसकी रिकॉल (recall) को महत्वपूर्ण रूप से सुधारता है।

Rehana Mahfuz, Yinyi Guo, Erik Visser, Phanidhar Chinchili2026-06-19
💻 computer science

Redact or Keep? A Fully Local AI Cascade for Educational Dialogue De-Identification

यह शोध पत्र एक पूर्णतः स्थानीय एआई कैस्केड फ्रेमवर्क प्रस्तावित करता है जो शैक्षिक संवाद को वि-पहचानित (de-identify) करने के लिए कार्य को दो-चरणीय गोपनीयता ट्राइएज प्रक्रिया के रूप में पुनर्गठित करके, समान-परिवार के एलएलएम-केवल बेसलाइन और वाणिज्यिक एपीआई दोनों से बेहतर प्रदर्शन करता है, जिससे डेटा गवर्नेंस से समझौता किए बिना व्यक्तिगत नामों और पाठ्यचर्या संबंधी शब्दों के बीच अंतर करने में उच्च सटीकता प्राप्त होती है।

Haocheng Zhang, Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, René F. Kizilcec2026-06-19
💻 computer science

SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG

SproutRAG एक एंड-टू-एंड प्रशिक्षित, अटेंशन-गाइडेड पदानुक्रमित (hierarchical) RAG फ्रेमवर्क है जो बीम सर्च के माध्यम से मल्टी-ग्रैनुलैरिटी रिट्रीवल सक्षम करने के लिए वाक्य-स्तरीय एम्बेडिंग्स से एक बाइनरी चंकिंग ट्री का निर्माण करता है, जिससे महंगी LLM कॉल्स या लॉसवी समराइजेशन पर निर्भर रहे बिना लॉन्ग-डॉक्यूमेंट कार्यों में सूचना दक्षता में सुधार होता है।

Amirhossein Abaskohi, Issam H. Laradji, Peter West, Giuseppe Carenini2026-06-19
💻 computer science

From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability

यह शोधपत्र एक पोस्ट-हॉक सामान्यीकरण ढांचे (post-hoc generalization framework) को प्रस्तुत करता है जो बेस मॉडल के अपेक्षित जोखिम (expected risk) पर एक ऊपरी सीमा (upper bound) व्युत्पन्न करके भाषा मॉडलों के लिए स्पार्स ऑटोएन्कोडर (Sparse Autoencoder)-आधारित स्पष्टीकरणों की निष्ठा (faithfulness) को प्रमाणित करता है, जो यह प्रदर्शित करता है कि यह सीमा विभिन्न मॉडलों में गैर-रिक्त (non-vacuous) हो जाती है और यह प्रकट करती है कि मजबूत स्थानीय निष्ठा (local fidelity) और कम त्रुटि प्रवर्धन (error amplification) के कारण बाद की परतें अधिक विश्वसनीय रूप से प्रमाणित होती हैं।

Dibyanayan Bandyopadhyay, Asif Ekbal2026-06-19
💻 computer science

LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

यह शोध पत्र LLMZero को प्रस्तुत करता है, जो एक LLM एजेंट सिस्टम है जो निरंतर बढ़ते हुए क्षमता और दोलन करते हुए रेगुलराइजेशन मापदंडों द्वारा अभिलक्षित अनुकूल, बहु-चरणीय RL पोस्ट-ट्रेनिंग रणनीतियों की खोज के लिए ट्री सर्च का उपयोग करता है, जो विविध कार्यों में फिक्स्ड शेड्यूल्स, ग्रिड सर्च और रैंडम सर्च की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Haoyang Fang, Wei Zhu, Boran Han, Alex Zhang, Zhenyu Pan, Shuo Yang, Shuai Zhang, Jiading Gai, Peng Tang, Cuixiong Hu, X (…)2026-06-19
💻 computer science

JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

JetFlow एक नवीन स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो एक कॉज़ल पैरेलल ड्राफ्ट हेड को ब्रांच-वाइज सुसंगत टोकन ट्री जेनरेट करने के लिए प्रशिक्षित करके मौजूदा तरीकों की स्केलिंग सीमाओं को दूर करता है, जिससे स्वीकृति दरों से समझौता किए बिना विविध LLM वर्कलोड पर महत्वपूर्ण गति (9.64x तक) प्राप्त होती है।

Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana (…)2026-06-19
💻 computer science

VISUALSKILL: Multimodal Skills for Computer-Use Agents

यह शोध पत्र VISUALSKILL को पेश करता है, जो एक मल्टीमॉडल स्किल फ्रेमवर्क है जो विजुअल फिगर्स (visual figures) को टेक्स्ट में बदलने के बजाय उन्हें स्किल आर्टिफैक्ट्स (skill artifacts) में बनाए रखकर लॉन्ग-होराइजन कार्यों पर कंप्यूटर-उपयोग एजेंटों के प्रदर्शन को बढ़ाता है, जिसके परिणामस्वरूप बेसलाइन और टेक्स्ट-ओनली स्किल अप्रोच दोनों की तुलना में सटीकता में महत्वपूर्ण सुधार होता है।

Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang2026-06-19