💬 NLP

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

यह शोध पत्र RLHF और RLVR में रिवॉर्ड हैकिंग को कम करने के लिए KL पेनल्टी के एक बेहतर विकल्प के रूप में ग्रेडिएंट रेगुलराइजेशन (GR) का प्रस्ताव करता है, जो रिवॉर्ड सटीकता को इष्टतम सपाटता (optimum flatness) से सैद्धांतिक रूप से जोड़कर और अनुभवजन्य रूप से यह प्रदर्शित करके कि GR प्रभावी रूप से पॉलिसी अपडेट को अधिक सपाट, अधिक सटीक रिवॉर्ड क्षेत्रों की ओर पक्षपाती बनाता है।

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama2026-07-07
💬 NLP

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

यह शोध पत्र VERI-DPO को प्रस्तुत करता है, जो एक प्राथमिकता-माइनिंग (preference-mining) ढांचा है जो शोर युक्त दावे-स्तरीय सत्यापन (claim-level verification) को कवरेज-नियंत्रित सारांश-स्तरीय प्राथमिकताओं में परिवर्तित करता है ताकि साक्ष्य-आधारित नैदानिक सारांशीकरण मॉडलों को प्रशिक्षित किया जा सके जो सामग्री कवरेज से समझौता किए बिना या इन्फरेंस-टाइम पुनर्रैंकिंग की आवश्यकता के बिना असंयोजित दावों को महत्वपूर्ण रूप से कम करते हैं।

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin2026-07-07
💬 NLP

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

KARA एक स्लाइडिंग-विंडो KV कैश संपीड़न (compression) विधि है जो द्विदिश अटेंशन (bidirectional attention) और एक लचीले टोकन2चंक (Token2Chunk) मॉड्यूल का उपयोग करके डिकोडिंग के दौरान सूचनात्मक संदर्भ को चुनिंदा रूप से बनाए रखती है, जिससे मौजूदा दृष्टिकोणों की कठोर सीमाओं के बिना रीजनिंग लैंग्वेज मॉडल्स के लिए मेमोरी ओवरहेड को कम करती है और थ्रूपुट में सुधार करती है।

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev2026-07-07
💬 NLP

GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech

GRAFT एक ज़ीरो-शॉट टेक्स्ट-टू-स्पीच सिस्टम है जो दुर्लभ और कठिन शब्दों के उच्चारण की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए ग्राफ़्टेड रेफरेंस ऑडियो के साथ प्रति-शब्द कंडिशनिंग मैकेनिज्म का उपयोग करता है, जबकि प्राकृतिकता और वक्ता की समानता को बनाए रखता है।

Antonis Asonitis, Francesco Verdini, Aref Farhadipour, Vijeta Avijeet, Pierre-Edouard Honnet, Marzieh Razavi, Juan Pablo (…)2026-07-07
💬 NLP

Improving LLMs via Validator-to-Generator Alignment

यह शोध पत्र \FCPA को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण उद्देश्य (training objective) है जो उच्चारण आवृत्ति (utterance frequency) को ठीक करके जनरेटर और वैलिडेटर को संरेखित करता है, जिससे वैलिडेटर की गुणवत्ता को बनाए रखते हुए बड़े भाषा मॉडलों (large language models) में निरंतरता और पीढ़ी प्रदर्शन दोनों में महत्वपूर्ण सुधार होता है।

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett2026-07-07
💬 NLP

LuxSQA: Ask Me in Luxembourgish with TTS-Augmented Spoken Question Answering

यह शोध पत्र यह प्रदर्शित करता है कि कई टीटीएस (TTS) प्रणालियों का उपयोग करके अनुवादित टेक्स्ट क्यू-एंड-ए (QA) युग्मों से उत्पन्न सिंथेटिक स्पीच पर प्रशिक्षण देकर कम-संसाधन वाली भाषा लक्समबर्गिश के लिए पैरामीटर-कुशल स्पोकन क्वेश्चन आंसरिंग को प्रभावी ढंग से प्राप्त किया जा सकता है, जो यह प्रकट करता है कि कार्य-विशिष्ट प्रदर्शन मानक टीटीएस गुणवत्ता मेट्रिक्स के बजाय विविध वॉयस कॉन्फ़िगरेशन पर अधिक निर्भर करता है।

Nina Hosseini-Kivanani, Marco Matassoni, Alessio Brutti2026-07-07
💬 NLP

Gemma 4 Technical Report

जेम्मा 4 (Gemma 4) तकनीकी रिपोर्ट एक नई पीढ़ी के ओपन-वेट, नेटिवली मल्टीमॉडल मॉडल्स का परिचय देती है जिसमें विविध आर्किटेक्चर, कच्चे ऑडियो और इमेज प्रोसेसिंग के लिए एनकोडर-मुक्त डिज़ाइन और एक थिंकिंग मोड शामिल है, जो सामूहिक रूप से STEM और लॉन्ग-कॉन्टेक्स्ट बेंचमार्क में दक्षता, तर्क और प्रदर्शन में महत्वपूर्ण प्रगति प्रदान करते हैं।

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick (…)2026-07-07
💬 NLP

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

यह शोध पत्र लैग्रेंजियन रिवॉर्ड ऑग्मेंटेशन (LARA) का प्रस्ताव करता है, जो एक सामान्य इन्फरेंस-टाइम अलाइनमेंट फ्रेमवर्क है जो सुरक्षा बाधाओं को लागू करने के लिए एक ड्यूल वेरिएबल के माध्यम से संवर्धित रिवॉर्ड सिग्नल को गतिशील रूप से कैलिब्रेट करता है ताकि बिना रिट्रेनिंग के हेल्पफुलनेस-हारmlessness ट्रेडऑफ में सुधार किया जा सके और फाइनट्यूनिंग-आधारित विधियों के प्रदर्शन के करीब पहुँचा जा सके।

Yaswanth Chittepu, Ativ Joshi, Sohini Chintala, Scott Niekum2026-07-07
💬 NLP

Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

यह शोध पत्र BDLM Mamba-H को प्रस्तुत करता है, जो एक हाइब्रिड डिफ्यूजन लैंग्वेज मॉडल है जो सटीक कैशिंग (exact caching) को सक्षम करने के लिए सक्रिय डिनोइजिंग ब्लॉक्स (active denoising blocks) तक द्विदिश मम्बा स्कैनिंग (bidirectional Mamba scanning) को सीमित करता है, जिससे मौजूदा फुल-सीक्वेंस और अटेंशन-आधारित डिफ्यूजन बेसलाइनों की तुलना में बेहतर परप्लेक्सिटी (perplexity) और काफी अधिक लॉन्ग-कॉन्टेक्स्ट इन्फरेंस थ्रूपुट प्राप्त होता है।

Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen2026-07-07
💬 NLP

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

यह शोधपत्र एक मल्टीमॉडल फ्रेमवर्क प्रस्तावित करता है जो एक बॉटलनेक एनकोडर और गेटिंग मैकेनिज्म के माध्यम से कॉनफॉर्मर-आधारित स्पीच फीचर्स को रोबर्टा-प्रोसेस्ड एएसआर एम्बेडिंग्स के साथ फ्यूज करके कम-संसाधन वाली भारतीय भाषाओं के लिए ऑटोमैटिक स्पीच रिकग्निशन और डायलेक्ट आइडेंटिफिकेशन को संयुक्त रूप से अनुकूलित करता है, जिससे आठ भाषाओं और तैंतीस बोलियों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Saurabh Kumar, Amartyaveer, Prasanta Kumar Ghosh2026-07-07