🤖 machine learning

A Unifying Lens on Reward Uncertainty in RLHF

यह शोध पत्र RLHF में रिवॉर्ड हैकिंग को संबोधित करने के लिए एक डिस्ट्रीब्यूशनल रिवॉर्ड मॉडल का उपयोग करने का प्रस्ताव देता है, जो यह प्रदर्शित करता है कि एक KL-रेगुलराइज्ड ऑब्जेक्टिव एक क्लोज्ड-फॉर्म प्रभावी रिवॉर्ड प्रदान करता है जो विभिन्न निराशावादी ह्यूरिस्टिक्स (जैसे माध्य, वर्स्ट-केस, और अनसर्टेन्टी-वेटेड एग्रीगेशन) को एक एकल सैद्धांतिक ढांचे के तहत एकीकृत करता है।

Ely Hahami, Yoel Zimmermann, Ray Zhou, Jack Benarroch Jedlicki2026-06-09
💬 NLP

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1 एक एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) के लिए स्टेप-लेवल डेटा मिडलवेयर सिस्टम है जो एजेंट-पर्यावरण इंटरैक्शन के पूर्ण जीवनचक्र का प्रबंधन करता है, जो इंटरैक्शन ट्रेसेस को कैप्चर, व्यवस्थित और क्यूरेट करके उन्हें प्रशिक्षण के लिए तैयार डेटा एसेट्स में बदल देता है।

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu2026-06-09
💬 NLP

SEF-CLGC at SemEval-2026 Task 11: Logical Notation Impact on Language Model Performance

यह शोध पत्र SEF-CLGC पाइपलाइन प्रस्तुत करता है, जो SemEval-2026 टास्क 11 पर 27.80% कंटेंट स्कोर प्राप्त करने के लिए स्मॉल लैंग्वेज मॉडल्स के साथ औपचारिक तार्किक नोटेशन को एकीकृत करता है और साथ ही तर्क में कंटेंट बायस (सामग्री पूर्वाग्रह) को महत्वपूर्ण रूप से कम करता है।

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin2026-06-09
💬 NLP

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

यह शोध पत्र "इंजेक्शन पैराडॉक्स" (Injection Paradox) की पहचान करता है, जो सुरक्षा-प्रशिक्षित (safety-trained) LLMs में एक विफलता मोड है जहाँ RAG संदर्भों में प्रॉम्प्ट इंजेक्शन अप्रत्याशित रूप से लक्षित ब्रांड की सिफारिशों को दबा देते हैं, जिससे एक संभावित रिवर्स-अटैक वेक्टर उत्पन्न होता है जो GPT मॉडलों में देखे गए व्यवहार के विपरीत है।

Hyunseok Paeng2026-06-09
💬 NLP

TruthSplit: Operationalizing Conditional Validity in Arguments Through Multi-Perspective Reasoning

यह शोधपत्र TruthSplit प्रस्तुत करता है, जो एक इंटरैक्टिव सिस्टम है जो मल्टी-लेयर NLI दृष्टिकोण और संरचित मूल्य प्रोफाइल्स (structured value profiles) पर आधारित LLM रीजनिंग के माध्यम से यह विश्लेषण करता है कि तर्क विविध विश्वदृष्टिकोणों में अलग-अलग निष्कर्ष कैसे देते हैं, जिससे "सशर्त वैधता" (conditional validity) को क्रियान्वित किया जा सके।

Benjamin Stieger, Maximilian Terberger, Thomas Huber, Christina Niklaus2026-06-09
💬 NLP

One Model, Multiple Goals: Adaptive Multi-Objective Learning for E-commerce Dialogue Systems

यह शोध पत्र MORE को प्रस्तुत करता है, जो एक अनुकूलन योग्य बहु-उद्देश्यीय सुदृढीकरण शिक्षण (multi-objective reinforcement learning) ढांचा है जो प्रशिक्षण को स्थिर करने के लिए तर्क सटीकता (reasoning accuracy) को एक बाधा के रूप में मानता है और भाषाई स्वाभाविकता को गतिशील रूप से संतुलित करता है, जिससे ByteDance के वास्तविक ई-कॉमर्स संवाद प्रणालियों और MultiWOZ बेंचमार्क पर रूपांतरण दरों और उपयोगकर्ता संतुष्टि में महत्वपूर्ण सुधार प्राप्त होता है।

Mingzhe Li, Jing Xiang, Enguo Zhou, Lang Gao, Tai Li, Qishen Zhang, Xiangliang Zhang, Xiuying Chen2026-06-09
💬 NLP

NüshuVoice: Reviving the Voice of Endangered Nüshu with Pitch-Aware Text-to-Speech

यह शोध पत्र NüshuVoice प्रस्तुत करता है, जो Nüshu टेक्स्ट-टू-स्पीच के लिए पहला बेंचमार्क और डेटासेट है, साथ ही Nüshu-PitchVITS मॉडल भी पेश करता है जो अत्यधिक कम-संसाधन वाली स्थिति में उच्च-गुणवत्ता वाले स्पीच सिंथेसिस को प्राप्त करने के लिए लिपि की पांच-स्तरीय पिच नोटेशन का लाभ उठाता है।

Hongkun Yang, Xinhui Yi, Xiyan Zhao, Yibo Meng, Lionel Z. Wang, Lixu Wang, Yaqi Zhang, Ruiqi Chen, Xuanyue Zhao, Lanxin (…)2026-06-09
💬 NLP

SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling

यह शोध पत्र साइन-गेटेड ऑन-पॉलिसी डिस्टिलेशन (SG-OPD) को प्रस्तुत करता है, जो एक विधि है जो फेज़्ड सैंपलिंग और साइन-कंसिस्टेंसी चेक के माध्यम से टीचर सिग्नल्स को गेट करने के लिए एक बाइनरी वेरीफायर का उपयोग करके ऑन-पॉलिसी डिस्टिलेशन को बढ़ाता है, जिससे प्रतियोगिता-स्तर के गणितीय तर्क बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Haoran Xu, Hongyu Wang, Yifei Gao, Jiaze Li, Xiaofeng Zhang, Xiaosong Yuan2026-06-09
💬 NLP

How Far Can Prompting Go for Minimal-Edit Ukrainian Grammatical Error Correction?

यह शोध पत्र प्रदर्शित करता है कि यूक्रेनी-विशिष्ट न्यूनतम-संपादन निर्देशों और फ्यू-शॉट उदाहरणों के साथ वाणिज्यिक और ओपन-सोर्स एलएलएम (LLMs) को रणनीतिक रूप से प्रॉम्प्ट करने से यूक्रेनी व्याकरणिक त्रुटि सुधार में अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है, जो फाइन-ट्यून्ड मॉडलों के अंतर को 90% से अधिक कम कर देता है और विशिष्ट भाषाई ओवरकरेक्शन पैटर्न को प्रकट करता है।

Kateryna Karpo, Artem Chernodub2026-06-09
💬 NLP

Multi-Hop Knowledge Composition is Bound by Pretraining Exposure

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल (Large Language Models) की 'इम्प्लिसिट मल्टी-हॉप रीजनिंग' (implicit multi-hop reasoning) में विफलता याद किए गए तथ्यों की कमी के कारण नहीं, बल्कि प्रीट्रेनिंग की कमी के कारण है, क्योंकि कंपोजिशनल रीजनिंग (compositional reasoning) क्षमताएं केवल उन व्यक्तियों (मॉडल्स) में स्थानांतरित होती हैं जो प्रीट्रेनिंग के दौरान स्पष्ट रूप से मल्टी-हॉप संदर्भों के संपर्क में आए होते हैं।

Yannis Karmim, Luis Marti, Djamé Seddah, Valentin Barrière2026-06-09