💬 NLP

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

यह शोध पत्र PMark प्रस्तुत करता है, जो बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) के लिए एक सुदृढ़ और विरूपण-मुक्त अर्थ-स्तरीय वॉटरमार्किंग विधि है, जो वाक्य माध्यिका (सेंटेंस मीडियन) का गतिशील रूप से अनुमान लगाने के लिए प्रॉक्सी फंक्शन और मल्टी-चैनल बाधाओं के एक नवीन सैद्धांतिक ढांचे का उपयोग करता है, जिससे पाठ की गुणवत्ता बनाए रखते हुए पैराफ्रेसिंग हमलों के प्रति प्रतिरोध क्षमता में महत्वपूर्ण सुधार होता है।

Jiahao Huo, Shuliang Liu, Bin Wang, Junyan Zhang, Yibo Yan, Aiwei Liu, Xuming Hu, Mingxun Zhou2026-03-03
💬 NLP

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

यह शोध पत्र एक ही प्रशिक्षण रन के भीतर एक साथ कई नियंत्रित प्रीट्रेनिंग प्रयोगों को संचालित करने के लिए एक लागत प्रभावी विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण समग्र प्रदर्शन पर न्यूनतम प्रभाव के साथ डेटा संदूषण और मॉडल व्यवहार पर पूर्व अनुसंधान को दोहरा सकता है और उसका विस्तार कर सकता है।

Sebastian Bordt, Martin Pawelczyk2026-03-03
💬 NLP

Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models

यह शोध पत्र प्रतिस्पर्धी रिट्रीवल तंत्रों (retrieval mechanisms) पर उनकी निर्भरता को उजागर करके लार्ज रीजनिंग मॉडल्स में रीजनिंग ट्रेसेस और अंतिम उत्तरों के बीच की विसंगति की जांच करता है, और FARL प्रस्तावित करता है, जो एक नवीन फाइन-ट्यूनिंग फ्रेमवर्क है जो वास्तविक रीजनिंग क्षमताओं को लागू करने के लिए इन रिट्रीवल शॉर्टकट्स को दबाता है।

Yuhui Wang, Changjiang Li, Guangke Chen, Jiacheng Liang, Ting Wang2026-03-03
💬 NLP

Scaling with Collapse: Efficient and Predictable Training of LLM Families

यह शोध पत्र प्रदर्शित करता है कि इष्टतम स्केलिंग रेसिपी के तहत LLM परिवारों के लिए ट्रेनिंग लॉस कर्व्स एक सार्वभौमिक प्रक्षेपवक्र (यूनिवर्सल ट्रजेक्टरी) पर सिमट जाते हैं, जो इस घटना को कंप्यूट-कुशल प्रशिक्षण के एक हस्ताक्षर के रूप में स्थापित करता है जो विकृतियों की शीघ्र पहचान और हाइपरपैरामीटर ट्यूनिंग को सक्षम बनाता है, जिसका उपयोग लेखक प्रतिस्पर्धी *Celerity* मॉडल परिवार विकसित करने के लिए करते हैं।

Shane Bergsma, Bin Claire Zhang, Nolan Dey, Shaheer Muhammad, Gurpreet Gosal, Joel Hestness2026-03-03
💬 NLP

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

यह शोधपत्र EditReward को प्रस्तुत करता है, जो एक नए बड़े पैमाने के मानव प्राथमिकता डेटासेट पर प्रशिक्षित एक मानव-संरेखित (human-aligned) रिवॉर्ड मॉडल है, जो निर्देश-निर्देशित छवि संपादन (instruction-guided image editing) के मूल्यांकन में अत्याधुनिक प्रदर्शन प्राप्त करता है और ओपन-सोर्स संपादन मॉडलों के प्रशिक्षण को महत्वपूर्ण रूप से सुधारने के लिए उच्च-गुणवत्ता वाले डेटा को प्रभावी ढंग से फ़िल्टर करता है।

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen2026-03-03
💬 NLP

MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages

यह शोध पत्र MENLO को प्रस्तुत करता है, जो 47 भाषाओं में नेटिव-लाइक (native-like) LLM प्रतिक्रिया गुणवत्ता का मूल्यांकन करने के लिए एक फ्रेमवर्क और डेटासेट है, जो यह दर्शाता है कि जबकि ज़ीरो-शॉट जज मानव एनोटेटरों की तुलना में पीछे रह जाते हैं, सुदृढीकरण लर्निंग (reinforcement learning) और रिवॉर्ड शेपिंग (reward shaping) मूल्यांकन सटीकता और बहुभाषी मॉडल दक्षता दोनों में महत्वपूर्ण सुधार कर सकते हैं।

Chenxi Whitehouse, Sebastian Ruder, Tony Lin, Oksana Kurylo, Haruka Takagi, Janice Lam, Nicolò Busetto, Denise Diaz, Fra (…)2026-03-03
💬 NLP

GEM: A Gym for Agentic LLMs

यह शोध पत्र GEM (General Experience Maker) को प्रस्तुत करता है, जो एक ओपन-सोर्स, मानकीकृत वातावरण सिम्युलेटर और मूल्यांकन टूलकिट है, जिसे उच्च-थ्रूपुट निष्पादन, विविध वातावरणों और REINFORCE, PPO और GRPO जैसे एल्गोरिदम की तुलना करने वाले व्यापक बेंचमार्क के माध्यम से अनुभव-आधारित शिक्षण को सुगम बनाकर एजेंटिक LLM अनुसंधान को गति देने के लिए डिज़ाइन किया गया है।

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan (…)2026-03-03
💬 NLP

ExGRPO: Learning to Reason from Experience

ExGRPO एक नवीन ढांचा है जो शुद्धता और एंट्रॉपी के आधार पर मूल्यवान रोलआउट अनुभवों की पहचान करके और उन्हें प्राथमिकता देकर सत्यापन योग्य पुरस्कारों से सुदृढीकरण शिक्षण (reinforcement learning) की दक्षता और स्थिरता को बढ़ाता है, जिससे मानक ऑन-पॉलिसी विधियों की तुलना में विभिन्न बड़े भाषा मॉडलों में तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng2026-03-03
💬 NLP

TiTok: Transfer Token-level Knowledge via Contrastive Excess to Transplant LoRA

TiTok एक नवीन ढांचा है जो सिंथेटिक डेटा को चुनिंदा रूप से फ़िल्टर करने के लिए कंट्रास्टिव एक्सीस (contrastive excess) के माध्यम से टोकन-स्तरीय ज्ञान को कैप्चर करके विभिन्न LLM बैकबोन में LoRA एडेप्टर के हस्तांतरण को सक्षम बनाता है, जिससे बिना किसी अतिरिक्त मॉडल या ओवरहेड के महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Chanjoo Jung, Jaehyung Kim2026-03-03
💬 NLP

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

SwiReasoning एक प्रशिक्षण-मुक्त ढांचा है जो एंट्रॉपी-संचालित आत्मविश्वास मेट्रिक्स के आधार पर स्पष्ट और गुप्त तर्क के बीच गतिशील रूप से स्विच करके बड़े भाषा मॉडलों की सटीकता और टोकन दक्षता को बढ़ाता है, जिससे अन्वेषण और अभिसरण के बीच संतुलन बनता है और अत्यधिक सोचने (overthinking) को रोका जाता है।

Dachuan Shi, Abedelkadir Asi, Keying Li, Xiangchi Yuan, Leyan Pan, Wenke Lee, Wen Xiao2026-03-03