💬 NLP

One prompt is not enough: Instruction Sensitivity Undermines Embedding Model Evaluation

यह शोध पत्र यह प्रदर्शित करता है कि इंस्ट्रक्शन-ट्यून्ड एम्बेडिंग मॉडल्स के लिए वर्तमान सिंगल-प्रॉम्ट मूल्यांकन पद्धति मौलिक रूप से त्रुटिपूर्ण है क्योंकि यह निर्देश वाक्यांशण (instruction phrasing) के प्रति अत्यधिक संवेदनशील है, जिससे भ्रामक प्रदर्शन स्कोर और अस्थिर लीडरबोर्ड रैंकिंग उत्पन्न होती है, अतः ऐसे बेंचमार्क की आवश्यकता है जो प्रॉम्ट सुदृढ़ता (prompt robustness) को समाहित करते हों।

Yevhen Kostiuk, Kenneth Enevoldsen2026-05-22
💬 NLP

SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

यह शोधपत्र SynAE को प्रस्तुत करता है, जो एक बहु-अक्षीय मूल्यांकन ढांचा (multi-axis evaluation framework) है जिसे कार्य निर्देशों, टूल कॉल्स, आउटपुट और डाउनस्ट्रीम प्रदर्शन का विश्लेषण करके टूल-कॉलिंग एजेंटों के लिए सिंथेटिक डेटासेट की वैधता, निष्ठा (fidelity) और विविधता का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि सिंथेटिक डेटा की गुणवत्ता को स्पष्ट करने के लिए कोई भी एकल मीट्रिक पर्याप्त नहीं है।

Shuaiqi Wang, Aadyaa Maddi, Zinan Lin, Giulia Fanti2026-05-22
💬 NLP

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

यह शोध पत्र LANG को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो प्रोग्रेसिव डिके (progressive decay) और एडेप्टिव स्विचिंग के साथ भाषा-सशर्त संकेतों (language-conditioned hints) का उपयोग करता है ताकि अंग्रेजी की ओर अनपेक्षित भाषाई विचलन (language drift) को रोकते हुए बहुभाषी तर्क प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai (…)2026-05-22
💬 NLP

Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion

यह शोध पत्र प्रकट करता है कि LLMs में "हाइपरफिटिंग" (Hyperfitting) की घटना केवल लो-एन्ट्रॉपी शार्पनिंग का परिणाम नहीं है, बल्कि यह अंतिम ट्रांसफार्मर ब्लॉक में एक गतिशील, संदर्भ-निर्भर ज्यामितीय विस्तार से उत्पन्न होती है जो डीप-टेल टोकन्स को बढ़ावा देती है, एक ऐसी प्रक्रिया जिसे केवल अंतिम पाँच परतों को अपडेट करने वाली एक लक्षित "लेट-स्टेज लोरा" (Late-Stage LoRA) रणनीति का उपयोग करके कुशलतापूर्वक पुनरुत्पादित किया जा सकता है।

Meimingwei Li, Yuanhao Ding, Esteban Garces Arias, Christian Heumann2026-05-22
💬 NLP

A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models

यह ट्यूटोरियल अवकल समीकरणों (differential equations) से उनके फॉरवर्ड और रिवर्स डायनेमिक्स को व्युत्पन्न करके डिफ्यूजन मॉडल्स के लिए एक एकीकृत ढांचा प्रदान करता है, मानक प्रशिक्षण उद्देश्यों और स्कोर मैचिंग के बीच समानता को प्रदर्शित करता है, और DDPM, DDIM और गाइडेड जनरेशन जैसे विभिन्न सैंपलिंग तरीकों के बीच सैद्धांतिक संबंधों को स्पष्ट करता है।

Jiayi Fu, Yuxia Wang2026-05-22
💬 NLP

Chinese sensorimotor and embodiment norms for 3,000 lexicalized concepts

यह शोध पत्र 3,000 मंदारिन चीनी अवधारणाओं के लिए 11-आयामी संवेदी-मोटर (sensorimotor) और एम्बॉडिमेंट (embodiment) मानदंडों के एक व्यापक डेटाबेस को प्रस्तुत करता है, जो उनकी उच्च विश्वसनीयता, लेक्सिकल डिसीजन टास्क में उनकी भविष्य कहने वाली शक्ति, और विशुद्ध रूप से भाषाई निरूपणों से उनकी आंशिक रिकवरेबिलिटी (recoverability) को प्रदर्शित करता है।

Jing Chen, Gábor Parti, Yin Zhong, Chu-Ren Huang, Marco Marelli2026-05-22
💬 NLP

Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

यह शोधपत्र एक कोलैप्स-मुक्त मल्टी-रिवॉर्ड RLIF प्रशिक्षण ढांचे का प्रस्ताव करता है जो बाहरी ग्राउंड-ट्रुथ सुपरविजन पर निर्भर किए बिना LLMs में स्थिर, अनसुपरवाइज्ड लॉन्ग-होरिज़न रीजनिंग को सक्षम करने के लिए उत्तर-स्तरीय क्लस्टर वोटिंग और टोकन-वाइज़ सेल्फ-सर्टेंटी रिवार्ड्स को GDPO नॉर्मलाइजेशन और KL-Cov रेगुलराइजेशन के साथ जोड़ता है।

Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali2026-05-22
💬 NLP

More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts

यह व्यवस्थित अध्ययन प्रदर्शित करता है कि जहाँ नैतिक ज्ञान को पुनः प्राप्त करना (retrieving) राजनीतिक ग्रंथों में श्वार्ट्ज मूल्यों (Schwartz values) का पता लगाने में निरंतर सुधार करता है, वहीं केवल संदर्भ लंबाई या मॉडल के आकार को बढ़ाने से बेहतर प्रदर्शन की गारंटी नहीं मिलती है, जिसमें पुनः प्राप्त ज्ञान का प्रारंभिक संलयन (early fusion), अन्य RAG वेरिएंट और बड़े मॉडलों से बेहतर प्रदर्शन करता है।

Víctor Yeste, Paolo Rosso2026-05-22
💬 NLP

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

यह शोध पत्र "बॉयलिंग द फ्रॉग" (Boiling the Frog) प्रस्तुत करता है, जो एक मल्टी-टर्न बेंचमार्क है जिसे कॉर्पोरेट वातावरण में टूल-उपयोग करने वाले एआई एजेंटों की क्रमिक हमलों के प्रति संवेदनशीलता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल अक्सर तब सुरक्षा बनाए रखने में विफल रहते हैं जब निर्दोष कार्य धीरे-धीरे उच्च-जोखिम वाले परिदृश्यों में बदल जाते हैं।

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon S (…)2026-05-22
💬 NLP

Seeing the Poem: Image-Semantic Detection of AI-Generated Modern Chinese Poetry with MLLMs

यह शोध पत्र एक इमेज-सिमेंटिक निर्देशित पहचान पद्धति का प्रस्ताव और सत्यापन करता है जो दृश्य चित्रण को पाठ्य विश्लेषण के साथ एकीकृत करने के लिए मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स (MLLMs) का लाभ उठाता है, जिससे एआई-जनित आधुनिक चीनी कविता का पता लगाने में अत्याधुनिक प्रदर्शन प्राप्त होता है और यह टेक्स्ट-ओनली LLMs और रोबर्टा (RoBERTa) जैसे पारंपरिक डिटेक्टरों से बेहतर प्रदर्शन करता है।

Shanshan Wang, Fengying Ye, Hanjia Lyu, Caiwen Gou, Junchao Wu, Jingming Yao, Chengzhong Xu, Jiebo Luo, Derek F. Wong2026-05-22