💬 NLP

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

यह शोधपत्र रिफ्लेक्टिव ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (ROSD) को प्रस्तुत करता है, जो एक फ्रेमवर्क है जो एक सेल्फ-रिफ्लेक्टर का उपयोग करके त्रुटियों को स्थानीयकृत करने और लक्षित, त्रुटि-विशिष्ट डिस्टिलेशन को निर्देशित करने के माध्यम से विभिन्न डोमेन में लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है, जिससे मौजूदा ऑन-पॉलिसी सेल्फ-डिस्टिलेशन विधियों की ओवरफिटिंग और खराब सामान्यीकरण की सीमाओं को दूर किया जा सके।

Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu2026-05-28
💬 NLP

The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

यह शोध पत्र एनर्जी-बेस्ड डिकोडिंग (EBD) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त, रिवॉर्ड-गाइडेड फ्रेमवर्क है जो फ्रोजन प्री-ट्रेन्ड लैंग्वेज मॉडल्स को टास्क-ओरिएंटेड व्यवहारों की ओर निर्देशित करता है और बिना किसी पैरामीटर अपडेट या महंगी पोस्ट-ट्रेनिंग के उनके बेंचमार्क प्रदर्शन में महत्वपूर्ण सुधार करता है।

Shaobo Wang, Guo Chen, Ziyue Wang, Zhengyang Tang, Qingyang Liu, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang2026-05-28
💬 NLP

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

यह शोध पत्र यह पहचान करता है कि सत्यापनकर्ताओं के साथ मानक शुद्धता-केंद्रित सुदृढीकरण शिक्षण (RLVR) से कोड जनरेशन में पुनरुक्ति (redundancy) होती है, और JPlag-आधारित एंटी-रिडंडेंसी रिवार्ड्स का उपयोग करने वाला एक रिडंडेंसी-अवेयर RLVR दृष्टिकोण प्रस्तावित करता है जो विविध कैंडिडेट समाधानों को बनाए रखकर सीमित-बजट वाले कोड जनरेशन प्रदर्शन में महत्वपूर्ण सुधार करता है।

Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne2026-05-28
💬 NLP

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

यह शोध पत्र VCap का प्रस्ताव करता है, जो एक नवीन विटनेस-एडजुडिकेटर (witness-adjudicator) रिवॉर्ड तंत्र है जो संदर्भ और जनरेट किए गए कैप्शन के बीच तथ्यात्मक निरंतरता को सत्यापित करने के लिए हाइपरजियोमेट्रिक-डिस्ट्रीब्यूशन-लेवल परिशुद्धता का लाभ उठाता है, जिससे सुदृढीकरण शिक्षण (reinforcement learning) में कमजोर-से-मजबूत सामान्यीकरण (weak-to-strong generalization) सक्षम होता है जो एक 8B मॉडल को अत्याधुनिक विजुअल कैपशनिंग प्रणालियों से बेहतर प्रदर्शन करने की अनुमति देता है।

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Ti (…)2026-05-28
🤖 AI

MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents

यह शोधपत्र MemCog को प्रस्तुत करता है, जो एक "मेमोरी-एज़-कॉग्निशन" (स्मृति-के-रूप-में-संज्ञान) ढांचा है जो निष्क्रिय, एक-बार के रिट्रीवल (पुनर्प्राप्ति) को नेविगेबल मेमोरी ग्राफ और सक्रिय अन्वेषण प्रोटोकॉल वाले एक सक्रिय, तर्क-एकीकृत सिस्टम से बदल देता है, जिससे यह पैसिव क्यूए (QA) और एक नए प्रस्तावित प्रोएक्टिव मेमोरी बेंचमार्क दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zihan Li, Xingyu Fan, Feifei Li, Wenhui Que2026-05-28
💬 NLP

Challenges in Explaining Pretrained Clinical Text Classifiers

यह शोध पत्र यह प्रदर्शित करता है कि LIME और SHAP जैसे सामान्य पोस्ट-हॉक स्पष्टीकरण विधियाँ नैदानिक टेक्स्ट क्लासिफायर के लिए विश्वसनीय अंतर्दृष्टि प्रदान करने में विफल रहती हैं, क्योंकि वे गैर-सूचनात्मक टोकन पर अत्यधिक जोर देने, अस्थिर एट्रिब्यूशन उत्पन्न करने और असंगत इनपुट के लिए उच्च-विश्वास वाली भविष्यवाणियां करने की अपनी प्रवृत्ति को उजागर करती हैं, जिससे नैदानिक रूप से सार्थक और सुदृढ़ स्पष्टीकरण रणनीतियों की तत्काल आवश्यकता रेखांकित होती है।

Kristian Miok, Matej Klemen, Blaz Škrlj, Marko Robnik Šikonja2026-05-28
💬 NLP

PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting

PromptEmbedder एक नवीन dual-LLM फ्रेमवर्क पेश करता है जो सॉफ्ट प्रॉम्प्टिंग के माध्यम से एम्बेडिंग ज्ञान को विशिष्ट बैकबोन वेट्स से अलग करता है, जिससे कुशल, आर्किटेक्चर-अज्ञेय टेक्स्ट एम्बेडिंग अनुकूलन सक्षम होता है जो LoRA के प्रदर्शन से मेल खाता है और साथ ही मेमोरी उपयोग और प्रशिक्षण समय को काफी कम कर देता है।

Yu-Che Tsai, Kuan-Yu Chen, Yuan-Hao Chen, Yu-Han Chang, Ching-Yu Tsai, Yu-Hsiang Chuang, Shou-De Lin2026-05-28
💬 NLP

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

यह शोध पत्र SilentRetrieval को प्रस्तुत करता है, जो एक दो-चरणीय डेटा पॉइजनिंग हमला है जो धाराप्रवाह रूप से तैयार किए गए प्रतिकूल दस्तावेजों को इंजेक्ट करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टमों को हाईजैक कर लेता है, जो उच्च रिट्रीवल रैंकिंग बनाए रखते हैं और अर्थपूर्ण सुसंगतता (semantic coherence) को संरक्षित करके पहचान से बचने के साथ-साथ सफलतापूर्वक LLM आउटपुट को मैनिपुलेट करते हैं।

Jiachen Qian2026-05-28
💬 NLP

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

यह शोध पत्र SMILE-Next को पेश करता है, जो एक व्यापक वास्तविक दुनिया का हँसने का डेटासेट है, और एक विशेषीकृत लार्ज लैंग्वेज मॉडल फ्रेमवर्क प्रस्तावित करता है जिसमें 'लाफ्टर-स्पेसिफिक सेल्फ-इंस्ट्रक्ट' और एक 'मिक्सचर-ऑफ-लाफ-एक्सपर्ट्स (MoLE)' तंत्र शामिल है ताकि जटिल सामाजिक हँसी के संकेतों के पता लगाने, वर्गीकरण और तर्क करने की क्षमता में महत्वपूर्ण सुधार किया जा सके।

Lee Jung-Mok, Kim Sung-Bin, Joohyun Chang, Lee Hyun, Tae-Hyun Oh2026-05-28
💬 NLP

MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content

यह शोध पत्र MIRAGE पेश करता है, जो एक संदर्भ-जागरूक (context-aware) हमला पाइपलाइन है जो विजन-लैंग्वेज मॉडल एजेंटों को धोखा देने के लिए मोबाइल GUI स्क्रीनशॉट के भीतर उपयोगकर्ता-जनित सामग्री में प्रतिकूल प्रॉम्प्ट (adversarial prompts) इंजेक्ट करती है, यह प्रदर्शित करते हुए कि पांच मूल्यांकित किए गए सभी एजेंट यथार्थवादी, दृश्य रूप से अविभेद्य हमलों के प्रति संवेदनशील हैं जिनकी सफलता दर 23% और 30% के बीच है।

Ruoqi Guo, Yi Liu, Gelei Deng, Yiheng Xiong, Yuekang Li, Ying Zhang, Leo Yu Zhang, Lida Zhao, Ji Jie, Yuxiao Lu2026-05-28