💬 NLP

MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning

यह शोधपत्र MemoryDocDataSet को प्रस्तुत करता है, जो एक सिंथेटिक बेंचमार्क है जिसे मल्टी-सेशन कन्वर्सेशनल मेमोरी (बहु-सत्र संवादात्मक स्मृति) को नेविगेट करने और लंबे दस्तावेजों के भीतर गहन तर्क करने की संयुक्त चुनौती पर AI प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो उन प्रश्नों को संभालने में वर्तमान मॉडलों के प्रदर्शन में एक महत्वपूर्ण अंतर को प्रकट करता है जिनके लिए बातचीत के इतिहास के आधार पर प्रासंगिक दस्तावेजों को खोजने की आवश्यकता होती है।

Qiyang Xie, Jialun Wu, Xinjie He, Su Liu, Shuai Xiao, Zhiyuan Lin, Weikai Zhou2026-06-04
💬 NLP

Stepwise Reasoning Enhancement for LLMs via External Subgraph Generation

यह शोध पत्र SGR को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो बाहरी नॉलेज ग्राफ से क्वेरी-प्रासंगिक सबग्राफ को गतिशील रूप से उत्पन्न करके बड़े भाषा मॉडलों (large language models) की बहु-चरणीय तर्क क्षमता को बढ़ाता है, ताकि स्पष्ट संबंधपरक साक्ष्य प्रदान किए जा सकें और सहयोगात्मक तर्क के माध्यम से उत्तरों को सत्यापित किया जा सके, जिससे सटीकता, मजबूती और व्याख्यात्मकता में सुधार होता है।

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li2026-06-04
💬 NLP

Token Rankings are Unforgeable Language Model Signatures

यह शोधपत्र यह प्रदर्शित करता है कि टोकन रैंकिंग भाषा मॉडलों के लिए एक अद्वितीय, अनफॉरजेबल (unforgeable) हस्ताक्षर के रूप में कार्य करती है जो उन्हें बिना उनके पैरामीटर्स को लीक किए पहचान सकती है, बशर्ते कि API आउटपुट को पर्याप्त रूप से छोटे टॉप-kk तक प्रतिबंधित करे ताकि पैरामीटर चोरी को रोका जा सके और साथ ही मॉडल के विशिष्ट रैंकिंग पैटर्न को प्रकट किया जा सके।

Matthew Finlayson, Andreas Grivas, Xiang Ren, Swabha Swayamdipta2026-06-04
💬 NLP

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

यह शोध पत्र SePO का प्रस्ताव करता है, जो एक स्व-संदर्भित (self-referential) ढांचा है जो दो-चरणीय विकासवादी खोज (two-stage evolutionary search) के माध्यम से टास्क एजेंटों और प्रॉम्प्ट एजेंट के अपने सिस्टम प्रॉम्प्ट्स दोनों को अनुकूलित करता है, जो मौजूदा विधियों की तुलना में विविध बेंचमार्क पर बेहतर सामान्यीकरण और प्रदर्शन प्रदर्शित करता है।

Wangcheng Tao, Han Wu, Weng-Fai Wong2026-06-04
⚡ electrical engineering

Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention

यह शोध पत्र तार्किक तर्क (logical reasoning) कार्यों पर स्पीच लार्ज लैंग्वेज मॉडल्स के कम प्रदर्शन को एक एंटिटी बाइंडिंग विफलता (entity binding failure) के रूप में निदान करता है और प्रदर्शित करता है कि एक एंटिटी-अवेयर चेन-ऑफ-थॉट (Entity-Aware Chain-of-Thought) हस्तक्षेप स्पष्ट एंटिटी-प्रॉपर्टी जुड़ाव को अनिवार्य करके इस अंतर को महत्वपूर्ण रूप से पाटता है।

Ming-Hao Hsu, Xiaohai Tian, Jun Zhang, Zhizheng Wu2026-06-04
💬 NLP

Evaluating Reasoning Fidelity in Visual Text Generation

यह शोध पत्र विज़ुअल टेक्स्ट जनरेशन में वर्तमान टेक्स्ट-टू-इमेज मॉडल्स की रीजनिंग फिडेलिटी (तर्क संबंधी सत्यता) का मूल्यांकन करता है और पाता है कि, पठनीय टेक्स्ट उत्पन्न करने के बावजूद, वे अर्थ संबंधी त्रुटियों और तार्किक विसंगतियों के कारण जटिल तर्क प्रक्रियाओं को सटीक रूप से प्रदर्शित करने में अक्सर विफल रहते हैं, जो विज़ुअल टेक्स्ट जनरेशन और प्रक्रियात्मक तर्क क्षमताओं के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Jiajun Hong, Jiawei Zhou2026-06-04
💬 NLP

Off-Distribution Voices: Fanfiction Subgenres as Universal Vernacular Jailbreaks for Aligned LLMs

यह शोध पत्र एक नवीन जेलब्रेक तकनीक प्रस्तुत करता है जो संरेखित (aligned) एलएलएम (LLMs) में सुरक्षा प्रशिक्षण को दरकिनार करने के लिए एक सार्वभौमिक शब्दावली के रूप में कम-कवर किए गए फैनफिक्शन उप-शैलियों का लाभ उठाती है, जो मौजूदा विधियों की तुलना में काफी उच्च आक्रमण सफलता दर प्राप्त करती है और यह प्रदर्शित करती है कि वर्तमान रक्षा प्रणालियाँ अक्सर अनजाने में हमलावरों को ऐसी रजिस्टर-आधारित रणनीतियों की ओर मोड़ देती हैं।

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang2026-06-04
📊 statistics

Global Sketch-Based Watermarking for Diffusion Language Models

यह शोध पत्र मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन वैश्विक, क्रम-अज्ञेय (order-agnostic) वॉटरमार्किंग योजना प्रस्तावित करता है जो डिटेक्शन को स्थानीय जेनरेशन कॉन्टेक्स्ट से अलग करने के लिए एक वेक्टर-वैल्यूड स्केच रिप्रेजेंटेशन का उपयोग करता है, जो पारंपरिक ऑटोरेग्रेसिव टोकन-बायस विधियों की तुलना में विशिष्ट लाभ प्रदान करता है।

Daniel Zhao2026-06-04
💬 NLP

SANE Schema-aware Natural-language Evaluation of Biological Data

यह शोध पत्र SANE को पेश करता है, जो स्वचालित रूप से जनरेट किए गए बेंचमार्क का उपयोग करने वाला एक स्कीमा-जागरूक मूल्यांकन प्रतिमान (paradigm) है, जो यह प्रदर्शित करता है कि फ्यू-शॉट लार्ज लैंग्वेज मॉडल्स बिना फाइन-ट्यूनिंग के जैविक सूक्ष्मदर्शी डेटा (biological microscopy data) के लिए सटीक SQL क्वेरीreliably जनरेट कर सकते हैं, बशर्ते कि इनपुट सुव्यवस्थित हों और अस्पष्टता से सुरक्षित हों।

Rolf Gattung, Martin Krueger, Markus Reischl2026-06-04
💬 NLP

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA एक स्पार्स (sparse), डिकपल्ड अटेंशन आर्किटेक्चर पेश करता है जिसमें एक समर्पित "फोरकास्ट" (Forecast) प्रोजेक्शन है जो कुशल लुकअहेड सिलेक्शन और ओवरलैपिंग CPU-GPU प्रीफेचिंग को सक्षम बनाता है, जिससे KV कैश बाधाओं को दूर किया जा सकता है और चयन जटिलता को कम करते हुए सटीकता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को महत्वपूर्ण रूप से त्वरित किया जा सकता है।

Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa2026-06-04