💬 NLP

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

यह शोध पत्र GradingAttack को प्रस्तुत करता है, जो एक सूक्ष्म (fine-grained) एडवरसेरियल फ्रेमवर्क है जो यह प्रदर्शित करता है कि कैसे टोकन-स्तरीय और प्रॉम्प्ट-स्तरीय हेरफेर प्रभावी ढंग से और गुप्त रूप से LLM-आधारित शैक्षिक ग्रेडिंग एजेंटों की सुरक्षा से समझौता कर सकते हैं, जो स्वचालित मूल्यांकन प्रणालियों में मजबूत सुरक्षा उपायों की तत्काल आवश्यकता को रेखांकित करता है।

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu2026-05-25
💬 NLP

Evaluating Memory Structure in LLM Agents

यह शोध पत्र StructMemEval प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जिसे केवल तथ्यों को याद करने के बजाय जटिल संरचनाओं में दीर्घकालिक स्मृति (long-term memory) को व्यवस्थित करने की LLM एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि एजेंट स्पष्ट मार्गदर्शन के साथ ऐसे कार्यों को हल कर सकते हैं, वे अक्सर प्रॉम्प्टिंग के बिना आवश्यक स्मृति संगठन को पहचानने में विफल रहते हैं।

Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin2026-05-25
💬 NLP

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

यह शोध पत्र GT-HarmBench प्रस्तुत करता है, जो गेम थ्योरी संरचनाओं पर आधारित 1,535 उच्च-जोखिम वाले मल्टी-एजेंट परिदृश्यों का एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक एआई मॉडल अक्सर सामाजिक रूप से लाभकारी परिणामों को चुनने में विफल रहते हैं और यह प्रदर्शित करता है कि गेम-थ्योरेटिक हस्तक्षेप इन जटिल वातावरणों में संरेखण (alignment) में महत्वपूर्ण सुधार कर सकते हैं।

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin2026-05-25
💬 NLP

Differences in Typological Alignment in Language Models' Treatment of Differential Argument Marking

यह शोध पत्र यह प्रदर्शित करता है कि जबकि सिंथेटिक कॉर्पोरा पर प्रशिक्षित GPT-2 मॉडल विभेदक तर्क अंकन प्रणालियों (differential argument marking systems) में अर्थ संबंधी असामान्य तर्कों को चिह्नित करने के लिए मानव-समान प्राथमिकता को सफलतापूर्वक दोहराते हैं, वे विषयों की तुलना में वस्तुओं को प्राथमिकता से चिह्नित करने की क्रॉस-भाषाई प्रवृत्ति को पुनरुत्पादित करने में विफल रहते हैं, जो यह सुझाव देता है कि ये टाइपोलॉजिकल पैटर्न विशिष्ट अंतर्निहित स्रोतों से उत्पन्न होते हैं।

Iskar Deng, Nathalia Xu, Shane Steinert-Threlkeld2026-05-25
💬 NLP

Query-Adaptive Semantic Chunking for Retrieval-Augmented Generation: A Dynamic Strategy with Contextual Window Expansion

यह शोध पत्र क्वेरी-एडेप्टिव सिमेंटिक चंकिंग (QASC) प्रस्तुत करता है, जो एक गतिशील रणनीति है जो फिक्स्ड, सिमेंटिक और एजेंटिक चंकिंग विधियों की तुलना में काफी उच्च रिट्रीवल प्रासंगिकता और सुसंगतता प्राप्त करने के लिए दस्तावेज़ विभाजन प्रक्रिया में उपयोगकर्ता की क्वेरी को एकीकृत करती है।

Mudit Rastogi2026-05-25
🤖 machine learning

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

यह शोध पत्र प्रकट करता है कि छोटे भाषा मॉडल (1-3B) चेन-ऑफ-थॉट प्रॉम्प्टिंग में वास्तविक अंकगणितीय तर्क को दरकिनार करते हुए एक स्थितिजन्य शॉर्टकट (पोजीशनल शॉर्टकट) पर निर्भर करते हैं, जहाँ वे उत्तर विभाजक (एन्सर डेलिमिटर) से ठीक पहले आने वाली संख्या को सीधे कॉपी कर लेते हैं, एक ऐसा तंत्र जो प्रदर्शन पर हावी हो जाता है और CoT-आधारित निरीक्षण की विश्वसनीयता को कमजोर करता है।

Ming Liu2026-05-25
🤖 machine learning

When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions

यह शोध पत्र EDRM का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) रूटिंग फ्रेमवर्क है जो शुरुआती डिकोडिंग के दौरान एक चरण-परिवर्तन जैसी एंट्रॉपी शिफ्ट (phase-transition-like entropy shift) की पहचान करता है ताकि गतिशील रूप से यह निर्धारित किया जा सके कि चेन-ऑफ-थॉट (Chain-of-Thought) तर्क कब फायदेमंद है, जिससे विविध कार्यों और मॉडलों में सटीकता में सुधार करते हुए टोकन की खपत को महत्वपूर्ण रूप से कम किया जा सके।

Wei Xia, Haoqing Wang, Zhi-Hong Deng, Yehui Tang2026-05-25
🤖 AI

ImProver 2: Iteratively Self-Improving LMs for Neurosymbolic Proof Optimization

यह शोध पत्र ImProver 2 को प्रस्तुत करता है, जो एक न्यूरोसिम्बोलिक ढांचा है जो डेटा-कुशल विशेषज्ञ पुनरावृत्ति (expert iteration) को एक संरचनात्मक स्कैफोल्डिंग प्रणाली के साथ जोड़ता है ताकि छोटे भाषा मॉडलों को Lean 4 में जटिल औपचारिक प्रमाणों (formal proofs) को प्रभावी ढंग से अनुकूलित करने में सक्षम बनाया जा सके, जो काफी बड़े मॉडलों से बेहतर प्रदर्शन करता है और प्रमाण अनुकूलन को एक स्केलेबल, सीखने योग्य कार्य के रूप में स्थापित करता है।

Riyaz Ahuja, Tate Rowney, Jeremy Avigad, Sean Welleck2026-05-25
🤖 machine learning

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

यह शोध पत्र विज़न-लैंग्वेज मॉडल्स की व्याख्या करने के लिए ट्रांसकोडर्स (Transcoders) का उपयोग करते हुए एक फंक्शन-सेंट्रिक फ्रेमवर्क पेश करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders) की तुलना में अधिक स्थिर विज़ुअल ग्राउंडिंग प्रदान करता है और मैकेनिस्टिक ग्राफ विश्लेषण के माध्यम से मतिभ्रम (hallucinations) की भविष्यवाणी करने में सक्षम बनाता है।

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos2026-05-25
💻 computer science

Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

यह शोध पत्र प्रकट करता है कि वर्तमान विजन-लैंग्वेज बेंचमार्क सूक्ष्म-स्तरीय विजुअल ग्राउंडिंग का विश्वसनीय रूप से मूल्यांकन करने में विफल रहते हैं क्योंकि ओपन-सोर्स मॉडल विजुअल डिग्रेडेशन के प्रति आश्चर्यजनक रूप से कम संवेदनशीलता प्रदर्शित करते हैं और मानक सटीकता मेट्रिक्स द्वारा सुझाए गए स्तर की तुलना में दृश्य साक्ष्यों पर कम निर्भर करते हैं, एक ऐसी घटना जिसका कारण नेटवर्क की गहरी परतों में विजुअल टोकन के बीच बढ़ती समानता को माना गया है।

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou2026-05-25