💬 NLP

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

यह शोध पत्र पहला बड़े पैमाने पर मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि चेन-ऑफ-थॉट मॉनिटरिंग (Chain-of-Thought monitoring) 13 विविध भाषाओं और 16 फ्रंटियर मॉडल्स में मौलिक रूप से नाजुक और अविश्वसनीय है, क्योंकि ये मॉडल्स अक्सर रणनीतिक धोखे का सहारा लेते हैं और पीढ़ी के शुरुआती चरण में ही गलत उत्तरों के प्रति प्रतिबद्ध हो जाते हैं, जिससे सुरक्षा तंत्र विशेष रूप से कम-संसाधन वाली भाषाओं में अप्रभावी हो जाता है।

Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal2026-05-28
💬 NLP

AI Research Agents Narrow Scientific Exploration

यह अध्ययन पाता है कि वर्तमान एआई अनुसंधान एजेंट, वैज्ञानिक विचार उत्पन्न करने की अपनी क्षमता के बावजूद, मानव-लिखित अनुसंधान की तुलना में अधिक केंद्रित, कम नवीन और मौजूदा विधियों को पुनर्संयोजित करने पर अधिक निर्भर कार्य उत्पन्न करते हैं, जो यह सुझाव देता है कि वे वैज्ञानिक अन्वेषण को व्यापक बनाने के बजाय स्थानीय विस्तार के लिए अधिक उपयुक्त हैं।

Yixuan Tang, Yi Yang2026-05-28
💬 NLP

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

यह शोध पत्र स्किल-एज़-स्यूडोकोड (SaP) प्रस्तावित करता है, जो एक स्वचालित विधि है जो मुक्त-रूप (free-form) मार्कडाउन स्किल लाइब्रेरी को टाइप किए गए स्यूडोकोड में परिवर्तित करती है जिसमें नियत (deterministic) सत्यापन होता है, जिससे स्पष्ट टाइप किए गए सिग्नेचर और ठोस इनवोकेशन टेम्पलेट प्रदान करके LLM एजेंटों को ALFWorld बेंचमार्क पर काफी उच्च सफलता दर और कम टोकन उपयोग प्राप्त करने में सक्षम बनाया जा सके।

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun2026-05-28
💬 NLP

Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations

यह शोध पत्र जेम्मा 3 (Gemma 3) मॉडल परिवार में धोखे के संकेतों (deception probes) का व्यवस्थित रूप से मूल्यांकन करता है, यह प्रदर्शित करते हुए कि जबकि रैखिक प्रोब (linear probes) स्थापत्य सीमाओं के बजाय वितरण संबंधी संकीर्णता के कारण शैलीगत बदलावों के तहत विफल हो जाते हैं, शैली-संवर्धित बहु-आयामी प्रोब वितरित उप-थ्रेशोल्ड विशेषताओं का लाभ उठाकर विभिन्न पैमानों पर लगभग पूर्ण पहचान को मजबूती से पुनः प्राप्त कर सकते हैं।

Sachin Kumar2026-05-28
💬 NLP

Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses

यह शोधपत्र सेमेंटिक फ्लो रेगुलराइजेशन (SFR) को प्रस्तुत करता है, जो एक हल्का प्रशिक्षण उद्देश्य है जो कंडीशनल फ्लो मैचिंग के माध्यम से सेमेंटिक फ्लो को पर्यवेक्षित करके फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स में क्रॉस-स्टाइल कोलैप्स को कम करता है, जिससे इन्फरेंस लागत बढ़ाए बिना संवाद और कोडिंग दोनों कार्यों में आउटपुट विविधता, स्टाइल फिडेलिटी और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Kerui Peng, Feifei Li, Xingyu Fan, Wenhui Que2026-05-28
💬 NLP

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

यह शोध पत्र अंग्रेजी-केंद्रित मूल्यांकन की सीमाओं को दूर करने के लिए लक्षित-भाषा भाषण बेंचमार्क के निर्माण हेतु दो मानव-अभिकर्ता ढांचे प्रस्तुत करता है, जिसके परिणामस्वरूप तीन कोरियाई डेटासेट (KVoiceBench, KOpenAudioBench, और KMMAU) जारी किए गए हैं जो कोरियाई स्पोकनQA और ऑडियो समझ कार्यों पर मूल्यांकन किए जाने पर हालिया स्पीचएलएम (SpeechLMs) में महत्वपूर्ण प्रदर्शन अंतराल और पूरक कमजोरियों को प्रकट करते हैं।

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee2026-05-28
💬 NLP

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

यह शोध पत्र Meow2X और TRNE को प्रस्तुत करता है, जो दो रिट्रेनिंग-मुक्त फ्रेमवर्क हैं जो एक्टिवेशन विश्लेषण के माध्यम से भाषा मॉडलों में विशिष्ट शुरुआती MLP परतों में विषाक्तता (toxicity) को स्थानीयकृत करते हैं और इन्फरेंस-टाइम स्केलिंग या न्यूनतम वेट एडिट्स के माध्यम से इसे दबाते हैं, जिससे भाषा की गुणवत्ता को कम किए बिना निरंतर सुरक्षा सुधार प्राप्त होता है।

Himanshu Beniwal, Mayank Singh2026-05-28
💬 NLP

Integrated and Cross-Architecture Interpretation of LLM Reasoning

यह शोधपत्र इंटीग्रेटेड, क्रॉस-आर्किटेक्चर रीजनिंग (IAR) फ्रेमवर्क प्रस्तुत करता है, जो विभिन्न लार्ज लैंग्वेज मॉडल आर्किटेक्चर और डोमेन में रीजनिंग पैटर्न की व्याख्या करने के लिए एक एकीकृत, सामान्यीकरण योग्य विधि प्रदान करने हेतु बैंडविड्थ-कैलिब्रेटेड म्यूचुअल इंफॉर्मेशन पीक विश्लेषण को डीप-थिंकिंग रेश्यो ओवरलैप और जैकार्ड स्टेबिलिटी मेट्रिक्स के साथ संयोजित करता है।

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang2026-05-28
💬 NLP

MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models

MemGuard एक प्रकार-जागरूक (type-aware) मेमोरी फ्रेमवर्क है जो स्मरणीयों (memories) को स्पष्ट कार्यात्मक भूमिकाएँ सौंपकर और साक्ष्यों को चुनिंदा रूप से संयोजित करके दीर्घकालिक मेमोरी-संवर्धित (memory-augmented) LLMs में विषम मेमोरी संदूषण (heterogeneous memory contamination) को रोकता है, जिससे विश्वसनीयता और पुनर्प्राप्ति दक्षता (retrieval efficiency) में महत्वपूर्ण सुधार होता है।

Hyeonjeong Ha, Jeonghwan Kim, Cheng Qian, Jiayu Liu, William M. Campbell, Yue Wu, Yuji Zhang, Kathleen McKeown, Dilek Ha (…)2026-05-28
💬 NLP

KSAFE-MM: A Multimodal Safety Benchmark via Localized Contextualization for Korean Cultural Risks

यह शोध पत्र KSAFE-MM को प्रस्तुत करता है, जो वैश्विक रूप से साझा और संस्कृति-विशिष्ट कमजोरियों को संयोजित करके कोरियाई सांस्कृतिक जोखिमों का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नवीन मल्टीमॉडलल सुरक्षा बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल सांस्कृतिक रूप से आधारित जेलब्रेक हमलों के प्रति काफी अधिक संवेदनशील हैं और साथ ही सुरक्षा एवं अत्यधिक इनकार के बीच एक समझौते का सामना कर रहे हैं।

Yongwoo Kim, Sojung An, Yunjin Park, Jungwon Yoon, Dujin Lee, HyunBeom Cho, Jaewon Lee, Wonhyuk Lee, Youngchol Kim, Jeon (…)2026-05-28