💬 NLP

Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems

यह शोध पत्र प्रकट करता है कि मल्टी-एजेंट एलएलएम (LLM) सिस्टम में इंजेक्शन डिटेक्टर एक महत्वपूर्ण "कैमफ्लाज डिटेक्शन गैप" (छलावरण पहचान अंतराल) से ग्रस्त हैं, जो उन हमलों की पहचान करने में विफल रहते हैं जो डोमेन-विशिष्ट शब्दावली और अधिकार संरचनाओं की नकल करते हैं, जिसके कारण पहचान दर तेजी से गिर जाती है और सुरक्षा तंत्रों में एक गंभीर संरचनात्मक भेद्यता उजागर होती है।

Aaditya Pai2026-05-22✓ Author reviewed
💬 NLP

From TF-IDF to Transformers: A Comparative and Ensemble Approach to Sentiment Classification

यह शोध पत्र IMDb डेटासेट पर सेंटीमेंट क्लासिफिकेशन के लिए विभिन्न मशीन लर्निंग और एनएलपी मॉडल्स का मूल्यांकन करता है, जिसमें यह पाया गया कि RoBERTa 93.02% की उच्चतम सटीकता प्राप्त करता है जबकि सभी मॉडल्स का एक सॉफ्ट वोटिंग एन्सेम्बल समग्र प्रदर्शन को और अधिक बढ़ाता है।

Dip Biswas Shanto, Mitali Yadav, Prajwal Panth, Suresh Chandra Satapathy2026-05-22
💬 NLP

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

यह शोध पत्र इस दृष्टिकोण को चुनौती देता है कि मतिभ्रम (hallucinations) केवल ज्ञान की कमी के कारण होते हैं, यह प्रकट करते हुए कि बड़े इंस्ट्रक्शन-ट्यून्ड एलएलएम (LLMs) अक्सर मतिभ्रम इसलिए करते हैं क्योंकि वे अपने संभाव्यता वितरण (probability distribution) में पहले से मौजूद एक सही अवधारणा के प्रति प्रतिबद्ध होने में विफल रहते हैं, बल्कि एक स्केल-डिपेंडेंट शार्पनिंग मैकेनिज्म के कारण विकल्पों के बीच संभाव्यता द्रव्यमान (probability mass) को बिखेर देते हैं जो सहायकता और आत्मविश्वासी त्रुटियों दोनों को प्रेरित करता है।

Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim2026-05-22
💬 NLP

FlyRoute: Self-Evolving Agent Profiling via Data Flywheel for Adaptive Task Routing

FlyRoute एक स्व-विकसित प्रोफाइलिंग ढांचा है जो लक्षित अन्वेषण और साक्ष्य आसवन (evidence distillation) के माध्यम से वास्तविक ट्रैफ़िक से एजेंट क्षमता विवरणों को गतिशील रूप से अपडेट करने के लिए डेटा फ्लाईव्हील का लाभ उठाता है, जिससे स्थिर बेसलाइन की तुलना में अनुकूली कार्य रूटिंग सटीकता में महत्वपूर्ण सुधार होता है।

Rongjun Li, Ziyu Zhou, Yihang Wu2026-05-22
💬 NLP

Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements

यह शोधपत्र Ishigaki-IDS-Bench प्रस्तुत करता है, जो एक द्विभाषी बेंचमार्क है जिसमें 166 विशेषज्ञ-सत्यापित उदाहरण शामिल हैं जो बिल्डिंग इंफॉर्मेशन मॉडलिंग (BIM) आवश्यकताओं से मानक-अनुपालन सूचना वितरण विनिर्देश (IDS) XML उत्पन्न करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल XML संरचना और डोमेन शब्दावली बाधाओं दोनों को लगातार संतुष्ट करने में संघर्ष करते हैं।

Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Sh (…)2026-05-22
💬 NLP

A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

यह शोध पत्र खमेर-भाषा के टेलीकॉम दस्तावेजों के लिए एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणाली का तुलनात्मक अध्ययन प्रस्तुत करता है, जिसमें BGE-M3 को बेहतर रिट्रिवर के रूप में पहचाना गया है और यह प्रदर्शित किया गया है कि हालांकि कोई भी एकल जनरेटर मॉडल सभी प्रदर्शन मेट्रिक्स में हावी नहीं है, विभिन्न मॉडल विशिष्ट क्षेत्रों जैसे कि निष्ठा (faithfulness), तथ्यात्मक शुद्धता, या अर्थ संबंधी समानता में उत्कृष्ट हैं।

Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor, Kimleang Ly, Wan-Sup Cho, Saksonita Khoeurn2026-05-22
💬 NLP

Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency

यह शोधपत्र एक नवीन स्व-पर्यवेक्षित ढांचे का प्रस्ताव करता है जो क्रॉस-लिंगुअल ज्ञान अंतराल को पाटने के लिए बहुभाषी स्व-संगति और स्व-आलोचना का लाभ उठाता है, जिससे बाहरी डेटा पर निर्भर रहे बिना स्थानीय भाषाओं से अंग्रेजी में अंतर्निहित सांस्कृतिक ज्ञान को उजागर और स्थानांतरित करके एलएलएम (LLMs) में सांस्कृतिक संरेखण में महत्वपूर्ण सुधार होता है।

Andrew Ivan Soegeng, Patrick Sutanto, Tan Sang Nguyen2026-05-22
💬 NLP

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

यह शोध पत्र SR2^2AM का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो निर्णय लेने को सिमुलेटिव प्लानिंग (simulative planning), रिएक्टिव एक्जीक्यूशन (reactive execution) और एक सीखे हुए सेल्फ-रेगुलेशन मैकेनिज्म (self-regulation mechanism) में विभाजित करके एजेंटिक रीजनिंग की दक्षता को बढ़ाता है, जो यह गतिशील रूप से निर्धारित करता है कि कब और कितनी गहराई से योजना बनानी है, जिससे बड़े मॉडलों की तुलना में काफी कम रीजनिंग टोकन के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Mingkai Deng, Jinyu Hou, Lara Sá Neves, Varad Pimpalkhute, Taylor W. Killian, Zhengzhong Liu, Eric P. Xing2026-05-22
💬 NLP

IdioLink: Retrieving Meaning Beyond Words Across Idiomatic and Literal Expressions

यह शोधपत्र IdioLink प्रस्तुत करता है, जो एक बड़े पैमाने का रिट्रीवल बेंचमार्क है जिसमें 10,000 से अधिक दस्तावेज़ और 2,000 क्वेरी शामिल हैं, जिसे वर्तमान एम्बेडिंग मॉडलों की उन सीमाओं को उजागर करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है जहाँ वे मुहावरेदार अभिव्यक्तियों को उनके वैचारिक रूप से समान शाब्दिक या पैराफ्रेज़्ड अर्थों से जोड़ने में विफल रहते हैं।

Kai Golan Hashiloni, Daniel Fadlon, Lior Livyatan, Ofri Hefetz, Jiahuan Pei, Kfir Bar2026-05-22
💬 NLP

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

यह शोध पत्र TransitLM प्रस्तुत करता है, जो 13 मिलियन से अधिक ट्रांजिट रिकॉर्ड वाला एक बड़े पैमाने का डेटासेट और बेंचमार्क है, जो लार्ज लैंग्वेज मॉडल्स को पारंपरिक मैप इंफ्रास्ट्रक्चर पर निर्भर हुए बिना, ओरिजिन-डेस्टिनेशन जानकारी से सीधे संरचनात्मक रूप से वैध, मैप-मुक्त सार्वजनिक पारगमन मार्ग उत्पन्न करने में सक्षम बनाता है।

Hanyu Guo, Jiedong Yang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu2026-05-22