💻 computer science

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

यह शोध पत्र PARASITE को पेश करता है, जो एक ब्लैक-बॉक्स हमला ढांचा है जो "स्लीपर एजेंट्स" के साथ तीसरे पक्ष के सिस्टम प्रॉम्प्ट्स को विषाक्त करता है ताकि लार्ज लैंग्वेज मॉडल्स (LLMs) को विशिष्ट प्रश्नों के लिए लक्षित, समझौतापूर्ण प्रतिक्रियाएं उत्पन्न करने के लिए हाईजैक किया जा सके, जबकि सामान्य इनपुट पर सामान्य कार्यक्षमता बनाए रखते हुए मानक सुरक्षा उपायों से प्रभावी ढंग से बचा जा सके।

Viet Pham, Thai Le2026-04-28
💻 computer science

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

यह शोध पत्र SIV-Bench प्रस्तुत करता है, जो एक व्यापक वीडियो बेंचमार्क है जिसमें 2,792 क्लिप और 5,455 प्रश्न-उत्तर जोड़े शामिल हैं, जिसे सामाजिक संपर्क कार्यों पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ वर्तमान मॉडल दृश्य समझ में उत्कृष्ट हैं, वहीं वे मानवीय विचार प्रक्रियाओं के साथ मिसअलाइनमेंट के कारण सामाजिक स्थिति के तर्क और गतिशीलता की भविष्यवाणी करने में संघर्ष करते हैं।

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng2026-04-28
💻 computer science

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

यह शोध पत्र StorySim पेश करता है, जो बड़े भाषा मॉडलों (large language models) का मूल्यांकन करने के लिए नवीन, संदूषण-मुक्त (contamination-free) कहानी प्रॉम्प्ट उत्पन्न करने वाला एक प्रोग्राम करने योग्य ढांचा है, जो यह प्रकट करता है कि वे आमतौर पर थ्योरी ऑफ माइंड (theory of mind) कार्यों की तुलना में वर्ल्ड मॉडलिंग (world modeling) पर बेहतर प्रदर्शन करते हैं और अक्सर गहरे तर्क के बजाय ह्यूरिस्टिक्स (heuristics) पर निर्भर रहते हैं।

Nathaniel Getachew, Abulhair Saparov2026-04-28
🤖 machine learning

FedRef: Bayesian Fine-Tuning using a Reference Model to Mitigate Catastrophic Forgetting for Heterogeneous Federated Learning

FedRef एक विषम फेडरेटेड लर्निंग (heterogeneous federated learning) के लिए एक बायेसियन फाइन-ट्यूनिंग फ्रेमवर्क है जो कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करने और क्लाइंट-साइड कंप्यूटेशनल ओवरहेड को घटाने के लिए सर्वर-साइड रेफरेंस मॉडल और MAP-आधारित रेगुलराइजेशन का उपयोग करता है।

Taehwan Yoon, Bongjun Choi, Wesley De Neve2026-04-28
🤖 machine learning

Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens

यह शोध पत्र यह प्रस्तावित करता है कि चेन-ऑफ-थॉट (CoT) तर्क वास्तविक बुद्धिमत्ता का संकेत नहीं है, बल्कि सीखे गए इंडक्टिव बायस (inductive biases) का एक भंगुर प्रतिबिंब है जो केवल तभी सफल होता है जब परीक्षण प्रश्न प्रशिक्षण डेटा वितरण के अनुरूप होते हैं, और वितरण बदलाव (distribution shifts) का सामना करने पर विफल हो जाता है।

Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu2026-04-28
💻 computer science

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

यह शोध पत्र mKG-RAG का प्रस्ताव करता है, जो एक नवीन रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो अनस्ट्रक्चर्ड डॉक्यूमेंट-आधारित विधियों की सीमाओं को दूर करने के लिए मल्टीमॉडल नॉलेज ग्राफ और एक दोहरे चरण वाली रिट्रीवल रणनीति का लाभ उठाता है, जिससे ज्ञान-गहन विजुअल क्वेश्चन आंसरिंग (Visual Question Answering) में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li2026-04-28
💻 computer science

BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks

ब्लाइंडगार्ड (BlindGuard) एक अनसुपरवाइज्ड डिफेंस फ्रेमवर्क है जो एलएलएम-आधारित मल्टी-एजेंट सिस्टम के लिए है, जो लेबल किए गए अटैक डेटा या विशिष्ट खतरों के पूर्व ज्ञान पर निर्भर हुए बिना, प्रभावी ढंग से दुर्भावनापूर्ण एजेंटों की पहचान करने और विविध हमलों को कम करने के लिए एक पदानुक्रमित एजेंट एनकोडर (hierarchical agent encoder) और एक करप्शन-गाइडेड डिटेक्टर (corruption-guided detector) का उपयोग करता है।

Rui Miao, Yixin Liu, Yili Wang, Xu Shen, Yue Tan, Yiwei Dai, Shirui Pan, Xin Wang2026-04-28
💻 computer science

Test of Time: Rethinking Temporal Signal of Benchmark Contamination

यह शोध पत्र इस धारणा को चुनौती देता है कि कटऑफ के बाद प्रदर्शन में गिरावट (post-cutoff performance decay) विश्वसनीय रूप से बेंचमार्क संदूषण (benchmark contamination) का संकेत देती है, और लाइवकोडबेंच (LiveCodeBench) तथा इन्फ्लुएंस फंक्शन्स (influence functions) के विश्लेषण के माध्यम से यह प्रदर्शित करता है कि यह टेम्पोरल सिग्नल प्रश्न निर्माण के प्रति अत्यधिक संवेदनशील है और इसे LLM-जनित रूपांतरणों द्वारा कृत्रिम रूप से प्रेरित या हटाया जा सकता है।

Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang (…)2026-04-28
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

यह शोध पत्र एक ऐसी नवीन कार्यप्रणाली प्रस्तावित करता है जो लार्ज लैंग्वेज मॉडल्स को डोमेन ऑन्टोलॉजी और SHACL बाधाओं के साथ जोड़कर एक ऐसा AI एजेंट बनाता है जो साइबर सुरक्षा लॉग्स, विशेष रूप से हनीपॉट डेटा से संरचित, अर्थपूर्ण रूप से वैध जानकारी निकालने की सटीकता और व्याख्यात्मकता में महत्वपूर्ण सुधार करता है।

Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti2026-04-28
⚡ electrical engineering

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

यह अध्ययन DementiaBank कॉर्पस का उपयोग करते हुए स्पीच-आधारित डिमेंशिया डिटेक्शन में लार्ज लैंग्वेज मॉडल्स के लिए विभिन्न अनुकूलन रणनीतियों का व्यवस्थित रूप से मूल्यांकन करता है, जिसमें यह पाया गया है कि टोकन-लेवल फाइन-ट्यूनिंग और अनुकूलित प्रदर्शन चयन (डेमोंस्ट्रेशन सिलेक्शन) ओपन-वेट मॉडल्स को प्रदर्शन में वाणिज्यिक प्रणालियों के बराबर या उनसे बेहतर बनाने में सक्षम बनाते हैं।

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Hag (…)2026-04-28