🤖 AI

Residual Feature Integration is Sufficient to Prevent Negative Transfer

यह योगदान अवशिष्ट विशेषताओं (residual features) को एकीकृत करने के लिए एक सरल रणनीति प्रस्तुत करता है जो सैद्धांतिक रूप से शून्य से प्रशिक्षण लेने की तुलना में अभिसरण दर (convergence rates) को बदतर न बनाकर नकारात्मक स्थानांतरण (negative transfer) से बचने की गारंटी देता है, जबकि विविध बेंचमार्क पर मजबूत प्रदर्शन का अनुभवजन्य प्रदर्शन करता है और समय की बाधाओं के अनुकूल होने के लिए बहु-मोडालिटी (multimodality) के विस्तार को सक्षम बनाता है।

Yichen Xu, Ryumei Nakada, Linjun Zhang, Lexin Li2026-04-28
💻 computer science

Can Large Language Models Really Recognize Your Name?

यह शोध पत्र AmBench को प्रस्तुत करता है, जो 12,000 से अधिक संदिग्ध मानव नामों का एक बेंचमार्क है, यह प्रदर्शित करने के लिए कि बड़े भाषा मॉडल (LLMs) सुस्पष्ट नामों की तुलना में ऐसे नामों का पता लगाने में काफी खराब प्रदर्शन करते हैं, जिससे LLM-आधारित गोपनीयता संरक्षण प्रणालियों में महत्वपूर्ण निष्पक्षता अंतराल और प्रॉम्प्ट इंजेक्शन के प्रति संवेदनशीलता का खुलासा होता है।

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr2026-04-28
⚡ electrical engineering

Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey

यह शोध पत्र लार्ज ऑडियो-लैंग्वेज मॉडल (LALM) मूल्यांकन का पहला व्यापक सर्वेक्षण प्रदान करता है, जो बेंचमार्किंग में वर्तमान विखंडन को संबोधित करने के लिए एक व्यवस्थित चार-आयामी वर्गीकरण प्रस्तावित करता है और भविष्य के अनुसंधान के लिए मार्गदर्शन प्रदान करता है।

Chih-Kai Yang, Neo S. Ho, Hung-yi Lee2026-04-28
💻 computer science

CUB: Benchmarking Context Utilisation Techniques for Language Models

यह शोध पत्र CUB को प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) में कॉन्टेक्स्ट यूटिलाइजेशन मैनिपुलेशन टेक्निक्स (CMTs) के मूल्यांकन के लिए पहला व्यापक बेंचमार्क है, जो व्यापक परीक्षण के माध्यम से यह प्रकट करता है कि अधिकांश मौजूदा विधियाँ विविध वास्तविक दुनिया के शोर वाले संदर्भों (noisy contexts) के साथ संघर्ष करती हैं और अक्सर सरलीकृत सिंथेटिक डेटासेट पर बढ़ा-चढ़ाकर प्रदर्शन करती हैं।

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein2026-04-28
💻 computer science

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

यह शोध पत्र PARASITE को पेश करता है, जो एक ब्लैक-बॉक्स हमला ढांचा है जो "स्लीपर एजेंट्स" के साथ तीसरे पक्ष के सिस्टम प्रॉम्प्ट्स को विषाक्त करता है ताकि लार्ज लैंग्वेज मॉडल्स (LLMs) को विशिष्ट प्रश्नों के लिए लक्षित, समझौतापूर्ण प्रतिक्रियाएं उत्पन्न करने के लिए हाईजैक किया जा सके, जबकि सामान्य इनपुट पर सामान्य कार्यक्षमता बनाए रखते हुए मानक सुरक्षा उपायों से प्रभावी ढंग से बचा जा सके।

Viet Pham, Thai Le2026-04-28
💻 computer science

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

यह शोध पत्र SIV-Bench प्रस्तुत करता है, जो एक व्यापक वीडियो बेंचमार्क है जिसमें 2,792 क्लिप और 5,455 प्रश्न-उत्तर जोड़े शामिल हैं, जिसे सामाजिक संपर्क कार्यों पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ वर्तमान मॉडल दृश्य समझ में उत्कृष्ट हैं, वहीं वे मानवीय विचार प्रक्रियाओं के साथ मिसअलाइनमेंट के कारण सामाजिक स्थिति के तर्क और गतिशीलता की भविष्यवाणी करने में संघर्ष करते हैं।

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng2026-04-28
💻 computer science

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

यह शोध पत्र StorySim पेश करता है, जो बड़े भाषा मॉडलों (large language models) का मूल्यांकन करने के लिए नवीन, संदूषण-मुक्त (contamination-free) कहानी प्रॉम्प्ट उत्पन्न करने वाला एक प्रोग्राम करने योग्य ढांचा है, जो यह प्रकट करता है कि वे आमतौर पर थ्योरी ऑफ माइंड (theory of mind) कार्यों की तुलना में वर्ल्ड मॉडलिंग (world modeling) पर बेहतर प्रदर्शन करते हैं और अक्सर गहरे तर्क के बजाय ह्यूरिस्टिक्स (heuristics) पर निर्भर रहते हैं।

Nathaniel Getachew, Abulhair Saparov2026-04-28
🤖 machine learning

FedRef: Bayesian Fine-Tuning using a Reference Model to Mitigate Catastrophic Forgetting for Heterogeneous Federated Learning

FedRef एक विषम फेडरेटेड लर्निंग (heterogeneous federated learning) के लिए एक बायेसियन फाइन-ट्यूनिंग फ्रेमवर्क है जो कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करने और क्लाइंट-साइड कंप्यूटेशनल ओवरहेड को घटाने के लिए सर्वर-साइड रेफरेंस मॉडल और MAP-आधारित रेगुलराइजेशन का उपयोग करता है।

Taehwan Yoon, Bongjun Choi, Wesley De Neve2026-04-28
🤖 machine learning

Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens

यह शोध पत्र यह प्रस्तावित करता है कि चेन-ऑफ-थॉट (CoT) तर्क वास्तविक बुद्धिमत्ता का संकेत नहीं है, बल्कि सीखे गए इंडक्टिव बायस (inductive biases) का एक भंगुर प्रतिबिंब है जो केवल तभी सफल होता है जब परीक्षण प्रश्न प्रशिक्षण डेटा वितरण के अनुरूप होते हैं, और वितरण बदलाव (distribution shifts) का सामना करने पर विफल हो जाता है।

Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu2026-04-28
💻 computer science

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

यह शोध पत्र mKG-RAG का प्रस्ताव करता है, जो एक नवीन रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो अनस्ट्रक्चर्ड डॉक्यूमेंट-आधारित विधियों की सीमाओं को दूर करने के लिए मल्टीमॉडल नॉलेज ग्राफ और एक दोहरे चरण वाली रिट्रीवल रणनीति का लाभ उठाता है, जिससे ज्ञान-गहन विजुअल क्वेश्चन आंसरिंग (Visual Question Answering) में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li2026-04-28