🤖 AI

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

यह शोध पत्र मोडैलिटी-म्युचुअल अटेंशन (MMA) का प्रस्ताव करता है, जो एक पैरामीटर-मुक्त आर्किटेक्चरल संशोधन है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कॉज़ल अटेंशन को प्रतिस्थापित करता है ताकि इमेज टोकन्स को टेक्स्ट टोकन्स पर अटेंड करने में सक्षम बनाया जा सके, जिससे विजन-लैंग्वेज मिसअलाइनमेंट को हल किया जा सके और 12 बेंचमार्क में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi2026-05-18
💬 NLP

TokenButler: Token Importance is Predictable

TokenButler एक हल्का, क्वेरी-जागरूक प्रेडिक्टर है जो मास्क किए गए कॉज़ल अटेंशन डिस्ट्रीब्यूशन को डिस्टिल करके कुशल KV-कैश प्रबंधन के लिए महत्वपूर्ण टोकन की गतिशील रूप से पहचान करता है, जिससे बिना टोकन को स्थायी रूप से हटाए, लगभग ऑरेकल रिट्रीवल सटीकता और महत्वपूर्ण लेटेंसी में कमी प्राप्त होती है।

Yash Akhauri, Ahmed F AbouElhamayed, Yifei Gao, Chi-Chih Chang, Sameh Gobriel, Nilesh Jain, Mohamed S. Abdelfattah2026-05-18
💬 NLP

Do Chinese models speak Chinese languages?

यह अध्ययन प्रकट करता है कि चीन के विविध भाषाई परिदृश्य के बावजूद, इसके प्रमुख ओपन-वेट एलएलएम (LLMs) पश्चिमी मॉडलों के समान ही बहुभाषी प्रदर्शन प्रोफाइल प्रदर्शित करते हैं—जो मंदारिन, फ्रेंच और जर्मन जैसी प्रमुख वैश्विक भाषाओं में उत्कृष्ट हैं जबकि कज़ाख और उइघुर जैसी अल्पसंख्यक भाषाओं का समर्थन करने में अक्सर विफल रहते हैं—जो यह सुझाव देता है कि वैश्विक बेंचमार्किंग अभ्यास और साझा प्रशिक्षण संसाधन स्थानीय प्राथमिकता के बजाय भाषाई क्षमताओं के एक समरूपीकरण को प्रेरित कर रहे हैं।

Andrea W Wen-Yi, Unso Eun Seo Jo, David Mimno2026-05-18
💬 NLP

VideoGameBench: Can Vision-Language Models complete popular video games?

यह शोधपत्र VideoGameBench को प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जहाँ विजन-लैंग्वेज मॉडल्स को केवल कच्चे विजुअल इनपुट्स और उच्च-स्तरीय निर्देशों का उपयोग करके 1990 के दशक के वीडियो गेम खेलने होते हैं, जो यह प्रकट करता है कि धारणा (perception), स्थानिक नेविगेशन और इन्फरेंस लेटेंसी की सीमाओं के कारण अत्याधुनिक मॉडल्स भी वास्तविक समय के गेमप्ले में काफी संघर्ष करते हैं।

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press2026-05-18
🤖 machine learning

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO एक सैंपल-एफिशिएंट अलाइनमेंट एल्गोरिदम है जो नॉन-लीनियर रिवॉर्ड फंक्शन्स के लिए उच्च-गुणवत्ता वाले प्रेफरेंस डेटा को चुनने के लिए एक सैद्धांतिक रूप से आधारित, LLM-पैरामीटराइज्ड रिवॉर्ड मॉडल का लाभ उठाता है, जो डेटा चयन के दौरान लक्षित मॉडल के प्रभाव को स्पष्ट रूप से ध्यान में रखकर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low2026-05-18
🤖 AI

FAR: Function-preserving Attention Replacement for IMC-friendly Inference

यह शोध पत्र FAR का प्रस्ताव करता है, जो डिस्टिलेशन (distillation) और प्रूनिंग (pruning) के माध्यम से प्रीट्रेन्ड (pretrained) DeiT मॉडलों में ट्रांसफॉर्मर सेल्फ-अटेंशन को IMC-अनुकूल द्विदिश LSTM मॉड्यूल (bidirectional LSTM modules) से बदल देता है, जिससे ReRAM-आधारित एक्सीलरेटरों पर काफी कम लेटेंसी और बैंडविड्थ ओवरहेड के साथ तुलनीय सटीकता प्राप्त होती है।

Yuxin Ren, Maxwell D Collins, Miao Hu, Huanrui Yang2026-05-18
🤖 AI

Honey, I shrunk the hypothesis space (through logical preprocessing)

यह शोध पत्र इंडक्टिव लॉजिक प्रोग्रामिंग सिस्टम के परिकल्पना स्थान (hypothesis space) से असंभव नियमों को हटाने के लिए 'आन्सर सेट प्रोग्रामिंग' का उपयोग करते हुए एक तार्किक प्रीप्रोसेसिंग दृष्टिकोण प्रस्तुत करता है, जिससे विभिन्न डोमेन में भविष्य कहने वाली सटीकता बनाए रखते हुए सीखने के समय को नाटकीय रूप से कम किया जा सकता है।

Andrew Cropper, Filipe Gouveia, David M. Cerna2026-05-18
🤖 AI

The Hardness of Achieving Impact in AI for Social Impact Research: A Ground-Level View of Challenges & Opportunities

26 शोधकर्ताओं के साक्षात्कारों और लेखकों के जीवंत अनुभवों का उपयोग करते हुए, यह शोध पत्र सामाजिक प्रभाव के लिए एआई (AI) परियोजनाओं को प्रूफ-ऑफ-कॉन्सेप्ट से वास्तविक दुनिया में तैनाती की ओर ले जाने में बाधा डालने वाली संरचनात्मक, संगठनात्मक और परिचालन चुनौतियों की पहचान करता है, साथ ही भविष्य के सहयोगों को निर्देशित करने के लिए व्यावहारिक रणनीतियाँ और सर्वोत्तम अभ्यास भी प्रस्तुत करता है।

Aditya Majumdar, Wenbo Zhang, Kashvi Prawal, Amulya Yadav2026-05-18
💬 NLP

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

यह शोध पत्र Prefix-RFT को प्रस्तुत करता है, जो एक हाइब्रिड फाइन-ट्यूनिंग विधि है जो प्रीफ़िक्स सैंपलिंग के माध्यम से सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट फाइन-ट्यूनिंग का तालमेल बिठाती है ताकि प्रत्येक व्यक्तिगत दृष्टिकोण की सीमाओं को दूर किया जा सके, जो गणितीय तर्क कार्यों पर बेहतर प्रदर्शन और मजबूती प्रदर्शित करता है।

Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov2026-05-18
⚡ electrical engineering

CIS-BWE: Chaos-Informed Speech Bandwidth Extension

यह शोध पत्र NDSI-BWE को प्रस्तुत करता है, जो एक नवीन एडवर्सियल बैंडविड्थ एक्सटेंशन फ्रेमवर्क है, जो आठ गुना पैरामीटर कमी के साथ अत्याधुनिक उच्च-आवृत्ति भाषण रिकवरी प्राप्त करने के लिए सात काओस-प्रेरित डिस्क्रिमिनेटर्स द्वारा निर्देशित एक कॉम्प्लेक्स-वैल्यूडेड ConformerNeXt जनरेटर का उपयोग करता है।

Tarikul Islam Tamiti, Tonmoy Das, Nursadul Mamun, Anomadarshi Barua2026-05-18