🤖 AI

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

यह शोध पत्र ROVER को प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक हल्का, सीखने योग्य प्लगइन है जो एक स्टेप-विशिष्ट टोकन ट्रिपलेट तंत्र के माध्यम से ऑब्जेक्ट-सेंट्रिक विजुअल एविडेंस को कुशलतापूर्वक रूट करके ग्राउंडेड मल्टी-इमेज रीजनिंग को बढ़ाता है, और समग्र दृश्य समझ से समझौता किए बिना MM-GCoT और VideoEspresso जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Guannan Lv, Ren Nie, Hongjian Dou2026-05-28
🤖 AI

Geometry of Human Perceptual Domains Emerges Transiently in LLM Representations

यह शोध पत्र प्रदर्शित करता है कि रंग और भावना जैसे विभिन्न डोमेन में मानव-समान संवेदी ज्यामिति (perceptual geometries), प्रत्यक्ष संवेदी प्रशिक्षण के अभाव के बावजूद, एक विशिष्ट विकासात्मक प्रक्षेपवक्र का पालन करते हुए, बड़े भाषा मॉडलों (large language models) की मध्यवर्ती परतों के भीतर क्षणिक रूप से उभरती है।

Simardeep Singh, Paras Chopra2026-05-28
💬 NLP

Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses

यह शोधपत्र सेमेंटिक फ्लो रेगुलराइजेशन (SFR) को प्रस्तुत करता है, जो एक हल्का प्रशिक्षण उद्देश्य है जो कंडीशनल फ्लो मैचिंग के माध्यम से सेमेंटिक फ्लो को पर्यवेक्षित करके फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स में क्रॉस-स्टाइल कोलैप्स को कम करता है, जिससे इन्फरेंस लागत बढ़ाए बिना संवाद और कोडिंग दोनों कार्यों में आउटपुट विविधता, स्टाइल फिडेलिटी और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Kerui Peng, Feifei Li, Xingyu Fan, Wenhui Que2026-05-28
💬 NLP

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

यह शोध पत्र अंग्रेजी-केंद्रित मूल्यांकन की सीमाओं को दूर करने के लिए लक्षित-भाषा भाषण बेंचमार्क के निर्माण हेतु दो मानव-अभिकर्ता ढांचे प्रस्तुत करता है, जिसके परिणामस्वरूप तीन कोरियाई डेटासेट (KVoiceBench, KOpenAudioBench, और KMMAU) जारी किए गए हैं जो कोरियाई स्पोकनQA और ऑडियो समझ कार्यों पर मूल्यांकन किए जाने पर हालिया स्पीचएलएम (SpeechLMs) में महत्वपूर्ण प्रदर्शन अंतराल और पूरक कमजोरियों को प्रकट करते हैं।

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee2026-05-28
🤖 AI

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

यह शोध पत्र AsyncTool को प्रस्तुत करता है, जो सिम्युलेटेड लेटेंसी (simulated latency) के साथ मल्टी-टास्क परिदृश्यों में LLM-आधारित एजेंटों की एसिंक्रोनस टूल-कॉलिंग क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल विलंबित टूल प्रतिक्रियाओं को संभालने के दौरान टेम्पोरल कोऑर्डिनेशन (temporal coordination) और दक्षता के मामले में संघर्ष करते हैं।

Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shi (…)2026-05-28
💬 NLP

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

यह शोध पत्र Meow2X और TRNE को प्रस्तुत करता है, जो दो रिट्रेनिंग-मुक्त फ्रेमवर्क हैं जो एक्टिवेशन विश्लेषण के माध्यम से भाषा मॉडलों में विशिष्ट शुरुआती MLP परतों में विषाक्तता (toxicity) को स्थानीयकृत करते हैं और इन्फरेंस-टाइम स्केलिंग या न्यूनतम वेट एडिट्स के माध्यम से इसे दबाते हैं, जिससे भाषा की गुणवत्ता को कम किए बिना निरंतर सुरक्षा सुधार प्राप्त होता है।

Himanshu Beniwal, Mayank Singh2026-05-28
🤖 AI

Learning to Assign Prediction Tasks to Agents with Capacity Constraints

यह शोध पत्र एक सैद्धांतिक ढांचे और अनुक्रमिक एक्सप्लोर-एक्सप्लोइट (explore-exploit) एल्गोरिदम को प्रस्तुत करता है जो क्षमता संबंधी बाधाओं वाले मानव या एआई एजेंटों को भविष्यवाण करने वाले कार्यों को गतिशील रूप से सौंपने के लिए है, और प्रयोगों के माध्यम से यह प्रदर्शित करता है कि ये विधियाँ एजेंट की विशेषज्ञता और कार्य के संदर्भ को अनुकूलित करना सीखकर गैर-संदर्भात्मक बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करती हैं।

Shang Wu, Saatvik Kher, Padhraic Smyth2026-05-28
🤖 AI

An Empirical Audit of k-NAF Budget Accounting for Anchored Decoding

यह शोध पत्र स्थिर और अनुकूलन योग्य वर्कलोड के माध्यम से एंकोर्ड डिकोडिंग (Anchored Decoding) में k-NAF बजट-लेखांकन तंत्र का अनुभवजन्य रूप से ऑडिट करता है, जिसमें यह पाया गया है कि संचयी KL व्यय लगातार अनुक्रम-स्तर के बजटों से काफी नीचे रहता है और स्पष्ट बजट समाप्ति के मामले तंत्र की वास्तविक विफलताओं के बजाय प्रॉक्सी आर्टिफैक्ट्स (proxy artifacts) के कारण होते हैं।

J. Vijayavallabh2026-05-28✓ Author reviewed
💬 NLP

Integrated and Cross-Architecture Interpretation of LLM Reasoning

यह शोधपत्र इंटीग्रेटेड, क्रॉस-आर्किटेक्चर रीजनिंग (IAR) फ्रेमवर्क प्रस्तुत करता है, जो विभिन्न लार्ज लैंग्वेज मॉडल आर्किटेक्चर और डोमेन में रीजनिंग पैटर्न की व्याख्या करने के लिए एक एकीकृत, सामान्यीकरण योग्य विधि प्रदान करने हेतु बैंडविड्थ-कैलिब्रेटेड म्यूचुअल इंफॉर्मेशन पीक विश्लेषण को डीप-थिंकिंग रेश्यो ओवरलैप और जैकार्ड स्टेबिलिटी मेट्रिक्स के साथ संयोजित करता है।

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang2026-05-28
🤖 machine learning

Learning Compositional Latent Structure with Vector Networks

यह शोध पत्र वेक्टर नेटवर्क्स (VN) का परिचय देता है, जो एक पदानुक्रमित आवर्ती संरचना (hierarchical recurrent architecture) है जो स्थिर वेट मैट्रिसेस को पुन: प्रयोज्य रैंक-1 वेट परमाणुओं (rank-1 weight atoms) की लाइब्रेरी से बदल देता है ताकि स्पार्स, इनपुट-विशिष्ट वेट संरचना को सक्षम किया जा सके, जिससे मानक गहरे नेटवर्क की तुलना में कंपोजिशनल कार्यों पर काफी बेहतर आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण प्राप्त किया जा सके।

Niclas Pokel, Benjamin F. Grewe2026-05-28