🤖 AI

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

यह शोध पत्र MCPEvol-Bench का परिचय देता है, जो एक नया बेंचमार्क है जो यथार्थवादी इंटरफ़ेस परिवर्तनों को सिम्युलेट करके MCP सर्वरों में डायनेमिक टूलसेट इवोल्यूशन के प्रति LLM एजेंट की अनुकूलन क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि अत्याधुनिक मॉडल भी ऐसे अनुकूलनों के साथ संघर्ष करते हैं और उनके प्रदर्शन में महत्वपूर्ण गिरावट आती है।

Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang2026-07-17
🤖 AI

LLM-Driven Approach to Modeling Tool Interoperability in Automotive Domain

यह शोध पत्र एक LLM-संचालित कार्यप्रणाली प्रस्तुत करता है जो मॉडल इंस्टेंस को लक्षित मेटा-मॉडल्स पर मैप करके और मेटा-मॉडल्स को मर्ज करके ऑटोमोटिव डोमेन में मॉडल इंटरऑपरेबिलिटी को स्वचालित करता है, जिससे Ecore और SysML v2 जैसे विषम टूल्स के बीच संरचनात्मक वैधता सुनिश्चित करते हुए मैनुअल ट्रांसफॉर्मेशन प्रयास को काफी कम किया जाता है।

Nenad Petrovic, Jiajie Zhang, Vahid Zolfaghari, Alois Knoll2026-07-17
🤖 AI

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

यह शोधपत्र कालिडोस्कोप (Kaleidoscope) को प्रस्तुत करता है, जो एक व्यावहारिक और पुनरावृत्ति आधारित वर्कफ़्लो है जो वास्तविक दुनिया के एआई अनुप्रयोगों के स्केलेबल और नीति-अनुरूप मूल्यांकन को सक्षम करने के लिए व्यक्तित्व-आधारित परीक्षण जनरेशन, संदर्भ-आधारित रूब्रिक्स और ह्यूमन-इन-द-लूप विश्वसनीयता गेटिंग को एकीकृत करता है।

Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee2026-07-17
💬 NLP

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

यह शोध पत्र Perception-RFT प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो बिना मध्यवर्ती तर्क टोकन (intermediate reasoning tokens) के मल्टीमॉडल दस्तावेज़ प्रश्नोत्तर (multimodal document QA) पर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) लागू करता है, जो यह प्रदर्शित करता है कि प्रत्यक्ष विजुअल ग्राउंडिंग अलाइनमेंट (direct visual grounding alignment), तर्क-केंद्रित दृष्टिकोणों की तुलना में अनुमान लागत (inference costs) को 60% से अधिक कम करके और सिमेंटिक मजबूती एवं ज्यामितीय सटीकता के बीच "ग्राउंडिंग डाइवर्जेंस" (Grounding Divergence) ट्रेड-ऑफ से बचकर बेहतर प्रदर्शन करता है।

Harikrishnan P M, Goutham Vignesh, Ganesh Parab, Saisubramaniam Gopalakrishnan, Vishal Vaddina, Varun V, Rohit Agrawal2026-07-17
🤖 AI

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

यह शोध पत्र InCarEmo को प्रस्तुत करता है, जो ड्राइवर भावना पहचान, थकान का पता लगाने और व्याकुलता की निगरानी को उन्नत करने के लिए स्क्रिप्टेड इन-कैबिन परिदृश्यों से RGB, इन्फ्रारेड, ऑडियो और संवाद टेक्स्ट को एकीकृत करने वाला एक व्यापक मल्टीमॉडल डेटासेट है, जो मौजूदा विजुअल-ओनली (केवल दृश्य) डेटासेट्स की सीमाओं को संबोधित करता है।

Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen W (…)2026-07-17
🤖 AI

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

यह शोध पत्र एक डिस्टिलेशन-आधारित प्रीट्रेनिंग फ्रेमवर्क प्रस्तावित करता है जो मल्टीपल इंस्टेंस लर्निंग नेटवर्क को इनिशियलाइज़ करने के लिए स्लाइड-लेवल फाउंडेशन मॉडल्स (TITAN और CARE) को टीचर्स के रूप में उपयोग करता है, जिससे डेटा की कमी को दूर किया जा सके और 15 बेंचमार्क डेटासेट्स पर प्रदर्शन में सुधार किया जा सके, विशेष रूप से लीनियर प्रोबिंग और फ्यू-शॉट परिदृश्यों में।

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He2026-07-17
🤖 AI

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

FoMoVLA एक नवीन फ्रेमवर्क है जो विज़न-लैंग्वेज-एक्शन मॉडल्स को भविष्य के फीचर फोरसाइट (future feature foresight) और स्पार्स 2D पॉइंट ट्रैकिंग को संयुक्त रूप से सीखकर उन्नत करता है ताकि लक्ष्य भविष्यवाणी और निरंतर गति मार्गदर्शन के बीच के अंतर को पाटा जा सके, जिससे कई रोबोटिक बेंचमार्क पर अत्याधुनिक प्रदर्शन और मजबूत ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त होता है।

Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin L (…)2026-07-17
🤖 AI

Large Audio Language Models for Spoofing-Aware Speaker Verification

यह शोध पत्र स्पूफिंग-अवेयर स्पीकर वेरिफिकेशन (SASV) के लिए लार्ज ऑडियो लैंग्वेज मॉडल्स (LALMs) का व्यवस्थित रूप से मूल्यांकन करता है, जो यह दर्शाता है कि हालांकि उनमें नेटिव ज़ीरो-शॉट क्षमता का अभाव है, फिर भी कार्य-विशिष्ट अनुकूलन उन्हें प्रतिस्पर्धी प्रदर्शन प्राप्त करने और पारंपरिक मॉड्यूलर पाइपलाइनों के ऑडिट योग्य, एकीकृत विकल्पों की पेशकश करने में सक्षम बनाता है।

Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir, Artem Dvirniak, Dmitrii Korzh, Oleg Y. Rogov2026-07-17
🤖 AI

AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

यह अध्ययन प्रदर्शित करता है कि विजन-लैंग्वेज मॉडल, विशेष रूप से जब उन्हें चेन-ऑफ-थॉट प्रॉम्प्टिंग के साथ उन्नत किया जाता है, दृश्य पैटर्न पहचान का लाभ उठाकर स्ट्रीट व्यू इमेजरी से भवन टिपोलॉजी (building typologies) की भविष्यवाणी करने में लगभग 70% सटीकता प्राप्त कर सकते हैं, हालांकि वे व्यापक संदर्भ संकेतों और डोमेन ज्ञान पर कम निर्भर रहने के कारण मानव विशेषज्ञों से भिन्न होते हैं।

Zahratu Shabrina, Muhammad Asa, Jin Rui, Lu Yin, Stephen Law2026-07-17
🤖 AI

Transcoders for Investigating Deception in Language Models

यह शोधपत्र यह प्रदर्शित करता है कि ट्रांसकोडर्स (transcoders), फीचर एक्टिवेशन और इंटर-फीचर डिपेंडेंसीज़ को मैप करने के लिए एट्रिब्यूशन ग्राफ्स का निर्माण करके, भाषा मॉडलों में धोखे (deception) की प्रभावी ढंग से पहचान और विश्लेषण कर सकते हैं, जो धोखे से संबंधित फीचर्स के एक विशिष्ट डिक्शनरी को प्रकट करता है जो भ्रामक और गैर-भ्रामक आउटपुट्स के बीच अनुमानित बदलावों को संचालित करते हैं।

Darius Lim, Nathan Leow, Xin Wei Chia2026-07-17