🤖 AI

DeltaMCP: Incremental Regeneration via Spec-Aware Transformation for MCP servers

डेल्टाएमसीपी (DeltaMCP) एक स्पेसिफिकेशन-जागरूक टूल है जो ओपनएपीआई (OpenAPI) स्पेसिफिकेशन्स में बदलाव होने पर केवल प्रभावित घटकों को अपडेट करके एंटरप्राइज-ग्रेड एमसीपी (MCP) सर्वरों के क्रमिक पुनरुत्पादन (incremental regeneration) को सक्षम बनाता है, जिससे पूर्ण पुनरुत्पादन विधियों की तुलना में डेवलपर ओवरहेड कम होता है और रखरखाव में सुधार होता है।

Aditya Pujara, Xiaogang Zhu, Hsiang-Ting Chen2026-05-28
🤖 AI

OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

यह शोध पत्र OR-Space को प्रस्तुत करता है, जो एक पूर्ण-जीवनचक्र कार्यक्षेत्र बेंचमार्क है जिसे मॉडल निर्माण, संशोधन और निरंतर, बहु-कलाकृति (multi-artifact) वातावरण के भीतर आधारित स्पष्टीकरण वाले यथार्थवादी, बहु-चरणीय कार्यों में औद्योगिक अनुकूलन एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो पारंपरिक वन-शॉट समस्या सूत्रीकरण मूल्यांकनों से आगे बढ़ता है।

Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye2026-05-28
🤖 AI

Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

यह शोध पत्र CSMR को प्रस्तुत करता है, जो एक मल्टीमॉडलल रीजनिंग फ्रेमवर्क है जो एक संज्ञानात्मक शेड्यूलिंग तंत्र (cognitive scheduling mechanism) का उपयोग करके सटीकता को बढ़ाता है, जहाँ एक लैंग्वेज मॉडल गतिशील रूप से यह निर्णय लेता है कि कार्य-प्रासंगिक साक्ष्य प्राप्त करने के लिए एक स्वतंत्र विजुअल परसेप्शन मॉड्यूल को कब आमंत्रित किया जाए, जिससे मौजूदा दृष्टिकोणों में मौजूद स्टैटिक कन्वर्जन और भाषाई प्रभुत्व की सीमाओं को दूर किया जा सके।

Yang Zhang, Xiaoshuai Sun, Rui Zhao, Wujin Sun, Yidong Chen, Jiayi Ji, Qian Chen, Rongrong Ji2026-05-28
🤖 AI

Performance and Explainability Requirements of Evolutionary Algorithms in Real-World Physics-Informed Optimization

यह शोध पत्र पांच डोमेन-विशिष्ट समस्याओं का विवरण देकर, विश्वास निर्माण के लिए प्रदर्शन और व्याख्यात्मकता हेतु विशेषज्ञ आवश्यकताओं को रेखांकित करके, और इस अंतर को पाटने के लिए मौजूदा लेकिन कम उपयोग की जाने वाली तकनीकों का प्रस्ताव देकर, विकासवादी गणना (इवोल्यूशनरी कंप्यूटेशन) और वास्तविक दुनिया के भौतिकी-आधारित अनुकूलन के बीच के अंतराल को संबोधित करता है।

Helena Stegherr, Michael Heider, Nils Meyer, Tobias Thummerer, Thomas Wendler, Pierre Aublin, Ennio Idrobo-Àvila, Lars M (…)2026-05-28
💬 NLP

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

यह शोध पत्र BenGER को प्रस्तुत करता है, जो जर्मन कानून में उपसमूह-आधारित (subsumption-based) कानूनी तर्क के मूल्यांकन के लिए LLMs हेतु एक व्यापक बेंचमार्क डेटासेट है, जो यह प्रदर्शित करता है कि क्लोज्ड-फ्लैगशिप मॉडल प्रदर्शन में अग्रणी हैं जबकि मानव-AI सह-सृजन (co-creation) बिना सहायता वाले मानव कार्य से काफी बेहतर प्रदर्शन करता है, और इन सभी की पुष्टि एक सुदृढ़ LLM-as-a-Judge ढांचे के माध्यम से की गई है।

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, So (…)2026-05-28
🤖 AI

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

यह शोध पत्र मल्टी-हॉप ऑडियो-विजुअल रीजनिंग के लिए एक बेंचमार्क के रूप में MOV-Bench प्रस्तुत करता है, और एक कुशल एजेंटिक फ्रेमवर्क AOP-Agent का प्रस्ताव देता है जो बिना किसी अतिरिक्त प्रशिक्षण के सक्रिय ओम्नी-मोडल धारणा (active omni-modal perception) के माध्यम से ओपन-सोर्स ओम्नी-LLMs की तर्क क्षमताओं को बढ़ाता है।

Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang2026-05-28
🤖 AI

Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

यह शोध पत्र "स्लीपर अटैक" (Sleeper Attack) को पेश करता है, जो एक नवीन सुरक्षा खतरा है जहाँ एक LLM एजेंट के बाहरी वातावरण में इंजेक्ट की गई प्रतिकूल सामग्री उसके स्टेट (जैसे कि मेमोरी या कॉन्टेक्स्ट) में इंटरैक्शन के दौरान बनी रहती है ताकि बाद में निर्दोष प्रश्नों के माध्यम से हानिकारक व्यवहारों को ट्रिगर किया जा सके, जो यह प्रदर्शित करता है कि वर्तमान एजेंट एकल-इंटरैक्शन परीक्षण के तहत सुरक्षित दिखने के बावजूद भी असुरक्षित बने रहते हैं।

Yongxiang Li, Moxin Li, Zhixin Ma, Fengbin Zhu, Dongrui Liu, Wenjie Wang, Fuli Feng2026-05-28
💬 NLP

Pruning and Distilling Mixture-of-Experts into Dense Language Models

यह शोध पत्र एक नवीन ढांचे (framework) को प्रस्तुत करता है जो प्रशिक्षित मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) मॉडलों को स्कोरिंग, चयन और विशेषज्ञों के समूहीकरण के बाद नॉलेज डिस्टिलेशन के माध्यम से मानक डेंस आर्किटेक्चर में परिवर्तित करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण सटीकता और प्रशिक्षण दक्षता में पारंपरिक डेंस-टू-डेंस प्रूनिंग की तुलना में काफी बेहतर प्रदर्शन करता है।

Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho2026-05-28
🤖 AI

Learning When to Optimize: Verified Optimization Skills from Expert GPU-Kernel Lineages

यह शोधपत्र KLineage प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो वैलिडेशन-गेटेड सरलीकरणों (validation-gated simplifications) के माध्यम से पीछे की ओर चलते हुए विशेषज्ञ GPU कर्नेल से सत्यापित अनुकूलन कौशल (verified optimization skills) निकालता है, जिससे LLM-आधारित एजेंटों को न केवल यह सीखने में सक्षम बनाया जाता है कि कौन से अनुकूलन लागू करने हैं, बल्कि यह भी कि वे कब सुरक्षित हैं, जिससे वे कर्नेल गुणवत्ता और दक्षता में मेमोरी-आधारित बेसलाइन से बेहतर प्रदर्शन करते हैं।

Shuoming Zhang, Qiuchu Yu, Yangyu Zhang, Ruiyuan Xu, Xiyu Shi, Guangli Li, Xiaobing Feng, Huimin Cui, Jiacheng Zhao2026-05-28
🤖 AI

When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?

यह शोध पत्र टूल-यूज़ (tool-use) एलएलएम (LLM) एजेंटों के लिए मल्टी-ट्रैजेक्टरी इन्फरेंस (multi-trajectory inference) का मूल्यांकन करने हेतु एक एकीकृत ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि मेमोरी विधियों की प्रभावशीलता उपयोग की जाने वाली इन्फरेंस रणनीति पर अत्यधिक निर्भर है, जिसमें रिफ्लेक्शन (reflection), विदिन-एक्सपेंशन इंजेक्शन (within-expansion injection), और एटॉमिक फैक्ट एक्सट्रैक्शन (atomic fact extraction) जैसी विशिष्ट तकनीकें क्रमशः एमसीटीएस (MCTS), बीम सर्च (beam search), और पुन: प्रयोज्य संरचना (reusable structure) वाले कार्यों के तहत ही विशिष्ट लाभ प्रदान करती हैं।

Xinzhe Li, Yaguang Tao2026-05-28