🤖 AI

The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities

यह शोध पत्र AI कोडिंग एजेंट निष्पादन सुरक्षा पर 39 बिखरे हुए अध्ययनों को 17 श्रेणियों में व्यवस्थित करता है ताकि पांच महत्वपूर्ण क्रॉस-कटिंग अनुसंधान अंतराल की पहचान की जा सके—जिसमें आइसोलेशन आर्किटेक्चर के लिए तुलनात्मक बेंचमार्क की कमी से लेकर पॉलिसी-ऑथरिंग त्रुटियों और TOCTOU कमजोरियों के अनसुलझे जोखिमों तक शामिल हैं—जिससे इस खंडित क्षेत्र के लिए एक समर्पित अनुसंधान एजेंडा स्थापित होता है।

Mohammadreza Rashidi2026-07-08
🤖 AI

Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations

यह शोध पत्र प्रदर्शित करता है कि मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) में एक महत्वपूर्ण अप्रूवल-व्यू फिडेलिटी गैप (approval-view fidelity gap) मौजूद है जहाँ यूनिकोड TAG-ब्लॉक एनकोडिंग हमलावरों को टूल मेटाडेटा के भीतर दुर्भावनापूर्ण पेलोड को छिपाने की अनुमति देता है, जिससे वे मानव समीक्षा और क्लाइंट-साइड सैनिटाइज़र को बायपास करते हुए छिपे हुए कंटेंट को कई स्वतंत्र सर्वर कार्यान्वयनों के माध्यम से सीधे मॉडल के कॉन्टेक्स्ट तक पहुँचा सकते हैं।

Mohammadreza Rashidi2026-07-08
🤖 AI

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD एक औद्योगिक-स्तरीय CAD एजेंट है जो अस्पष्ट प्राकृतिक भाषा के संकेतों और विशेषज्ञ प्रक्रियात्मक डेटा को बेहतर सटीकता और मजबूती के साथ उत्पादन-तैयार, संपादन योग्य B-Rep मॉडल में बदलने के लिए विशेषज्ञ-आधारित ज्ञान डिस्टिलेशन (expert-grounded knowledge distillation) और एक निष्पादन योग्य मध्यवर्ती प्रतिनिधित्व (executable intermediate representation - CAD-IR) का लाभ उठाता है।

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, J (…)2026-07-08
🤖 AI

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

लेगाटो 2 (Legato 2) एक नवीन, सिस्टम-दर-सिस्टम न्यूरल पाइपलाइन पेश करता है जो टेक्स्ट को समाहित करते हुए प्रतीकात्मक प्रतिलेखन (symbolic transcriptions) उत्पन्न करके और मल्टीमॉडल एकीकरण के माध्यम से डाउनस्ट्रीम म्यूजिकल डॉक्यूमेंट अंडरस्टैंडिंग को बढ़ाकर ऑप्टिकल म्यूजिक रिकग्निशन में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith2026-07-08
🤖 AI

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

यह शोध पत्र 27 अध्ययनों के निष्कर्षों को संश्लेषित करते हुए लार्ज लैंग्वेज मॉडल एजेंटों में छह आवर्ती विफलता समूहों (failure clusters) का एक एकीकृत वर्गीकरण प्रस्तावित करता है, जो यह प्रकट करता है कि व्यक्तिगत उप-कार्यों पर प्रदर्शन अक्सर टूल के उपयोग, योजना, दीर्घ-अवधि तर्क (long-horizon reasoning), समन्वय, सुरक्षा और मापन वैधता में संचयी त्रुटियों के कारण विश्वसनीय एंड-टू-एंड सफलता में परिवर्तित नहीं हो पाता है।

Wael Albayaydh, Rui Zhao, Ivan Flechais2026-07-08
🤖 AI

Controlling Tool Use with Heading-Specific Activation Steering

यह शोध पत्र प्रदर्शित करता है कि जबकि हेडिंग-एंकर (heading-anchors) से निकाले गए स्टीयरिंग वेक्टर्स (steering vectors) बड़े भाषा मॉडलों में टूल इवोकेशन (tool invocation) को प्रभावी ढंग से नियंत्रित कर सकते हैं, ज्यामितीय विश्लेषण यह प्रकट करता है कि इन वेक्टर्स में पैरामीट्रिक अवधारणाओं की विशिष्ट स्वच्छ रैखिक संरचना का अभाव है, और इसके बजाय वे विसरित, द्वि-आयामी संरेखण (bimodal alignments) और विभिन्न टूल प्रकारों के लिए विशिष्ट हस्ताक्षरों को प्रदर्शित करते हैं जो बाहरी टूल्स की गैर-पैरामीट्रिक प्रकृति को दर्शाते हैं।

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang2026-07-08
🤖 AI

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

TurnOPD एक नवीन ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो एडेप्टिव रोलआउट-डेप्थ बजटिंग और प्रोग्रेसिव टर्न-नॉर्मलाइज्ड लॉस वेटिंग को पेश करके लॉन्ग-होरइजन लैंग्वेज एजेंट्स के प्रशिक्षण की दक्षता को बढ़ाता है, ताकि वे वैनिला OPD में निहित संसाधन अपव्यय और प्रशिक्षण असंतुलन को दूर कर सकें।

Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen2026-07-08
🤖 AI

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

यह अध्ययन प्रदर्शित करता है कि एक ही वंश (lineage) के बड़े भाषा मॉडलों के भीतर, रिफ्यूज़ल तंत्र (अब्लेशन) को हटाने से उनके संरेखित (aligned) समकक्षों की तुलना में सॉफ्टवेयर भेद्यता विश्लेषण कार्यों—जैसे पैच सत्यापन और कोड स्थानीयकरण—के लिए उनकी व्यावहारिक उपयोगिता में महत्वपूर्ण वृद्धि होती है, जो यह रेखांकित करता है कि सुरक्षा मूल्यांकनों को प्रतिक्रिया की इच्छा, शुद्धता और कार्यक्षमता का संयुक्त रूप से आकलन करने की आवश्यकता है।

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng2026-07-08
🤖 machine learning

Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns

यह शोध पत्र TENSOR को प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड (unsupervised) फ्रेमवर्क है जो टेम्पोरल पॉइंट प्रोसेस (Temporal Point Processes) के माध्यम से उपयोगकर्ताओं के समन्वित टेम्पोरल व्यवहारों को मॉडल करके और उनके टेक्स्टुअल कंटेंट के लार्ज लैंग्वेज मॉडल (LLM) विश्लेषण से प्राप्त मात्रात्मक स्कोर के साथ इन संकेतों को परिष्कृत करके सूचना परिचालन (information operations) उपयोगकर्ताओं का पता लगाता है, जिससे यह वास्तविक दुनिया के डेटासेट पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Sishun Liu, Sajal Halder, Ke Deng, Yan Wang, Xiuzhen Zhang2026-07-08
🤖 AI

Think Before You Grid-Search: Floor-First Triage for LLM Serving

यह शोध पत्र "फ्लोर-फर्स्ट ट्राइएज" (Floor-First Triage) का प्रस्ताव करता है, जो एक कंपोजिशनल, एस्टीमेशन-ड्रिवन वर्कफ़्लो है जो एलएलएम (LLM) डिकोडिंग को पांच-आयामी संसाधन वेक्टर के रूप में मॉडल करता है ताकि भारी प्रोफाइलिंग या ग्रिड सर्च का सहारा लिए बिना प्रदर्शन सीमाओं को विश्लेषणात्मक रूप से निर्धारित किया जा सके और बाइंडिंग बाधाओं की पहचान की जा सके, जिससे विविध ऑपरेटिंग पॉइंट्स के लिए कंप्यूटेबल लेआउट निर्णय सक्षम हो सकें।

Yihua Liu2026-07-08✓ Author reviewed