🤖 AI

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

यह शोध पत्र AgentForesight प्रस्तुत करता है, जो एक कॉम्पैक्ट ऑनलाइन ऑडिटर वाला एक फ्रेमवर्क है जिसे नए क्यूरेटेड AFTraj-2K डेटासेट पर प्रशिक्षित किया गया है ताकि LLM-आधारित मल्टी-एजेंट सिस्टम में निर्णायक त्रुटियों की वास्तविक समय में भविष्यवाणी और स्थानीयकरण किया जा सके, जिससे पोस्ट-हॉक विफलता एट्रिब्यूशन पर निर्भर रहने के बजाय डिप्लॉयमेंट-टाइम इंटरवेंशन (तैनाती-समय हस्तक्षेप) सक्षम हो सके।

Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang2026-05-12
💻 computer science

HULK: Large-scale Hierarchical Coordination under Continual and Uncertain Temporal Tasks

यह शोध पत्र HULK को प्रस्तुत करता है, जो एक पदानुक्रमित ढांचा (hierarchical framework) है जो निरंतर उत्पन्न होने वाले और अनिश्चित टेम्पोरल कार्यों को संभालने के लिए सब-टीमों को रोलिंग टास्क असाइनमेंट के साथ डायनेमिक इंट्रा-टीम निष्पादन को इंटरलीव करके, कुशल और सुदृढ़ बड़े पैमाने पर मल्टी-एजेंट समन्वय को सक्षम बनाता है।

Qingyuan Luo, Jie Li, Meng Guo2026-05-12
🤖 machine learning

Communicating Sound Through Natural Language

यह शोध पत्र लेक्सिकल अकॉस्टिक कोडिंग (LAC) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जहाँ पूर्व-प्रशिक्षित LLM एजेंट वेवफॉर्म्स को व्याख्यात्मक अंग्रेजी टेक्स्ट विवरणों में बदलकर और उन्हें क्लोज्ड-लूप रिफाइनमेंट के माध्यम से पुनर्गठित करके ध्वनि के संचार करते हैं, जो प्रभावी रूप से प्राकृतिक भाषा को ऑडियो के लिए एक परिमित-दर (finite-rate), हानिपूर्ण (lossy) ट्रांसपोर्ट प्रतिनिधित्व के रूप में उपयोग करता है।

Emanuele Rossi, Emanuele Rodolà2026-05-12
🤖 AI

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

यह शोध पत्र TRACE का प्रस्ताव करता है, जो सुधारात्मक ट्रैजेक्टरी-स्तरीय पर्यवेक्षण की सीमाओं को दूर करने के लिए एक टर्न-अवेयर क्रेडिट असाइनमेंट फ्रेमवर्क है, जो टर्न-स्तरीय योगदान का अनुमान लगाकर और लक्षित दंड (targeted penalties) निर्धारित करके, हमले की सफलता दर में उल्लेखनीय सुधार करता है और अधिक प्रभावी मल्टी-टर्न डिफेंस अलाइनमेंट को सक्षम बनाता है।

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang2026-05-12
🤖 AI

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

ऑक्टोपस प्रोटोकॉल (Octopus Protocol) एक लैंग्वेज-मॉडल-संचालित कोडिंग एजेंट का उपयोग करके विविध हार्डवेयर के लिए टाइप किए गए कंट्रोल टूल्स को स्वचालित रूप से खोजने, इंटरफेस करने और तैनात करने के माध्यम से, एकल शेल कमांड द्वारा क्लोज्ड-लूप विजुअल-मोटर कंट्रोल को सक्षम बनाकर, AI एजेंट्स के लिए हार्डवेयर इंटीग्रेशन की इंजीनियरिंग लागत को समाप्त करता है।

Quilee Simeon, Justin M. Wei, Yile Fan2026-05-12
🤖 AI

Robust Multi-Agent LLMs under Byzantine Faults

यह शोध पत्र सेल्फ-एंकोर्ड कंसेंसस (SAC) को प्रस्तुत करता है, जो एक पूर्णतः विकेंद्रीकृत इटरेटिव फ़िल्टर-एंड-रिफ़ाइन प्रोटोकॉल है जो लार्ज लैंग्वेज मॉडल मल्टी-एजेंट सिस्टम को असुरक्षित लीडर-आधारित समन्वय या स्व-रिपोर्टेड कॉन्फिडेंस पर निर्भर रहे बिना, विविध संचार टोपोलॉजी में बायज़ेंटाइन दोषों का मजबूती से प्रतिरोध करने और विश्वसनीय प्रदर्शन बनाए रखने में सक्षम बनाता है।

Haejoon Lee, Vincent-Daniel Yun, Hyeonho Oh, Dimitra Panagou, Sai Praneeth Karimireddy2026-05-12
🤖 AI

Internal vs. External: Comparing Deliberation and Evolution for Multi-Agent Constitutional Design

यह शोध पत्र एक नियंत्रित तुलना प्रस्तुत करता है जो यह दर्शाता है कि जहाँ बाहरी विकासवादी अनुकूलन (external evolutionary optimization) प्रभावी दंड तंत्र की खोज करके सामूहिक-कार्रवाई परिवेशों में आंतरिक एजेंट विचार-विमर्श (internal agent deliberation) से काफी बेहतर प्रदर्शन करता है, वहीं यह लाभ उन विशिष्ट प्रोत्साहन स्थितियों के तहत उलट जाता है जहाँ विकास मूल्य-विनाशकारी सहयोग को मजबूर करता है, जो बहु-एजेंट संवैधानिक डिजाइन में अनुकूलन शिखरों (optimization peaks) और संरचनात्मक प्रतिक्रियाशीलता के बीच एक मौलिक व्यापार-व्यवहार (trade-off) को रेखांकित करता है।

Hershraj Niranjani, Ujwal Kumar, Phan Xuan Tan2026-05-12
🤖 AI

MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments

MCP-Cosmos एक ऐसा फ्रेमवर्क है जो जनरेटिव वर्ल्ड मॉडल्स (World Models) को मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) इकोसिस्टम में एकीकृत करता है, जिससे एजेंटों को निष्पादन से पहले एक लेटेंट स्पेस (latent space) में स्टेट ट्रांजिशन को सिम्युलेट करने और योजनाओं को परिष्कृत करने में सक्षम बनाया जाता है, जिससे जटिल कार्यों पर टूल की सफलता दर और पैरामीटर सटीकता में उल्लेखनीय सुधार होता है।

Giridhar Ganapavarapu, Dhaval Patel2026-05-12
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

यह शोध पत्र SmartEval को प्रस्तुत करता है, जो 9,000 LLM-जनित सॉलिडिटी (Solidity) अनुबंधों के एक संग्रह, एक पांच-आयामी मूल्यांकन मानदंड और एक प्रमाणित पाइपलाइन से युक्त एक व्यापक बेंचमार्क है, जो विशिष्ट विफलता मोड को प्रकट करता है और यह प्रदर्शित करता है कि LLM-जनित अनुबंध कार्यात्मक अनुपालन में ग्राउंड-ट्रुथ कार्यान्वयन से बेहतर प्रदर्शन कर सकते हैं।

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah2026-05-12
🤖 AI

CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs

CalBench मल्टी-एजेंट LLMs के लिए एक नियंत्रित मूल्यांकन वातावरण है जो समन्वय गुणवत्ता, संचार दक्षता, निष्पक्षता और गोपनीयता रिसाव को इष्टतम और बेसलाइन समाधानों के विरुद्ध सटीक रूप से मापने के लिए निजी जानकारी के साथ एक विकेंद्रीकृत कैलेंडर शेड्यूलिंग कार्य का उपयोग करता है।

Chelsea Zou, Yiheng Yao, Selena She, Robert D. Hawkins2026-05-12