🤖 AI

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

यह शोध पत्र \textsc{Ptah} को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो विश्वसनीय, उद्धरण-सत्य और विजुअल इंटरलीव्ड मल्टीमॉडल डीप रिसर्च रिपोर्ट्स तैयार करने के लिए प्लानिंग, विजुअल वर्किंग मेमोरी के साथ साक्ष्य संग्रह, और वेरीफायर-प्रवर्तित रिपोर्ट जनरेशन को ऑर्केस्ट्रेट करता है।

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Zhicheng Dou2026-05-29
🤖 AI

Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension

यह अध्ययन 2025-2026 के चार फ्रंटियर एलएलएम (LLM) एजेंटों तक विकासवादी गेम थ्योरी (evolutionary game theory) के बेंचमार्क का विस्तार करता है, जो यह प्रकट करता है कि जबकि अधिकांश मॉडलों में सहयोगात्मक पूर्वाग्रह बने रहते हैं, प्रदाता की पहचान संतुलन परिणामों को महत्वपूर्ण रूप से प्रभावित करती है और आक्रामक क्षमता समानता में आंशिक सुधार के बावजूद शोर संबंधी मजबूती (noise robustness) एक सार्वभौमिक चुनौती बनी हुई है।

Francisco León Zúñiga Bolívar (Institución Universitaria Colegio Mayor del Cauca)2026-05-29
🤖 machine learning

LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

यह शोध पत्र LaRA को प्रस्तुत करता है, जो एक लेयर-वाइज रिप्रेजेंटेशन विश्लेषण ढांचा है जो प्रवर्धित गड़बड़ी संवेदनशीलता (amplified perturbation sensitivity), दिशात्मक पतन (directional collapse) और स्थानीय कठोरता (local rigidity) जैसे ज्यामितीय विचलन की पहचान करके RL पोस्ट-ट्रेन्ड लार्ज लैंग्वेज मॉडल्स में डेटा संदूषण का पता लगाता है, जिससे यह मौजूदा आउटपुट-लेवल डिटेक्शन विधियों से बेहतर प्रदर्शन करता है।

Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim2026-05-29
🤖 machine learning

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

यह शोध पत्र PlanAhead फ्रेमवर्क प्रस्तुत करता है ताकि अनुभवजन्य रूप से यह प्रदर्शित किया जा सके कि प्राकृतिक भाषा योजना प्रतिनिधित्व (जैसे कि अनुक्रमिक उपलक्ष्य, वृत्तांत, स्यूडोकोड, या चेकलिस्ट) का चयन और अंतर्निहित LLM दोनों ही कठिन WebArena कार्यों पर मल्टीमॉडल वेब एजेंटों की मजबूती और सफलता दर को महत्वपूर्ण रूप से प्रभावित करते हैं।

Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim2026-05-29
🤖 AI

CityGen: Structure-Guided City-Style Synthesis for Cross-City Autonomous Driving

यह शोध पत्र सिटीट्रांसफर-बेंच (CityTransfer-Bench) का परिचय देता है, जो क्रॉस-सिटी सामान्यीकरण (cross-city generalization) के मूल्यांकन के लिए एक भौगोलिक रूप से विलगित (geographically disjoint) बेंचमार्क है, और सिटीजेन (CityGen) का प्रस्ताव करता है, जो एक डिफ्यूजन-आधारित जनरेटिव फ्रेमवर्क है जो विविध शहरी वातावरणों में स्वायत्त ड्राइविंग की मजबूती को बेहतर बनाने के लिए एचडी-मैप-कंडीशन्ड सिंथेसिस (HD-map-conditioned synthesis) के माध्यम से ज़ीरो-लेबल सिटी एडाप्टेशन (zero-label city adaptation) को सक्षम बनाता है।

Zezhong Qian, Zhao Yang, Lu Tan, Zhihao Yan, Weiyi Hong, Haizhuang Liu, Yawei Jueluo2026-05-29
⚡ electrical engineering

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

यह शोध पत्र HoliTok को प्रस्तुत करता है, जो एक निरंतर समग्र स्पीच टोकनाइज़ेशन मॉडल है जो उच्च-गुणवत्ता वाले ऑडियो को संक्षिप्त, सीखने योग्य लेटेंट्स (latents) में एनकोड करता है, जिससे एक एकीकृत AR+DiT आर्किटेक्चर बिना किसी अतिरिक्त अनुकूलन के उच्च-गुणवत्ता वाली स्पीच जनरेशन और रिकग्निशन दोनों को मजबूती से करने में सक्षम होता है।

Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu2026-05-29
🤖 machine learning

Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots

यह शोधपत्र Honeyval को प्रस्तुत करता है, जो LLM-संचालित HTTP हनीपॉट्स के लिए एक व्यापक मूल्यांकन ढांचा है जो AI हैकिंग एजेंटों और विविध बैकएंड अनुप्रयोगों का उपयोग करके स्केलेबल और पुनरुत्पादक परीक्षण की कमी को संबोधित करता है, और अंततः यह प्रदर्शित करता है कि LLM-आधारित हनीपॉट्स नियम-आधारित बेसलाइन की तुलना में काफी लंबे हमलावर इंटरैक्शन और कम डिटेक्शन दर प्रदान करते हैं जबकि लागत दक्षता बनाए रखते हैं।

Mark Vero, Fabian Kaczmarczyck, Ivan Petrov, Ilia Shumailov, Jamie Hayes, Niels Heinen, Tianqi Fan, Luca Invernizzi, Mar (…)2026-05-29
🤖 AI

Meta-Programming for Linear-time Temporal Answer Set Programming

यह शोध पत्र एक लचीले मेटा-प्रोग्रामिंग फ्रेमवर्क और उसके साथ आने वाले metasp सिस्टम को प्रस्तुत करता है जो clingo के थ्योरी ग्रामर को औपचारिक प्रकार विशिष्टताओं (formal type specifications) और नेस्टिंग क्षमताओं के साथ विस्तारित करता है ताकि TEL, DEL, और MEL सहित एंसेर सेट प्रोग्रामिंग (ASP) के विभिन्न टेम्पोरल एक्सटेंशन के एकीकृत, डिक्लेरेटिव कार्यान्वयन और सत्यापन को सक्षम बनाया जा सके।

Susana Hahn, Amade Nems, Javier Romero, Torsten Schaub2026-05-29
🤖 AI

Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent

यह शोधपत्र 'कम्पास' (Compass) का परिचय देता है, जो एक विशेषज्ञ-निर्देशित एलएलएम (LLM) एजेंट फ्रेमवर्क है, जिसने 2,30,000 से अधिक वैज्ञानिक शोध पत्रों से 3,751 पहले से अप्राप्य समुद्री लेड (marine lead) रिकॉर्ड्स को सफलतापूर्वक निकाला है ताकि सबसे बड़े एकीकृत समुद्री लेड डेटाबेस का निर्माण किया जा सके, और एक नॉलेज-ट्री-संचालित दृष्टिकोण के माध्यम से 92% सटीकता प्राप्त की है जो सामान्य-उद्देश्य वाले एआई (AI) और उच्च-जोखिम वाले वैज्ञानिक डेटा एकीकरण के बीच के अंतर को पाटता है।

Yiming Liu, Bin Lu, Meng Jin, Ziyuan Sang, Shuo Jiang, Lei Zhou, Xinbing Wang, Chenghu Zhou, Jing Zhang2026-05-29
🔬 physics

Evaluating Skill and Stability of ArchesWeather and ArchesWeatherGen under Multi-Decadal Climate Simulations

यह शोध पत्र प्रदर्शित करता है कि मौसम पूर्वानुमान मॉडल ArchesWeather और ArchesWeatherGen को AIMIP चरण 1 प्रोटोकॉल के तहत समुद्र की सतह के तापमान और समुद्री बर्फ के आवरण पर आधारित करके, स्थिर, दीर्घकालिक फोर्स्ड वायुमंडलीय मॉडलों में सफलतापूर्वक अनुकूलित किया जा सकता है जो ERA5 जलवायु विज्ञान, बड़े पैमाने के परिसंचरण और अंतरवार्षिक परिवर्तनशीलता को सटीक रूप से पुनरुत्पादित करते हैं।

Renu Singh, Robert Brunstein, Antonia Jost, Thomas Rackow, Claire Monteleoni, Yana Hasson, Christian Lessig, Guillaume C (…)2026-05-29