🤖 AI

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

यह शोध पत्र कंप्यूटर-उपयोग एजेंटों के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो शोर वाले रिवॉर्ड सिग्नल्स (noisy reward signals) उत्पन्न करने के लिए स्वायत्त विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिन्हें फिर एक नॉइज़-अवेयर एस्टीमेटर के माध्यम से सुधारा जाता है ताकि विविध डेस्कटॉप वातावरणों में कार्य सफलता दरों को महत्वपूर्ण रूप से सुधारा जा सके।

Marta Sumyk, Oleksandr Kosovan2026-06-24
💬 NLP

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

यह शोध पत्र तुर्की स्कैम कॉल्स के पहले सार्वजनिक बहु-मोडल डेटासेट को प्रस्तुत करता है और सात लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिसमें यह पाया गया कि कम-संसाधन वाली भाषाओं में फोन स्कैम का पता लगाने के लिए ट्रांसक्रिप्ट-आधारित इनपुट, कच्चे ऑडियो प्रोसेसिंग की तुलना में लगातार बेहतर प्रदर्शन करते हैं।

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu2026-06-24
🤖 AI

Governed Shared Memory for Multi-Agent LLM Systems

यह शोध पत्र MemClaw को प्रस्तुत करता है, जो एक प्रोडक्शन मल्टी-टेनेंट मेमोरी सर्विस है जो मल्टी-एजेंट LLM सिस्टम में महत्वपूर्ण विफलता मोडों को संबोधित करने के लिए गवर्नड शेयर्ड मेमोरी प्रिमिटिव्स को लागू करती है, जबकि यह ArgusFleet इवैल्यूएशन हारनेस का उपयोग करके एसिमेट्रिक स्कोप एनफोर्समेंट और पाइपलाइन ऑर्डरिंग कॉन्फ्लिक्ट्स जैसी वास्तविक दुनिया की आर्किटेक्चरल चुनौतियों को उजागर करता है जिन्हें केवल डिज़ाइन-ओनली दृष्टिकोण अक्सर मिस कर देते हैं।

Yanki Margalit, Nurit Cohen-Inger, Erni Avram, Ran Taig, Oded Margalit2026-06-24
🤖 AI

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

यह शोध पत्र एक नियंत्रित बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि GUI एजेंट वर्तमान में बेहतर इंटरैक्शन विश्वसनीयता के कारण CLI एजेंटों से बेहतर प्रदर्शन करते हैं, CLI प्रदर्शन अंतराल मुख्य रूप से अपूर्ण कौशल कवरेज (incomplete skill coverage) द्वारा संचालित है न कि अंतर्निहित मॉडल सीमाओं द्वारा, क्योंकि सत्यापनकर्ता-निर्देशित कौशल संवर्धन (verifier-guided skill augmentation) CLI सफलता दर को महत्वपूर्ण रूप से बढ़ाता है।

Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao2026-06-24
🤖 AI

Quant Convergence: Bridging Classical Value Investing and Modern Factor Models for Systematic Equity Selection

यह शोध प्रदर्शित करता है कि बेंजामिन ग्राहम के क्लासिक वैल्यू इन्वेस्टिंग सिद्धांतों को आधुनिक फैक्टर मॉडल्स के साथ एकीकृत करना प्रभावी रूप से एक जोखिम-नियंत्रण तंत्र के रूप में कार्य करता है, जिससे एक हाइब्रिड रैंडम फॉरेस्ट रणनीति चार साल की अवधि में ऑटोग्लून (AutoGluon) जैसे जटिल एआई मॉडल्स की तुलना में काफी कम ड्रॉडाउन के साथ बेहतर रिटर्न प्रदान करते हुए उत्कृष्ट प्रदर्शन करने में सक्षम होती है।

Augusto Eiji Yamazaki, Hugo Garrido-Lestache Belinchon2026-06-24
🤖 AI

LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

यह शोध पत्र प्रकट करता है कि कानूनी सहायता के लिए लक्षित छोटे, ऑन-प्रिमाइसेस (on-premises) LLMs, अधिकार-शैली वाले भूमिका उपसर्गों (authority-style role prefixes) के साथ प्रॉम्प्ट किए जाने पर अत्यधिक बढ़ी हुई ओवररिफ्यूजल (overrefusal) दरों—20 गुना तक अधिक—का प्रदर्शन करते हैं, जो वास्तविक संस्थागत संदर्भों में उनकी अस्थिरता और पूर्वाग्रह की संभावना को उजागर करता है।

Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David, Andrei Kucharavy2026-06-24
🤖 AI

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench एक स्वचालित रेड-टीमिंग पाइपलाइन है जो संरचित उत्परिवर्तन ऑपरेटरों (mutation operators) के माध्यम से प्रतिकूल प्रॉम्प्ट (adversarial prompts) उत्पन्न करती है और एक मल्टी-जज पुष्टिकरण प्रणाली के माध्यम से विफलताओं को मान्य करती है, जिससे यह पता चलता है कि उत्परिवर्तन की प्रभावशीलता कार्य श्रेणी के अनुसार भिन्न होती है जबकि प्रतिकूल प्रॉम्प्ट मजबूत क्रॉस-मॉडल स्थानांतरणीयता प्रदर्शित करते हैं।

Khanak Khandelwal (Indian Institute of Technology Jodhpur)2026-06-24
🤖 AI

ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning

यह शोध पत्र ASALT को प्रस्तुत करता है, जो एक मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) विधि है जो अवलोकन-स्तर (ऑब्जर्वेशन-लेवल) और अवस्था-स्तर (स्टेट-लेवल) के एडेप्टरों का उपयोग करती है ताकि बेमेल स्रोत और लक्ष्य डोमेन को एक साझा एम्बेडिंग स्पेस में मैप किया जा सके, जिससे प्रभावी ज्ञान हस्तांतरण संभव हो सके और भिन्न अवस्था-स्थान विमाओं (स्टेट-स्पेस डाइमेंशनलिटीज़) वाले वातावरणों में नकारात्मक हस्तांतरण को कम किया जा सके।

Anurag Akula, Satheesh K. Perepu, Abhishek Sarkar, Kaushik Dey2026-06-24
🤖 AI

Uncertainty-Aware Longitudinal Forecasting of Alzheimer's Disease Progression Using Deep Learning

यह शोध पत्र अल्जाइमर रोग की प्रगति के बहु-क्षितिज (multi-horizon), अनिश्चितता-जागरूक अनुदैर्ध्य पूर्वानुमान उत्पन्न करने के लिए एक टेम्पोरल फ्यूजन ट्रांसफार्मर और मिश्रण घनत्व नेटवर्क (Mixture Density Network) का उपयोग करने वाले एक संभाव्य गहन शिक्षण ढांचे का प्रस्ताव करता है, जो प्रभावी रूप से रोग-चरण क्रम को कैप्चर करता है और नैदानिक विश्वसनीयता में सुधार के लिए एलियटोरिक (aleatoric) और एपिस्टेमिक (epistemic) अनिश्चितता के बीच अंतर करता है।

Arya Hariharan, Shreyank N Gowda, Anala M R2026-06-24
📊 statistics

Infinitesimal Causality

यह शोध पत्र फ्रोबेनियस मार्कोव श्रेणियों (Frobenius Markov categories) में सूक्ष्मतः कारणता (infinitesimal causality) के लिए एक श्रेणीगत ढांचा प्रस्तुत करता है, जहाँ हस्तक्षेपों (interventions) को कॉपी/डिस्कार्ड संरचनाओं के स्पर्शरेखीय विरूपण (tangent deformations) के रूप में मॉडल किया गया है और कारण पर्याप्तता (causal sufficiency) को बीजगणितीय फ्रोबेनियस ऑपरेशन्स और ज्यामितीय समाकलनीयता स्थितियों (geometric integrability conditions) के बीच अनुकूलता द्वारा परिभाषित किया गया है, जिससे पर्ल के डू-कैलकुलस (Pearl's do-calculus) के लिए एक ली-सैद्धांतिक (Lie-theoretic) आधार प्राप्त होता है।

Sridhar Mahadevan2026-06-24