🤖 machine learning

The Equilibrium Is the Initialization: Lazy Identity Collapse in Physics-Structured Deep Equilibrium Reasoning

यह शोधपत्र प्रकट करता है कि भौतिकी-संरचित डीप इक्विलिब्रियम मॉडल अक्सर "लेज़ी आइडेंटिटी कोलैप्स" (lazy identity collapse) से ग्रस्त होते हैं, जहाँ अंतर्निहित सॉल्वर इनपुट की कठिनाई के बावजूद अपने इनिशियलाइज़ेशन पर अभिसरित होकर वास्तव में कोई गणना नहीं करता है, जिससे जटिल आर्किटेक्चर सरल बेसलाइन की तुलना में अप्रभावी हो जाता है।

Joyjeet Singh2026-07-14
🤖 AI

VIA: Visual Interface Agent for Robot Control

यह शोध पत्र VIA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रोबोट को ब्राउज़र-आधारित 3D इंटरफ़ेस के माध्यम से नियंत्रित करने के लिए टास्क-विशिष्ट फाइन-ट्यूनिंग के बिना ऑफ-द-शेल्फ फाउंडेशन मॉडल्स का विजुअल इंटरफेस एजेंट के रूप में लाभ उठाता है, यह प्रदर्शित करते हुए कि फ्रंटियर एजेंट्स रोबोट नियंत्रण को एक इंटरैक्टिव सॉफ्टवेयर ऑपरेशन के रूप में मानकर जटिल मैनिपुलेशन कार्यों में उच्च ज़ीरो-शॉट सफलता दर प्राप्त कर सकते हैं।

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh2026-07-14
🤖 AI

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

यह शोध पत्र AgentFootprint को प्रस्तुत करता है जो एक ऐसा बेंचमार्क है जो यह प्रकट करता है कि LLM एजेंटों के निरंतर स्टोरेज फुटप्रिंट (persistent storage footprints) कार्य की सटीकता से स्वतंत्र रूप से विभिन्न फ्रेमवर्क और कॉन्फ़िगरेशन में नाटकीय रूप से भिन्न होते हैं, जबकि यह भी प्रदर्शित करता है कि कंटेंट-एड्रेस्ड स्टोरेज डेटा की पुनर्रचना क्षमता (data reconstructability) से समझौता किए बिना इस ओवरहेड को महत्वपूर्ण रूप से कम कर सकता है।

Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li2026-07-14
🤖 AI

AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

यह शोध पत्र AMT-X को प्रस्तुत करता है, जो एक चरण-संरचित बहु-चरण रेड-टीमिंग फ्रेमवर्क है जो स्टेट-मशीन अटैक रणनीति और चेकलिस्ट-गेटेड मूल्यांकन के साथ एक मल्टी-रोल जूरी का उपयोग करता है, जिससे यह पता चलता है कि बड़े भाषा मॉडल (LLMs) एकल-चरण, एकल-जज आकलन द्वारा अनुमानित स्तर की तुलना में अनुकूल बहु-चरण परिदृश्यों में पूर्णतः कार्यात्मक हानिकारक सामग्री उत्पन्न करने के प्रति काफी अधिक संवेदनशील हैं।

Yi Ting Shen, Kentaroh Toyoda, Alex Leung2026-07-14
🤖 AI

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP एक प्रोवेनेंस-गाइडेड क्रेडिट असाइनमेंट तंत्र पेश करके डीप-सर्च एजेंटों में रिवॉर्ड-क्रेडिट मिसमैच को संबोधित करता है जो सहायक दस्तावेजों को उनके एक्सपोजिंग एक्शन्स तक ट्रैक करता है और साइन-प्रिजर्विंग मॉड्यूलेशन के माध्यम से एडवांटेज को पुनर्वितरित करता है, जिससे कई बेंचमार्क पर GRPO बेसलाइनों की तुलना में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li2026-07-14
🤖 AI

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

यह शोध पत्र नैदानिक परिनियोजन आवश्यकताओं को प्राथमिकता देकर, एक तीन-स्तरीय स्वायत्तता वर्गीकरण को परिभाषित करके, और केवल पैरामीटर स्केलिंग के बजाय संवादात्मक प्रशिक्षण वातावरण और वास्तविक दुनिया के एकीकरण पर जोर देने वाले एक एकीकृत स्केलिंग ढांचे को स्थापित करके, चिकित्सा एजेंटों को कार्य-विशिष्ट उपकरणों से विश्वसनीय, स्व-विकसित स्वायत्त प्रणालियों में परिवर्तित करने के लिए एक रोडमैप प्रस्तावित करता है।

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Y (…)2026-07-14
🤖 AI

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

ScaleCUA एक एकीकृत ढांचा है जो VeriGen द्वारा सत्यापन योग्य कार्य संश्लेषण (verifiable task synthesis), Frontier Sampling द्वारा अनुकूलित नमूना आवंटन (optimized sample allocation) और Visual Context Segmentation द्वारा त्वरित प्रशिक्षण के माध्यम से डेटा की कमी और प्रशिक्षण अक्षमता को संबोधित करते हुए ओपन-सोर्स कंप्यूटर उपयोग एजेंटों को अत्याधुनिक प्रदर्शन तक उन्नत करता है।

Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong2026-07-14
🤖 AI

RepTran: Search-Based Repair of Transformer Models

RepTran एक खोज-आधारित मरम्मत विधि है जो उनके फीड-फॉरवर्ड नेटवर्क में संदिग्ध भार (weights) की पहचान करने के लिए एक संयुक्त विचरण-आधारित (variance-based) और द्विदिश स्कोरिंग तंत्र का उपयोग करके ट्रांसफॉर्मर मॉडल की विश्वसनीयता को बढ़ाती है, और फिर मौजूदा अत्याधुनिक दृष्टिकोणों की तुलना में काफी उच्च मरम्मत दर प्राप्त करने के लिए डिफरेंशियल इवोल्यूशन के माध्यम से उन्हें पुनरावृत्ति रूप से अनुकूलित करती है।

Yuta Ishimoto, Paolo Arcaini, Fuyuki Ishikawa, Masanari Kondo, Naoyasu Ubayashi, Yasutaka Kamei2026-07-14
🤖 AI

What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Abilities

यह शोधपत्र तर्क देता है कि LLM नियोजन प्रदर्शन एक एकल क्षमता स्पेक्ट्रम के बजाय दो विशिष्ट अंतर्निहित दक्षताओं—परिचालनात्मक तर्क (operational reasoning) और संरचनात्मक गणना (structural enumeration)—द्वारा संचालित होता है, जो यह प्रकट करता है कि जहाँ परिचालन तर्क स्केलिंग और लंबे तर्क पथों (reasoning traces) के साथ सुधारता है, वहीं संरचनात्मक गणना इन कारकों के प्रति तुलनात्मक रूप से असंवेदनशील बनी रहती है।

Sukai Huang, Chenyuan Zhang, Fucai Ke, Zhixi Cai, Naim Rastgoo, Gholamreza Haffari, Hamid Rezatofighi2026-07-14
🤖 AI

PREF-Gate: Provenance-Constrained Relational Evidence Fusion with Validation-Gated Selection for Graph Fraud Detection

PREF-Gate ग्राफ धोखाधड़ी का पता लगाने के लिए एक ऑडिट करने योग्य निर्णय ढांचा है जो प्रोवेनेंस बाधाओं के आधार पर एक लेबल-मुक्त संदर्भ विशेषज्ञ और एक लेबल-व्युत्पन्न साक्ष्य विशेषज्ञ के बीच गतिशील रूप से चयन करता है, जिससे वैध रिलेशनल साक्ष्य का उपयोग सुनिश्चित होता है और कई डेटासेट में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Liming Liu, Chao Hu, Mingfei Lu, Yiwei Ge, Xingle Li, Heyuan Shi2026-07-14