🤖 AI

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

यह शोध पत्र नैदानिक परिनियोजन आवश्यकताओं को प्राथमिकता देकर, एक तीन-स्तरीय स्वायत्तता वर्गीकरण को परिभाषित करके, और केवल पैरामीटर स्केलिंग के बजाय संवादात्मक प्रशिक्षण वातावरण और वास्तविक दुनिया के एकीकरण पर जोर देने वाले एक एकीकृत स्केलिंग ढांचे को स्थापित करके, चिकित्सा एजेंटों को कार्य-विशिष्ट उपकरणों से विश्वसनीय, स्व-विकसित स्वायत्त प्रणालियों में परिवर्तित करने के लिए एक रोडमैप प्रस्तावित करता है।

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Y (…)2026-07-14
🤖 AI

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

ScaleCUA एक एकीकृत ढांचा है जो VeriGen द्वारा सत्यापन योग्य कार्य संश्लेषण (verifiable task synthesis), Frontier Sampling द्वारा अनुकूलित नमूना आवंटन (optimized sample allocation) और Visual Context Segmentation द्वारा त्वरित प्रशिक्षण के माध्यम से डेटा की कमी और प्रशिक्षण अक्षमता को संबोधित करते हुए ओपन-सोर्स कंप्यूटर उपयोग एजेंटों को अत्याधुनिक प्रदर्शन तक उन्नत करता है।

Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong2026-07-14
🤖 AI

RepTran: Search-Based Repair of Transformer Models

RepTran एक खोज-आधारित मरम्मत विधि है जो उनके फीड-फॉरवर्ड नेटवर्क में संदिग्ध भार (weights) की पहचान करने के लिए एक संयुक्त विचरण-आधारित (variance-based) और द्विदिश स्कोरिंग तंत्र का उपयोग करके ट्रांसफॉर्मर मॉडल की विश्वसनीयता को बढ़ाती है, और फिर मौजूदा अत्याधुनिक दृष्टिकोणों की तुलना में काफी उच्च मरम्मत दर प्राप्त करने के लिए डिफरेंशियल इवोल्यूशन के माध्यम से उन्हें पुनरावृत्ति रूप से अनुकूलित करती है।

Yuta Ishimoto, Paolo Arcaini, Fuyuki Ishikawa, Masanari Kondo, Naoyasu Ubayashi, Yasutaka Kamei2026-07-14
🤖 AI

What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Abilities

यह शोधपत्र तर्क देता है कि LLM नियोजन प्रदर्शन एक एकल क्षमता स्पेक्ट्रम के बजाय दो विशिष्ट अंतर्निहित दक्षताओं—परिचालनात्मक तर्क (operational reasoning) और संरचनात्मक गणना (structural enumeration)—द्वारा संचालित होता है, जो यह प्रकट करता है कि जहाँ परिचालन तर्क स्केलिंग और लंबे तर्क पथों (reasoning traces) के साथ सुधारता है, वहीं संरचनात्मक गणना इन कारकों के प्रति तुलनात्मक रूप से असंवेदनशील बनी रहती है।

Sukai Huang, Chenyuan Zhang, Fucai Ke, Zhixi Cai, Naim Rastgoo, Gholamreza Haffari, Hamid Rezatofighi2026-07-14
🤖 AI

PREF-Gate: Provenance-Constrained Relational Evidence Fusion with Validation-Gated Selection for Graph Fraud Detection

PREF-Gate ग्राफ धोखाधड़ी का पता लगाने के लिए एक ऑडिट करने योग्य निर्णय ढांचा है जो प्रोवेनेंस बाधाओं के आधार पर एक लेबल-मुक्त संदर्भ विशेषज्ञ और एक लेबल-व्युत्पन्न साक्ष्य विशेषज्ञ के बीच गतिशील रूप से चयन करता है, जिससे वैध रिलेशनल साक्ष्य का उपयोग सुनिश्चित होता है और कई डेटासेट में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Liming Liu, Chao Hu, Mingfei Lu, Yiwei Ge, Xingle Li, Heyuan Shi2026-07-14
🤖 AI

Multi-Agent LLMs Fail to Explore Each Other

यह शोध पत्र एक मौलिक सीमा की पहचान करता है जहाँ आधुनिक LLM एजेंट मल्टी-एजेंट परिवेश में एक-दूसरे को प्रभावी ढंग से एक्सप्लोर करने में विफल रहते हैं, जिससे उप-इष्टतम समन्वय होता है, और संरचित पीयर चयन (peer selection) को स्पष्ट रूप से बढ़ावा देने के लिए मल्टी-एजेंट कॉन्टेक्स्टुअल एक्सप्लोरेशन (MACE) फ्रेमवर्क का प्रस्ताव करता है, जिससे एक्सप्लोरेशन व्यवहार और कार्य प्रदर्शन में महत्वपूर्ण सुधार होता है।

Hyeong Kyu Choi, Jiatong Li, Wendi Li, Xin Eric Wang, Sharon Li2026-07-14
🤖 AI

Valid \ne Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

यह शोध पत्र वैध लेकिन अक्षम तर्क (reasoning) के संबंध में मौजूदा चेन-ऑफ-थॉट इवैल्यूएटर्स में एक महत्वपूर्ण ब्लाइंड स्पॉट की पहचान करता है, और कई बेंचमार्क्स में सटीकता बनाए रखते हुए टोकन खपत को महत्वपूर्ण रूप से कम करने के लिए प्रशिक्षण-मुक्त CAID मेट्रिक और PACE कंप्रेशन रणनीति पेश करता है।

Daeyeop Lee, Hwanjo Yu2026-07-14
💬 NLP

Enhancing LLMs through human feedback: a journey towards self-improvement

यह शोध पत्र एक नवीन ह्यूमन-इन-द-लूप कार्यप्रणाली प्रस्तावित करता है जो निरंतर उपयोगकर्ता फीडबैक के माध्यम से एक प्राथमिक RAG सिस्टम के प्रदर्शन को पुनरावृत्ति से परिष्कृत करने के लिए एक सहायक फीडबैक RAG सिस्टम को एकीकृत करता है, जो LLM-एज़-अ-जज मूल्यांकन के माध्यम से विविध बेंचमार्क में सटीकता और प्रासंगिकता में महत्वपूर्ण सुधार प्रदर्शित करता है।

Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon2026-07-14
🤖 AI

Towards Predictive, Aligned, and Scalable Robot Learning

यह शोध पत्र Lumo-2 को प्रस्तुत करता है, जो एक हल्का लेटेंट वर्ल्ड-एक्शन मॉडल है, जो लेटेंट स्पेस को व्यवस्थित करने और क्रिया (actions), विज़न और भाषा के बीच क्रॉस-मोडल निरंतरता सुनिश्चित करने के लिए एक मल्टी-स्टेज प्री-अलाइनमेंट रणनीति का उपयोग करके जटिल वास्तविक दुनिया के कार्यों पर बेहतर प्रेडिक्टिव रीजनिंग और कंट्रोल प्रदर्शन प्राप्त करता है।

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang2026-07-14
🤖 AI

Efficient Test-Time Optimization for Multi-Agent Proof Autoformalization

यह शोध पत्र ToMap का परिचय देता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो प्रूफ डिकम्पोज़िशन (प्रमाण अपघटन) चरण को महत्वपूर्ण बाधा के रूप में पहचानकर और औपचारिक सत्यापन (फॉर्मल वेरिफिकेशन) एवं सिमेंटिक रूब्रिक्स का उपयोग करके इसे पुनरावृत्ति से परिष्कृत करके टेस्ट-टाइम कंप्यूट को अनुकूलित करता है, जिससे ProofFlowBench पर फुल-प्रूफ ऑटोफॉर्मलाइजेशन की सटीकता और दक्षता में महत्वपूर्ण सुधार प्राप्त होता है।

Tian-Shuo Liu, Shiyuan Zhang, Zijie Geng, Haoyu Liu, Runjie Xu, Pengyuan Wang, Lei Yuan, Yang Yu2026-07-14