🤖 AI

AXLE: A Cloud Infrastructure for Lean 4 Theorem Proving Utilities

यह शोध पत्र AXLE को पेश करता है, जो एक स्केलेबल, मल्टी-टेनेंट क्लाउड इंफ्रास्ट्रक्चर है जो प्रमाण हेरफेर (proof manipulation) और सत्यापन के लिए 14 से अधिक लीन 4 (Lean 4) मेटाप्रोग्रामिंग उपकरण प्रदान करता है, जो Axiom Math की एआई-संचालित गणितीय उपलब्धियों के लिए आधारभूत इंजन के रूप में कार्य करता है, जिसमें 2025 की पुतनाम प्रतियोगिता में पूर्ण अंक प्राप्त करना शामिल है।

Jimmy Xin, Alex Schneidman, Chris Cummins, Karun Ram, Srihari Ganesh, Jannis Limperg2026-06-26
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

यह शोधपत्र WatchAct प्रस्तुत करता है, जो 3,000 लॉन्ग-होराइजन इंस्टेंस वाला एक व्यापक बेंचमार्क है जो वीडियो के माध्यम से देखे गए मानवीय व्यवहार के बारे में तर्क करने की रोबोटिक मैनिपुलेशन प्रणालियों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक मॉडल उन कार्यों के लिए काफी संघर्ष करते हैं जिनमें इवेंट ग्राउंडिंग, प्रक्रियात्मक तर्क, इरादा अनुमान और एपिसोडिक ट्रैकिंग की आवश्यकता होती है।

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius2026-06-26
🧬 biology

Closing the Loop to Discover Psychological Theories with an Automated Cognitive Scientist

यह शोध पत्र AutoCog को प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त AI प्रणाली है जो प्रयोग डिजाइन, डेटा संग्रह और मॉडल संश्लेषण के पुनरावृत्ति चक्रों के माध्यम से निष्पादन योग्य संज्ञानात्मक सिद्धांतों को स्वचालित रूप से उत्पन्न करने, परीक्षण करने और परिष्कृत करने के माध्यम से संज्ञानात्मक विज्ञान में वैज्ञानिक खोज के लूप को बंद करती है, जो अंततः निर्णय लेने के संबंध में नवीन, अनुभवजन्य रूप से मान्य अंतर्दृष्टि प्रदान करती है।

Akshay K. Jagadish, Younes Strittmatter, Nori Jacoby, George Kachergis, Eric Schulz, Nathaniel Daw, Suyog H. Chandramoul (…)2026-06-26
💬 NLP

ProvenAI: Provenance-Native Traces of Evidence in Generated Answers

ProvenAI एक नया ढांचा पेश करता है जो रिट्रीवल-ऑगमेंटेड क्वेश्चन अनswering में पारदर्शिता को बढ़ाता है, इसे तीन स्वतंत्र रूप से मापने योग्य परतों—उत्तर की शुद्धता, उद्धरण निष्ठा और प्रति-दस्तावेज़ प्रभाव—में विभाजित करके, जो उद्धृत स्रोतों और वास्तव में मॉडल आउटपुट को संचालित करने वाले साक्ष्यों के बीच के महत्वपूर्ण अंतराल को उजागर करता है।

Mohammad Faizan, Dalal Alharthi2026-06-26
🤖 AI

Data-driven Machine Learning Cannot Reach Symbolic-level Logical Reasoning -- The Limit of the Scaling Law

यह शोध पत्र यह तर्क देता है कि डेटा-संचालित पर्यवेक्षित मशीन लर्निंग (supervised machine learning), प्रशिक्षण डेटा की विभेद्यता (distinguishability) और परस्पर विरोधी प्रशिक्षण लक्ष्यों में अंतर्निहित पद्धतिगत सीमाओं के कारण, प्रतीकात्मक-स्तर के तार्किक तर्क (symbolic-level logical reasoning) की कठोरता प्राप्त नहीं कर सकती है, एक ऐसा निष्कर्ष जो सैद्धांतिक विश्लेषण और उन प्रयोगात्मक साक्ष्यों द्वारा समर्थित है जो दर्शाते हैं कि GPT-5 जैसे उच्च-सटीकता वाले मॉडल भी सही तार्किक स्पष्टीकरण प्रदान करने में विफल रहते हैं।

Tiansi Dong, Mateja Jamnik, Pietro Liò2026-06-26
🤖 AI

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

यह शोध पत्र MKG-RAG-Bench प्रस्तुत करता है, जो एक नया क्रॉस-डोमेन बेंचमार्क है जिसे सामान्य और चिकित्सा डोमेन से क्यूरेटेड डेटासेट का लाभ उठाकर मल्टीमॉडल नॉलेज ग्राफ-ऑगमेंटेड जनरेशन में रिट्रीवल चुनौतियों का मूल्यांकन और निदान करने के लिए डिज़ाइन किया गया है, ताकि यह प्रदर्शित किया जा सके कि रिट्रीवल की गुणवत्ता समग्र सिस्टम प्रदर्शन का एक महत्वपूर्ण निर्धारक है।

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma2026-06-26
🤖 AI

auto-psych: Automating the science of mind using agent-driven theory discovery and experimentation

यह शोध पत्र "auto-psych" को प्रस्तुत करता है, जो एक एजेंट-संचालित प्रणाली है जो नेस्टेड लूप्स (nested loops) का उपयोग करके प्रयोगों को डिजाइन करने, क्राउडसोर्स्ड मानव डेटा एकत्र करने और ऐसी थ्योरीज़ खोजने के माध्यम से कम्प्यूटेशनल कॉग्निटिव साइंस में पूर्ण वैज्ञानिक पाइपलाइन को स्वचालित करती है जो मानव व्यवहार को समझाने में मौजूदा साहित्य से बेहतर प्रदर्शन करती हैं।

Ben Prystawski, Kushin Mukherjee, Daniel Wurgaft, Linas Nasvytis, Michael Y. Li, Noah D. Goodman, Michael C. Frank2026-06-26
🤖 machine learning

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

यह शोध पत्र प्रदर्शित करता है कि डेडिकेटेड फीचर क्रॉसकोडर्स (DFC), Qwen2.5-3B में RL-प्रेरित (RL-induced) फीचर्स के एक संक्षिप्त सेट को अलग कर सकते हैं जो न केवल टूल-कॉलिंग की सटीकता में महत्वपूर्ण सुधार करते हैं बल्कि इन एजेंटिक क्षमताओं को एक फ्रोजन बेस मॉडल में स्थानांतरित करने में भी सक्षम बनाते हैं, जिससे रिट्रेनिंग-मुक्त व्यवहार नियंत्रण सुगम होता है।

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman2026-06-26
🤖 machine learning

Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks

यह शोध पत्र 'रिट्रीवल-वॉर्मड एनर्जी-बेस्ड रीजनिंग' (RW-EBR) और एक नवीन पांच-आर्म एब्लेशन पद्धति प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि क्लास-प्रायर बायस या स्टोकेस्टिक वार्म-स्टार्टिंग के बजाय, प्रति-ग्राफ संरेखण (per-graph alignment), ग्राफ रीचेबिलिटी और सुडोकू जैसे संरचित कार्यों पर डिफ्यूजन-आधारित रीजनिंग में प्रदर्शन वृद्धि को चलाने वाला प्रमुख कारक है, साथ ही की-क्वालिटी (key quality) जैसे विशिष्ट परिनियोजन बाधाओं की भी पहचान करता है।

Libo Sun, Po-Wei Harn, Zewei Zhang, Peixiong He, Xiao Qin2026-06-26
💬 NLP

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

यह शोध पत्र आउट-ऑफ-बैंड एलएलएम (LLM) एजेंट सुरक्षा प्रणालियों के मूल्यांकन के लिए एक संरचित ढांचे का प्रस्ताव करता है, एक अनुकूली हमला प्रोटोकॉल के माध्यम से यह प्रदर्शित करता है कि प्रोजेंट (Progent) प्रणाली एक स्व-होस्ट किए गए एजेंट पर प्रॉम्प्ट इंजेक्शन की सफलता दर को काफी कम कर देती है, और यह तर्क देता है कि इन-बैंड डिटेक्शन की तुलना में नियत बाहरी प्रवर्तन (deterministic external enforcement) अधिक सुदृढ़ सुरक्षा स्थिति प्रदान करता है।

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu2026-06-26