🤖 AI

Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data

यह शोध पत्र सामाजिक विज्ञान टेक्स्ट वर्गीकरण की विशिष्ट स्थितियों—जैसे कि छोटे नमूना आकार और नेस्टेड डेटा—के तहत क्लासिफायर प्रदर्शन मेट्रिक्स के लिए कॉन्फिडेंस इंटरवल विधियों का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि मानक दृष्टिकोण अक्सर गलत कवरेज प्रदान करते हैं और मशीन लर्निंग अनुप्रयोगों में पारदर्शिता और सत्यापन में सुधार के लिए एग्रेस्टी-कौल, विल्सन और पदानुक्रमित बूटस्ट्रैपिंग जैसे बेहतर विकल्पों की सिफारिश करता है।

Kylie Anglin2026-06-26
🤖 AI

CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation

CoStream एक नवीन ढांचा है जो तीन स्वतंत्र व्यवहारों—सिमेंटिक (semantic), प्रेडिक्टिव (predictive), और रिएक्टिव (reactive)—को एक एकीकृत $SE(3)$ नियंत्रण कमांड में संयोजित करके सुदृढ़, उच्च-परिशुद्धता वाले लॉन्ग-होरिज़न मैनिपुलेशन को प्राप्त करता है, जिससे कार्य-विशिष्ट कठोरता और मोनोलिथिक सामान्यीकरण के बीच के समझौते पर विजय प्राप्त होती है।

Haonan Chen, Yuxiang Ma, Stephen Tian, Xiaoshen Han, Wenlong Huang, Feiyang Wu, Yunzhu Li, Jiajun Wu, Edward H. Adelson (…)2026-06-26
💬 NLP

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

यह शोधपत्र ConflictScore प्रस्तुत करता है, जो एक नवीन मीट्रिक और बेंचमार्क है जिसे यह मापने के लिए डिज़ाइन किया गया है कि भाषा मॉडल अपने ग्राउंडिंग दस्तावेजों में विरोधाभासी साक्ष्यों को कितनी अच्छी तरह स्वीकार करते हैं, जो प्रतिक्रियाओं को परमाणु दावों (atomic claims) में विभाजित करके और सहायक एवं विरोधाभासी साक्ष्यों के बीच के अनुपात और संतुलन को मापकर किया जाता है।

Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia2026-06-26
🤖 AI

AXLE: A Cloud Infrastructure for Lean 4 Theorem Proving Utilities

यह शोध पत्र AXLE को पेश करता है, जो एक स्केलेबल, मल्टी-टेनेंट क्लाउड इंफ्रास्ट्रक्चर है जो प्रमाण हेरफेर (proof manipulation) और सत्यापन के लिए 14 से अधिक लीन 4 (Lean 4) मेटाप्रोग्रामिंग उपकरण प्रदान करता है, जो Axiom Math की एआई-संचालित गणितीय उपलब्धियों के लिए आधारभूत इंजन के रूप में कार्य करता है, जिसमें 2025 की पुतनाम प्रतियोगिता में पूर्ण अंक प्राप्त करना शामिल है।

Jimmy Xin, Alex Schneidman, Chris Cummins, Karun Ram, Srihari Ganesh, Jannis Limperg2026-06-26
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

यह शोधपत्र WatchAct प्रस्तुत करता है, जो 3,000 लॉन्ग-होराइजन इंस्टेंस वाला एक व्यापक बेंचमार्क है जो वीडियो के माध्यम से देखे गए मानवीय व्यवहार के बारे में तर्क करने की रोबोटिक मैनिपुलेशन प्रणालियों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक मॉडल उन कार्यों के लिए काफी संघर्ष करते हैं जिनमें इवेंट ग्राउंडिंग, प्रक्रियात्मक तर्क, इरादा अनुमान और एपिसोडिक ट्रैकिंग की आवश्यकता होती है।

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius2026-06-26
🧬 biology

Closing the Loop to Discover Psychological Theories with an Automated Cognitive Scientist

यह शोध पत्र AutoCog को प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त AI प्रणाली है जो प्रयोग डिजाइन, डेटा संग्रह और मॉडल संश्लेषण के पुनरावृत्ति चक्रों के माध्यम से निष्पादन योग्य संज्ञानात्मक सिद्धांतों को स्वचालित रूप से उत्पन्न करने, परीक्षण करने और परिष्कृत करने के माध्यम से संज्ञानात्मक विज्ञान में वैज्ञानिक खोज के लूप को बंद करती है, जो अंततः निर्णय लेने के संबंध में नवीन, अनुभवजन्य रूप से मान्य अंतर्दृष्टि प्रदान करती है।

Akshay K. Jagadish, Younes Strittmatter, Nori Jacoby, George Kachergis, Eric Schulz, Nathaniel Daw, Suyog H. Chandramoul (…)2026-06-26
💬 NLP

ProvenAI: Provenance-Native Traces of Evidence in Generated Answers

ProvenAI एक नया ढांचा पेश करता है जो रिट्रीवल-ऑगमेंटेड क्वेश्चन अनswering में पारदर्शिता को बढ़ाता है, इसे तीन स्वतंत्र रूप से मापने योग्य परतों—उत्तर की शुद्धता, उद्धरण निष्ठा और प्रति-दस्तावेज़ प्रभाव—में विभाजित करके, जो उद्धृत स्रोतों और वास्तव में मॉडल आउटपुट को संचालित करने वाले साक्ष्यों के बीच के महत्वपूर्ण अंतराल को उजागर करता है।

Mohammad Faizan, Dalal Alharthi2026-06-26
🤖 AI

Data-driven Machine Learning Cannot Reach Symbolic-level Logical Reasoning -- The Limit of the Scaling Law

यह शोध पत्र यह तर्क देता है कि डेटा-संचालित पर्यवेक्षित मशीन लर्निंग (supervised machine learning), प्रशिक्षण डेटा की विभेद्यता (distinguishability) और परस्पर विरोधी प्रशिक्षण लक्ष्यों में अंतर्निहित पद्धतिगत सीमाओं के कारण, प्रतीकात्मक-स्तर के तार्किक तर्क (symbolic-level logical reasoning) की कठोरता प्राप्त नहीं कर सकती है, एक ऐसा निष्कर्ष जो सैद्धांतिक विश्लेषण और उन प्रयोगात्मक साक्ष्यों द्वारा समर्थित है जो दर्शाते हैं कि GPT-5 जैसे उच्च-सटीकता वाले मॉडल भी सही तार्किक स्पष्टीकरण प्रदान करने में विफल रहते हैं।

Tiansi Dong, Mateja Jamnik, Pietro Liò2026-06-26
🤖 AI

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

यह शोध पत्र MKG-RAG-Bench प्रस्तुत करता है, जो एक नया क्रॉस-डोमेन बेंचमार्क है जिसे सामान्य और चिकित्सा डोमेन से क्यूरेटेड डेटासेट का लाभ उठाकर मल्टीमॉडल नॉलेज ग्राफ-ऑगमेंटेड जनरेशन में रिट्रीवल चुनौतियों का मूल्यांकन और निदान करने के लिए डिज़ाइन किया गया है, ताकि यह प्रदर्शित किया जा सके कि रिट्रीवल की गुणवत्ता समग्र सिस्टम प्रदर्शन का एक महत्वपूर्ण निर्धारक है।

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma2026-06-26
🤖 AI

auto-psych: Automating the science of mind using agent-driven theory discovery and experimentation

यह शोध पत्र "auto-psych" को प्रस्तुत करता है, जो एक एजेंट-संचालित प्रणाली है जो नेस्टेड लूप्स (nested loops) का उपयोग करके प्रयोगों को डिजाइन करने, क्राउडसोर्स्ड मानव डेटा एकत्र करने और ऐसी थ्योरीज़ खोजने के माध्यम से कम्प्यूटेशनल कॉग्निटिव साइंस में पूर्ण वैज्ञानिक पाइपलाइन को स्वचालित करती है जो मानव व्यवहार को समझाने में मौजूदा साहित्य से बेहतर प्रदर्शन करती हैं।

Ben Prystawski, Kushin Mukherjee, Daniel Wurgaft, Linas Nasvytis, Michael Y. Li, Noah D. Goodman, Michael C. Frank2026-06-26