🤖 AI

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

यह शोध पत्र "एवरी इवैल एवर" (Every Eval Ever) को प्रस्तुत करता है, जो एक समुदाय-शासित पहल है जो एक एकीकृत JSON स्कीमा स्थापित करके, विविध स्रोतों से स्वचालित कन्वर्टर प्रदान करके, और हगिंग फेस (Hugging Face) पर एक क्राउडसोर्स रिपॉजिटरी होस्ट करके AI मूल्यांकन परिणामों के विखंडन को संबोधित करता है, जो वर्तमान में 22,000 से अधिक मॉडलों और 2,000 बेंचमार्क से डेटा एकत्रित करता है।

Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuj (…)2026-06-15
🤖 AI

Rethinking Global Average Pooling: Your Classifier Is Secretly a Multi-Instance Learner

यह शोध पत्र ग्लोबल एवरेज पूलिंग वाले मानक इमेज क्लासिफायर को मल्टी-इंस्टेंस लर्नर्स के रूप में पुनर्व्याख्या करता है, जो यह प्रदर्शित करता है कि वे स्वाभाविक रूप से अपने लॉजिट्स (logits) के भीतर रिकवरेबल स्थानिक वर्ग साक्ष्य (spatial class evidence) बनाए रखते हैं और मल्टी-ऑब्जेक्ट दृश्यों के बेहतर विश्लेषण के लिए इस जानकारी को निकालने हेतु एक पोस्ट-हॉक नैदानिक पद्धति को सक्षम करते हैं।

Aray Karjauv2026-06-15
🤖 AI

StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

यह शोध पत्र StreamMemBench प्रस्तुत करता है, जो एक नवीन स्ट्रीमिंग बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि व्यक्तिगत एजेंट स्ट्रीमिंग अवलोकनों और इंटरेक्शन फीडबैक को भविष्योन्मुखी सहायता में कैसे परिवर्तित करते हैं, जिससे यह पता चलता है कि वर्तमान मेमोरी सिस्टम अक्सर संग्रहीत साक्ष्यों का प्रभावी ढंग से उपयोग करने या आगामी कार्यों के लिए फीडबैक को शामिल करने में विफल रहते हैं।

Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun Lu2026-06-15
💬 NLP

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

यह शोध पत्र SIMMER को प्रस्तुत करता है, जो एक मानव-क्यूरेटेड प्रतीकात्मक विश्व मॉडल (symbolic world model) का उपयोग करने वाला एक किचन-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान LLM प्लानर अक्सर अनदेखे गुप्त विफलताओं (latent failures) के कारण अपूरणीय क्षति पहुँचाते हैं, और साथ ही यह प्रदर्शित करता है कि स्पष्ट प्रतितथ्यात्मक अवस्था तर्क (counterfactual state reasoning) इन जोखिमों को काफी हद तक कम कर सकता है।

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang2026-06-15
🤖 AI

VISTA: View-Consistent Self-Verified Training for GUI Grounding

VISTA एक GRPO-आधारित प्रशिक्षण ढांचा है जो GUI ग्राउंडिंग के लिए, एक ही इंस्टेंस के कई लक्ष्य-संरक्षित दृश्यों (target-preserving views) से तुलनात्मक समूह बनाकर और समन्वय पीढ़ी (coordinate generation) को स्थिर करने के लिए एक स्व-सत्यापित क्रॉस-व्यू एंकर को शामिल करके मॉडल के प्रदर्शन और मजबूती को बढ़ाता है।

Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu2026-06-15
🤖 AI

A Temporal Planning Framework for Disruption Aware Dynamic Route Optimization in Heterogeneous Railway Systems

यह शोध पत्र एक PDDL 2.1-आधारित टेम्पोरल प्लानिंग फ्रेमवर्क प्रस्तावित करता है जो विषम, मल्टी-गेज रेलवे प्रणालियों में संघर्ष-मुक्त, निष्पादन योग्य परिचालन योजनाएं उत्पन्न करके मार्गों को गतिशील रूप से अनुकूलित करता है और व्यवधानों का प्रबंधन करता है ताकि मैनुअल निर्णय लेने पर निर्भरता कम की जा सके और सुरक्षा को बढ़ाया जा सके।

Pollob Chandra Ray, Sabah Binte Noor, Fazlul Hasan Siddiqui2026-06-15
🤖 AI

When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime

यह शोध पत्र एक प्रोडक्शन एलएलएम (LLM) एजेंट रनटाइम के एक अनुदैर्ध्य अध्ययन (longitudinal study) को प्रस्तुत करता है जो "फेल-प्लॉज़िबल" (fail-plausible) मौन विफलताओं की पहचान करता है—जहाँ सिस्टम त्रुटि संकेतों के बजाय विश्वसनीय लेकिन गलत आख्यान उत्पन्न करता है—और ऐसी एजेंट विफलताओं को मुखर, उत्तरदायी और उबाऊ बनाने के लिए एक पांच-वर्ग वर्गीकरण और रक्षा ढांचा प्रस्तावित करता है।

Wei Wu2026-06-15
🤖 AI

Regulating the Machine Contributor: Governance and Policy Alignment in Open Source

यह शोध पत्र छह प्रमुख संगठनों का परीक्षण करके मौजूदा ओपन-सोर्स योगदान नीतियों और उभरते एआई गवर्नेंस फ्रेमवर्क के बीच के मिसअलाइनमेंट (विसंगति) का विश्लेषण करता है, एक छह-आयामी वर्गीकरण के माध्यम से महत्वपूर्ण नियामक अंतराल की पहचान करता है, और स्वायत्त एआई योगदानकर्ताओं द्वारा उत्पन्न चुनौतियों को संबोधित करने के लिए एक सामंजस्यपूर्ण टियर्ड (स्तरित) ढांचे का प्रस्ताव करता है।

Jassem Manita, Aziz Amari2026-06-15
⚡ electrical engineering

Moonlight in Latent Space: Chirality and Structural Correspondence Between Beethoven's Op. 27 No. 2 and Machine Learning Mechanisms

यह शोध पत्र प्रदर्शित करता है कि बीथोवेन की "मूनलाइट सोनाटा" संरचनात्मक रूप से तीन विशिष्ट मशीन लर्निंग आर्किटेक्चर को मूर्त रूप देती है, जो संगीत संबंधी विशेषताओं और एंट्रॉपी, मेमोरी और कॉन्टेक्स्टुअल एम्बेडिंग्स जैसे कम्प्यूटेशनल अवधारणाओं के बीच प्रति-सहज संबंधों को प्रकट करती है, और 'चिरैलिटी' (chirality) के एनकोड-डिकोड चक्र को परिमाणित करती है ताकि यह दिखाया जा सके कि कैसे अनुक्रमिक क्रम स्वाभाविक रूप से प्राकृतिक भाषा की तुलना में संगीत संबंधी सूचना को विकृत करता है।

Chen Ying Claude, Zhihan Luo2026-06-15