🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

यह शोध पत्र 57 मशीन लर्निंग इवैल्यूएशन हार्नेस (evaluation harnesses) का एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो स्पेसिफिकेशन (Specification) चरण को परिचालन संबंधी चुनौतियों के प्राथमिक स्रोत के रूप में पहचानता है, 16,560 समस्याओं को उनके मूल कारण के आधार पर वर्गीकृत करता है जिससे यह पता चलता है कि अनिरुद्ध (unimplemented) विशेषताएं, दस्तावेज़ीकरण अंतराल और लुप्त इनपुट सत्यापन 60% से अधिक समस्याओं के लिए उत्तरदायी हैं, और मूल्यांकन इंजीनियरिंग (evaluation engineering) को एक विशिष्ट सॉफ्टवेयर इंजीनियरिंग अनुशासन के रूप में मानने के लिए एक आधार स्थापित करता है।

Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan2026-05-26
🤖 machine learning

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

यह शोध पत्र Agent-ToM को प्रस्तुत करता है, जो एक लर्निंग-टू-मॉनिटर फ्रेमवर्क है जो छिपे हुए विश्वासों और इरादों का अनुमान लगाकर स्वायत्त (autonomous) LLM एजेंटों में गुप्त दुर्भावनापूर्ण व्यवहारों का पता लगाने के लिए थ्योरी-ऑफ-माइंड रीजनिंग और एक रीज़न-वेरिफाई-रिफाइन पाइपलाइन का लाभ उठाता है, जिससे यह मौजूदा अत्याधुनिक मॉनिटरिंग बेसलाइनों से बेहतर प्रदर्शन करता है।

Nesreen K. Ahmed, Nima Nafisi2026-05-26
💻 computer science

Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks

यह शोध पत्र यह पहचानता है कि सिंगल-प्रोसेस, asyncio-संचालित बेंचमार्किंग उपयोगिताएँ पायथन GIL के कारण होने वाले क्लाइंट-साइड क्यूइंग बॉटलनेक्स की वजह से प्रोडक्शन LLM इवैल्यूएशन में व्यवस्थित माप पूर्वाग्रह (सिस्टमिक मेजरमेंट बायस) उत्पन्न करती हैं, और सटीक, उच्च-सहमति (हाई-कन्करेंसी) प्रदर्शन प्रोफाइलिंग को सक्षम करने के लिए एक मल्टी-प्रोसेस फ्रेमवर्क के साथ-साथ एक नए NTPOT मेट्रिक का प्रस्ताव करता है।

Ashok Chandrasekar, Jason Kramberger2026-05-26
💻 computer science

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

यह शोध पत्र Trajel प्रस्तुत करता है, जो एक डेटासेट और मूल्यांकन ढांचा है जो पांच विशिष्ट विफलता प्रकारों को वर्गीकृत करके मल्टी-एजेंट औद्योगिक वर्कफ़्लो में प्रक्षेपवक्र-स्तरीय (trajectory-level) मतिभ्रम का ऑडिट करता है, यह प्रदर्शित करते हुए कि मौजूदा बेंचमार्क महत्वपूर्ण मध्यवर्ती त्रुटियों को छोड़ देते हैं और सुरक्षित एजेंटिक परिनियोजन के लिए वर्गीकरण-आधारित, प्रक्षेपवक्र-जागरूक पहचान आवश्यक है।

Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin (…)2026-05-26
💻 computer science

GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer

यह शोधपत्र GIBLy को प्रस्तुत करता है, जो एक हल्का, आर्किटेक्चर-अज्ञेय (architecture-agnostic) लेयर है जो 3D सेगमेंटेशन मॉडल्स में सीखने योग्य ज्यामितीय पूर्ववृत्त (geometric priors) को एकीकृत करता है ताकि न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ प्रदर्शन और सामान्यीकरण (generalization) में महत्वपूर्ण सुधार किया जा सके।

Diogo Lavado, Alessandra Micheletti, Clàudia Soares2026-05-26
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

यह शोध पत्र एक एआई-संचालित वर्कफ़्लो का प्रस्ताव करता है जो कंटेंट मॉडरेशन श्रेणियों के लिए विस्तृत, एज-केस (edge-case) को कवर करने वाले "संविधानों" को उत्पन्न करने के लिए फ्रंटियर एलएलएम (LLM) का उपयोग करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण लेबलिंग निरंतरता और सटीकता में मानव एनोटेटरों से काफी बेहतर प्रदर्शन करता है और क्रॉस-मॉडल असहमति को 57 गुना तक कम करता है।

Konstantin Berlin, Adam Swanda2026-05-26
💻 computer science

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

यह शोध पत्र सौहार्दपूर्ण (benign) और हानिकारक प्रॉम्प्ट्स के तहत Mixtral 8x7B-Instruct मॉडल के रूटिंग व्यवहार का विश्लेषण करता है, जो यह प्रकट करता है कि सुरक्षा-संबंधित विशेषज्ञ सक्रियण (expert activation) सूक्ष्म, गहराई-निर्भर और वितरित है न कि विशेषज्ञों के एक निश्चित समूह द्वारा नियंत्रित, जिसमें ग्रेडिएंट-आधारित हस्तक्षेप, सक्रियण-आधारित हस्तक्षेपों की तुलना में हानिकारक प्रतिक्रियाओं को कम करने में अधिक प्रभावी सिद्ध होते हैं।

Md Nurul Absar Siddiky2026-05-26
💻 computer science

ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

यह शोध पत्र ChaosBench-Logic v2 का परिचय देता है, जो एक बड़े पैमाने का बेंचमार्क और CARE मूल्यांकन प्रोटोकॉल है जिसे डायनेमिकल सिस्टम्स (dynamical systems) के संबंध में LLMs में महत्वपूर्ण तार्किक तर्क विफलताओं को उजागर करने के लिए डिज़ाइन किया गया है, जिसमें यह पाया गया है कि जहाँ मॉडल औपचारिक निगमन (formal deduction) पर मध्यम प्रदर्शन करते हैं, वहीं वे रेजीम ट्रांज़िशन (regime transitions) के साथ काफी संघर्ष करते हैं और बाइफरकेशन (bifurcation) संबंधी प्रश्नों पर व्यवस्थित रूप से एंटी-कोरिलेशन (anti-correlation) प्रदर्शित करते हैं।

Noel Thomas2026-05-26
🤖 AI

Adaptive Human-AI Coordination via Hierarchical Action Disentanglement

यह शोध पत्र इंट्रिन्सिक एक्शन डिसेंटैंगलमेंट (IAD) का प्रस्ताव करता है, जो एक डीप हिरार्किकल रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो विविध और अनदेखे पार्टनर्स के साथ ओवरकुक्ड-एआई (Overcooked-AI) डोमेन में सुदृढ़ और अनुकूल मानव-एआई समन्वय को सक्षम करने के लिए विशिष्ट, पार्टनर-अवेयर एक्शन सीक्वेंस सीखने हेतु इंट्रिन्सिक रिवार्ड्स का उपयोग करता है।

Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo2026-05-26
🤖 AI

Partner-Aware Hierarchical Skill Discovery for Robust Human-AI Collaboration

यह शोध पत्र पार्टनर-अवेयर स्किल डिस्कवरी (PASD) को प्रस्तुत करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो पार्टनर के व्यवहार पर आधारित कौशल सीखने के लिए कंट्रास्टिव इंट्रिंसिक रिवार्ड्स का उपयोग करता है, जिससे शॉर्टकट लर्निंग की समस्या दूर होती है और विविध एवं नवीन पार्टनर्स के बीच सुदृढ़, अनुकूलन योग्य मानव-एआई सहयोग सक्षम होता है।

Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo2026-05-26