🤖 AI

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

यह शोधपत्र CrystalXRD-Bench प्रस्तुत करता है, जो XRD पीक इंडेक्सिंग के जटिल कार्य पर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि पूरक रासायनिक डेटा तक पहुंच होने के बावजूद वर्तमान मॉडल्स मल्टी-स्टेप क्रिस्टलोग्राफिक रीजनिंग और विजुअल एक्सट्रैक्शन में संघर्ष करते हैं।

Chengliang Xu, Xiaogang Li, Peiyao Xiao, Beng Wang, Hu Wei, Bing Zhao2026-05-29
🤖 AI

Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment

यह शोध पत्र एक अनुकूली साक्षात्कार ढांचे (adaptive interviewing framework) का प्रस्ताव करता है जो उपयोगकर्ता-विशिष्ट साक्ष्य गतिशील रूप से एकत्र करके नैतिक दुविधाओं में व्यक्तिगत निर्णय लेने की लार्ज लैंग्वेज मॉडल्स की क्षमता में सुधार करता है, यह प्रदर्शित करते हुए कि सटीकता में वृद्धि केवल समृद्ध व्यक्तित्व संदर्भ (persona context) रखने के बजाय इस साक्ष्य के आधार पर अपने तर्क को पुख्ता करने की मॉडल की क्षमता पर निर्भर करती है।

Ruoxi Su, Yuhan Liu, Jingyu Hu2026-05-29
🤖 machine learning

Honest Lying: Understanding Memory Confabulation in Reflexive Agents

यह शोधपत्र प्रकट करता है कि रिफ्लेक्शन-शैली (Reflexion-style) वाले एजेंट "मेमोरी कॉन्फैब्युलेशन" (स्मृति भ्रम) से ग्रस्त होते हैं, जहाँ वे आत्मविश्वास के साथ गलत आत्म-चिंतन को संग्रहीत करते हैं और बार-बार उसी पर निर्भर रहते हैं, और खुले-अंत वाले आत्म-निदान (self-diagnosis) के स्थान पर प्रोग्रामेटिक विफलता संकेतों (programmatic failure signals) का उपयोग करने वाला एक शमन रणनीति प्रस्तावित करता है, जो इस त्रुटि दर को काफी कम करता है और कार्य प्रदर्शन में सुधार करता है।

Prakhar Dixit, Sadia Kamal, Tim Oates2026-05-29
🤖 machine learning

Composing Non-Conjugate Factor Graphs with Closed-Form Variational Inference

यह शोध पत्र यह प्रदर्शित करता है कि पांच विशिष्ट फैक्टर-ग्राफ प्रिमिटिव्स (factor-graph primitives) को संयोजित करके गहरे संभाव्य आर्किटेक्चर (deep probabilistic architectures) में क्लोज्ड-फॉर्म वेरिएशनल इन्फरेंस (closed-form variational inference) को संरक्षित किया जा सकता है, जो बिना किसी सीखे गए गेटिंग पैरामीटर्स (learned gating parameters) के निर्णय वृक्षों (decision trees) और कैलिब्रेटेड अनिश्चितता वाले बायेसियन मिश्रण विशेषज्ञों (Bayesian mixture of experts) जैसे सार्वभौमिक फलन सन्निकटों (universal function approximators) के निर्माण को सक्षम बनाता है।

Mykola Lukashchuk, Kyrylo Yemets, Wouter M. Kouw, Dmitry Bagaev, żsmail Şenöz, Jeff Beck, Bert de Vries2026-05-29
🤖 AI

SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing

यह शोधपत्र SciIntBench को प्रस्तुत करता है, जो दस अनुसंधान अखंडता श्रेणियों में 810 प्रॉम्प्ट्स पर 16 लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक एडवर्सरियल बेंचमार्क है, जो यह प्रकट करता है कि जहाँ मॉडल प्रत्यक्ष कदाचार को अस्वीकार करने में विश्वसनीय हैं, वहीं वे अक्सर तब विफल हो जाते हैं जब उल्लंघन को दबाव-प्रेरित शॉर्टकट के रूप में गुप्त रूप से फ्रेम किया जाता है।

Almene De Meran Meguimtsop, Maria Leonor Pacheco, Daniel E. Acuna2026-05-29
🤖 AI

MOOSE-Copilot: A Web-Based Interactive Assistant for Unified Exploratory and Fine-Grained Scientific Hypothesis Discovery

MOOSE-Copilot एक एकीकृत, वेब-आधारित फ्रेमवर्क है जो वैज्ञानिक परिकल्पना खोज में अन्वेषणात्मक विचार-मंथन और सूक्ष्म परिशोधन के बीच के अंतर को पाटता है, जिससे वैज्ञानिकों को एक औपचारिक मानव-AI इंटरेक्शन प्रोटोकॉल के माध्यम से जनरेटिव प्रक्रिया को सक्रिय रूप से निर्देशित करने में सक्षम बनाया जाता है, जिससे यह स्वायत्त बेसलाइनों से बेहतर प्रदर्शन करता है और AI-संचालित वैज्ञानिक सफलताओं तक पहुंच का लोकतंत्रीकरण करता है।

Hongran An, Zonglin Yang2026-05-29
🤖 AI

Evolutionary Rule Extraction from Corporate Default Prediction Models

यह अध्ययन प्रदर्शित करता है कि मशीन लर्निंग मॉडलों को एक नवीन विकासवादी नियम निष्कर्षण ढांचे (DEXiRE-EVO) के साथ संयोजित करने से इतालवी SMEs के क्रेडिट जोखिम आकलन की भविष्य कहनेवाला सटीकता और व्याख्यात्मकता दोनों में महत्वपूर्ण वृद्धि होती है, जो तरलता संबंधी बाधाओं, पूंजी क्षरण और उच्च उत्तोलन जैसे प्रमुख वित्तीय संकट संकेतकों को प्रकट करता है।

Desirè Fabbretti, Matteo Pasquino, Elia Pacioni, Caterina Lucarelli, Davide Calvaresi2026-05-29
🤖 AI

VitalAgent: A Tool-Augmented Agent for Reactive and Proactive Physiological Monitoring over Wearable Health Data

यह शोध पत्र VitalAgent को प्रस्तुत करता है, जो एक टूल-ऑगमेंटेड फ्रेमवर्क है जो निरंतर पहनने योग्य स्वास्थ्य डेटा (wearable health data) पर रिएक्टिव प्रश्न उत्तरण और प्रोएक्टिव मॉनिटरिंग दोनों को सक्षम करने के लिए लॉन्गिट्यूडिनल फिजियोलॉजिकल मेमोरी और डायनेमिक सिग्नल कंप्यूटेशन का लाभ उठाता है, जिसे नए VitalBench डेटासेट द्वारा मान्य किया गया है।

Di Zhu, Yu Yvonne Wu, Hong Jia, Aaqib Saeed, Vassilis Kostakos, Ting Dang2026-05-29
🤖 machine learning

PhoneWorld: Scaling Phone-Use Agent Environments

PhoneWorld एक स्केलेबल पाइपलाइन पेश करता है जो 34 ऐप्स में वास्तविक मोबाइल GUI प्रक्षेप पथों (trajectories) को स्वचालित रूप से नियंत्रणीय, सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है, जिससे मैनुअल बेंचमार्क निर्माण से ध्यान हटाकर फोन-उपयोग वातावरण के बड़े पैमाने पर उत्पादन पर केंद्रित करते हुए कई बेंचमार्क पर एजेंट के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Wein (…)2026-05-29
🤖 AI

The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF

यह शोध पत्र DistractionIF बेंचमार्क प्रस्तुत करता है जो यह प्रकट करता है कि बड़े लार्ज लैंग्वेज मॉडल्स संदर्भ टेक्स्ट के भीतर विचलित करने वाले निर्देशों (distractor instructions) के विरुद्ध मजबूती में एक इनवर्स स्केलिंग लॉ (inverse scaling law) से ग्रस्त होते हैं, एक ऐसी भेद्यता जिसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से प्रभावी ढंग से कम किया जा सकता है।

Zeli Su, Zhankai Xu, Tianlei Chen, Longfei Zheng, Xiaolu Zhang, Jun Zhou, Wentao Zhang2026-05-29