🤖 machine learning

Precise Verification of Transformers through ReLU-Catalyzed Abstraction Refinement

यह शोधपत्र एक नवीन ट्रांसफॉर्मर सत्यापन ढांचे का प्रस्ताव करता है जो सेल्फ-अटेंशन परतों में डॉट उत्पादों को सटीक रूप से सीमित करने के लिए ReLU-आधारित एब्स्ट्रैक्शन का लाभ उठाकर परिशुद्धता को बढ़ाता है, जिससे मौजूदा उत्तल ओवर-एप्रोक्सिमेशन (convex over-approximation) विधियों की तुलना में गलत अलार्मों को काफी कम किया जा सकता है और साथ ही स्वीकार्य दक्षता भी बनाए रखी जा सकती है।

Hengjie Liu, Zhenya Zhang, Jianjun Zhao2026-05-15
📊 statistics

Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

यह शोध पत्र हाइब्रिड पॉलिसी ऑप्टिमाइज़ेशन (HPO) का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो हाइब्रिड डिस्क्रीट-कंटीन्यूअस एक्शन स्पेस में निष्पक्ष और कुशल प्रशिक्षण सक्षम करने के लिए पाथवाइज (pathwise) और स्कोर-फंक्शन ग्रेडिएंट्स को जोड़ती है, जो उच्च-आयामी नियंत्रण और इन्वेंट्री समस्याओं में PPO जैसे मानक दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

Matias Alvo, Daniel Russo, Yash Kanoria2026-05-15
🤖 machine learning

Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry

यह शोध पत्र मैट्रिक्स-स्पेस रीइन्फोर्समेंट लर्निंग (MSRL) प्रस्तुत करता है, जो एक ज्यामितीय ढांचा है जो स्थानीय संक्रमण ज्यामिति (local transition geometry) के बीजगणितीय संयोजन और हस्तांतरण को सक्षम करने के लिए धनात्मक अर्ध-निश्चित मैट्रिक्स डिस्क्रिप्टर (positive semidefinite matrix descriptors) के माध्यम से प्रक्षेपवक्र खंडों (trajectory segments) का प्रतिनिधित्व करता है, जिससे मौजूदा विधियों की तुलना में कंपोजिशनल जनरलाइजेशन में बेहतर नमूना दक्षता और प्रदर्शन प्राप्त होता है।

Zuyuan Zhang, Carlee Joe-Wong, Tian Lan2026-05-15
🤖 machine learning

Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment

यह शोध पत्र BBCritic प्रस्तुत करता है, जो एक नया प्रतिमान (पैराडाइम) है जो GUI आलोचना को बाइनरी क्लासिफिकेशन के बजाय एक निरंतर सिमेंटिक अलाइनमेंट समस्या के रूप में पुनर्गठित करता है, और मौजूदा मॉडलों की सीमाओं को दूर करने तथा अतिरिक्त एनोटेशन के बिना बेहतर रैंकिंग प्रदर्शन प्राप्त करने के लिए कंट्रास्टिव लर्निंग का उपयोग करता है।

Yuchen Sun, Pei Fu, Shaojie Zhang, Anan Du, Xiuwen Xi, Ruoceng Zhang, Zhenbo Luo, Jian Luan, Chongyang Zhang2026-05-15
🤖 machine learning

AIM-DDI: A Model-Agnostic Multimodal Integration Module for Drug-Drug Interaction Prediction

यह शोध पत्र AIM-DDI को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) मल्टीमॉडल एकीकरण मॉड्यूल है जो विषम औषधि सूचनाओं को एक साझा लेटेंट स्पेस में टोकन के रूप में निरूपित करता है ताकि विविध आर्किटेक्चरों में, विशेष रूप से अनदेखी औषधियों के लिए, ड्रग-ड्रग इंटरेक्शन भविष्यवाणी को प्रभावी ढंग से बढ़ाया जा सके।

Yerin Park, Sangseon Lee2026-05-15
💻 computer science

CrystalReasoner: Reasoning and RL for Property-Conditioned Crystal Structure Generation

क्रिस्टलरीज़नर (CrystalReasoner) एक एंड-टू-एंड एलएलएम (LLM) फ्रेमवर्क है जो भौतिक पूर्ववृत्तों (physical priors) को थिंकिंग टोकन के रूप में एकीकृत करके और प्राकृतिक भाषा के निर्देशों को 3D परमाणु निर्देशांकों के साथ संरेखित करने के लिए मल्टी-ऑब्जेक्टिव सुदृढीकरण लर्निंग (multi-objective reinforcement learning) का उपयोग करके वैध, स्थिर और गुण-आधारित क्रिस्टल संरचनाएं उत्पन्न करता है।

Yuyang Wu, Stefano Falletta, Delia McGrath, Sherry Yang2026-05-15
💬 NLP

Herculean: An Agentic Benchmark for Financial Intelligence

यह शोध पत्र हर्कुलियन (Herculean) को प्रस्तुत करता है, जो वित्तीय बुद्धिमत्ता के लिए पहला एजेंटिक बेंचमार्क है जो मानकीकृत MCP-आधारित वातावरणों का उपयोग करके चार जटिल वर्कफ़्लो (ट्रेडिंग, हेजिंग, मार्केट इनसाइट्स और ऑडिटिंग) में AI एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ एजेंट ट्रेडिंग और इनसाइट्स पर अच्छा प्रदर्शन करते हैं, वहीं वे हेजिंग और ऑडिटिंग के लिए आवश्यक दीर्घकालिक समन्वय (long-horizon coordination) और संरचित सत्यापन (structured verification) में काफी संघर्ष करते हैं।

Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linha (…)2026-05-15
🤖 machine learning

Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces

यह शोध पत्र "मिनिमल कोर्स" (minimal cores) की अवधारणा प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि लैंग्वेज मॉडल के रीजनिंग ट्रेसेस (reasoning traces) काफी हद तक ओवरकम्प्लीट (overcomplete) हैं, जो यह प्रकट करते हैं कि चरणों का एक छोटा उपसमुच्चय (subset) भविष्यवाणात्मक सटीकता को बनाए रखते हुए अंतर्निहित तर्क प्रक्रिया का एक स्वच्छ, निम्न-आयामी ज्यामितीय प्रतिनिधित्व प्रदान करता है।

Sanjoy Chowdhury, Dinesh Manocha2026-05-15
🤖 machine learning

LoMETab: Beyond Rank-1 Ensembles for Tabular Deep Learning

यह शोध पत्र LoMETab को प्रस्तुत करता है, जो मल्टीप्लिकेटिव इम्प्लिसिट एनसेम्बल्स (multiplicative implicit ensembles) का एक रैंक-rr सामान्यीकरण है जो BatchEnsemble के हाइपोथीसिस क्लास का विस्तार करता है और एडेप्टर रैंक (adapter rank) एवं इनिशियलाइजेशन स्केल (initialization scale) के माध्यम से नियंत्रणीय विविधता प्रदान करता है, जिससे यह फिक्स्ड रैंक-1 कंस्ट्रक्शंस की तुलना में टैबुलर डीप लर्निंग प्रदर्शन को सुधारने के लिए एक लचीला ढांचा प्रदान करता है।

Changryeol Choi, Hyewon Park, Yujin Kwon, Gowun Jeong2026-05-15
💬 NLP

Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement

यह शोध पत्र DiHAL को प्रस्तुत करता है, जो एक ज्यामिति-निर्देशित हाइब्रिड मॉडल है जो निरंतर डिफ्यूजन लैंग्वेज मॉडल्स (continuous diffusion language models) में सुधार करता है, जिसमें हिडन-स्टेट पुनर्निर्माण (hidden-state reconstruction) के लिए डिफ्यूजन ब्रिज से बदलने हेतु प्रीट्रेन ट्रांसफॉर्मर्स के भीतर इष्टतम परतों की पहचान की जाती है, जिससे प्रत्यक्ष निरंतर-से-डिस्क्रीट टोकन रिकवरी से बचा जा सके और बेहतर प्रदर्शन प्राप्त किया जा सके।

Injin Kong, Hyoungjoon Lee, Yohan Jo2026-05-15