🤖 machine learning

X-FEMR: A Token-level Explainable Approach for Electronic Health Records Foundation Models using Transformer-based Models

यह शोध पत्र X-FEMR को प्रस्तुत करता है, जो इलेक्ट्रॉनिक हेल्थ रिकॉर्ड्स फाउंडेशन मॉडल्स के लिए पहला टोकन-स्तरीय व्याख्यात्मकता ढांचा (explainability framework) है, जो भविष्यवाणियों का अनुमान लगाने के लिए एक ट्रांसफॉर्मर-आधारित सरोगेट मॉडल का उपयोग करता है और एक नवीन संरेखण मीट्रिक (alignment metric) के माध्यम से नैदानिक प्रासंगिकता को मान्य करता है, जिससे ब्लैक-बॉक्स क्लिनिकल एआई की व्याख्यात्मकता और विश्वसनीयता बढ़ती है।

Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang2026-07-08
💬 NLP

Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

यह शोध पत्र प्रदर्शित करता है कि सुदृढीकरण सीखना (Reinforcement Learning) LLM-जनित BPMN प्रक्रिया मॉडलों की गुणवत्ता को महत्वपूर्ण रूप से बढ़ाता है, जो यह प्रकट करता है कि बहु-आयामी गुणवत्ता मेट्रिक्स का समान भार देना लक्षित दृष्टिकोणों की तुलना में बेहतर प्रदर्शन करता है और इष्टतम रिवॉर्ड फंक्शन डिज़ाइन विशिष्ट मॉडल आर्किटेक्चर पर अत्यधिक निर्भर है।

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev2026-07-08
🤖 AI

UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods

UBEP एक प्रोडक्शन-रेडी कम्युनिकेशन लाइब्रेरी है जो उच्च-बैंडविड्थ वाले सुपरपॉड्स के लिए Mixture-of-Experts (MoE) All-to-All प्रिमिटिव्स को पुनर्गठित करती है, जो सीरियलाइजेशन, सिंक्रोनाइज़ेशन और लोड इम्बैलेंस की बाधाओं को दूर करके All-to-All लेटेंसी को 52.4% तक और इन्फरेंस TPOT को 11.1% तक कम करती है।

Yipeng Liu, Chang Liu, Si Shen, Jiaqi Zheng, Mingfan Li, Yuyang Yang, Guanhua Li, Yuquan Zhang, Yimeng Xu, Zhongzhe Hu (…)2026-07-08
🤖 AI

A toy framework for single and multi-agent human-AI curiosity ecosystems

यह शोध पत्र एक वैचारिक खिलौना ढांचे (toy framework) का प्रस्ताव करता है जो जिज्ञासा को एक गतिशील पारिस्थितिकी तंत्र के रूप में मॉडल करता है जहाँ एक एजेंट की पूछताछ नीति अनुभव के आधार पर अनुकूलित होती है और सामूहिक खोज मेट्रिक्स जैसे कि विषय विविधता और अतिरेक (redundancy) का विश्लेषण करने के लिए बहु-एजेंट प्रणालियों तक विस्तृत होती है।

Ilya E. Monosov2026-07-08
💬 NLP

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

यह शोध पत्र Spider 2.0-AIFunc को प्रस्तुत करता है, जो 125 वास्तविक दुनिया के डेटाबेस में 465 सत्यापित इंस्टेंस का एक नया बेंचमार्क है जिसे स्नोफ्लेक (Snowflake) प्लेटफॉर्म पर AI-नेटिव SQL क्वेरी उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि शीर्ष प्रोप्रायटरी मॉडल 67-70% सटीकता प्राप्त करते हैं, पारंपरिक टेक्स्ट-टू-SQL कार्यों के लिए अनुकूलित वर्तमान एजेंट फ्रेमवर्क इस उभरते परिवेश में प्रभावी रूप से स्थानांतरित नहीं होते हैं।

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He2026-07-08
🤖 AI

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

यह शोध पत्र VendorBench-100 को प्रस्तुत करता है, जो एक एकीकृत क्रॉस-पैराडाइम बेंचमार्क है जो एक क्यूरेटेड 100-छवि कॉर्पस का उपयोग करके कमर्शियल एपीआई (commercial APIs), विजन-लैंग्वेज मॉडल्स और ओपन-सोर्स डिटेक्टर्स के माध्यम से 36 डीपफेक डिटेक्शन मॉडल्स का मूल्यांकन करता है, जिससे यह खुलासा होता है कि हालांकि कमर्शियल एपीआई मेडियन प्रदर्शन में अग्रणी हैं, फिर भी रैंकिंग क्षमता (ROC-AUC) और विश्वसनीय निर्णय लेने (MCC) के बीच एक महत्वपूर्ण विचलन मौजूद है।

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh2026-07-08
🤖 AI

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

यह शोध पत्र एक ऐसे मूल मेटा-आर्किटेक्चर में संज्ञानात्मक प्रोटोकॉल को समाहित करके विषम एआई पारिस्थितिक तंत्रों के विकास के लिए एक सैद्धांतिक रूपरेखा प्रस्तावित करता है जो सख्त शासन अपरिवर्तनीयताओं (governance invariants) को बनाए रखते हुए स्व-सुसंगत, पथ-आश्रित टोपोलॉजिकल विकास को संचालित करने के लिए संरचनात्मक तनाव, ऑफलाइन आवर्ती लूप और अनुमान-समय प्लास्टिसिटी का उपयोग करता है।

Heting Mao2026-07-08
🤖 AI

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

यह शोध पत्र UI2App को प्रस्तुत करता है, जो केवल स्थिर UI स्क्रीनशॉट से निष्पादन योग्य इंटरैक्शन व्यवहारों को अनुमानित करने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो वर्तमान मॉडल्स की दृश्य पुनर्निर्माण क्षमताओं और जटिल, स्टेट-कोहेरेंट वेब एप्लिकेशन उत्पन्न करने की उनकी क्षमता के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen2026-07-08
🤖 AI

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard एक 4B-पैरामीटर वाला सुरक्षा गार्डरेल है जो "रीज़निंग-एक्टिव ट्रेनिंग, रीज़निंग-फ्री इन्फरेंस" प्रतिमान को अपनाकर उच्च-सटीकता और कम-विलंबता वाली मॉडरेशन प्राप्त करता है, जहाँ यह इन्फरेंस के दौरान केवल संरचित सुरक्षा लेबल उत्सर्जित करने के लिए इरादा-संचालित पर्यवेक्षण और लक्षित कठिन-मामला अनुकूलन के माध्यम से प्रशिक्षण के दौरान जटिल तर्क पैटर्न को आंतरिक रूप से आत्मसात कर लेता है।

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei L (…)2026-07-08
🤖 AI

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

यह शोध पत्र अनसुपरवाइज्ड डिक्शनरी लर्निंग का उपयोग करके एक पोस्ट-हॉक इंटरप्रिटेबिलिटी फ्रेमवर्क प्रस्तावित करता है ताकि एंड-टू-एंड ऑटोनॉमस ड्राइविंग मॉडल्स को अर्थपूर्ण अवधारणाओं में विघटित किया जा सके, जिससे त्रुटिपूर्ण व्यवहारों की पहचान और लक्षित हस्तक्षेप सक्षम हो सके जो समग्र ड्राइविंग प्रदर्शन में सुधार करते हैं।

Franz Motzkus, Sebastian Bernhard2026-07-08