🤖 AI

Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors

यह शोध पत्र तर्क देता है कि सेंटर्ड टोकन लॉग-प्रोबेबिलिटी (centered token log-probability), अपने अंतर्निहित मार्टिंगेल गुणों (martingale properties) और आत्मविश्वासी पुनरावृत्ति के दौरान मौन रहने के कारण, क्वांटाइज्ड रीजनिंग मॉडल्स की निगरानी के लिए एक अप्रभावी अवलोकन योग्य (observable) है, और इसके बजाय एक प्रशिक्षण-मुक्त, कैलिब्रेटेड e-CUSUM डिकोडर का प्रस्ताव देता है जो टोकन अनिश्चितता को वर्बेटम पुनरावृत्ति संकेतों (verbatim repetition signals) के साथ जोड़कर विफल होने वाले ट्रेसेस (failing traces) का सफलतापूर्वक पता लगाता है।

El Hassane Ettifouri (Novelis Research, Paris, France), Ayoub Belfatmi (Novelis Research, Paris, France), Mahaman Sanous (…)2026-07-14
🤖 AI

Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation

यह शोध पत्र एक न्यूरो-सिम्बोलिक जनरेट-वेरिफाई-रिपेयर हार्नेस पेश करता है जो बड़े भाषा मॉडलों द्वारा उत्पन्न बारह-स्वर (twelve-tone) संगीत की निरंतरता और कथित गुणवत्ता में महत्वपूर्ण सुधार करता है, जो उन्हें एक सिम्बोलिक सत्यापन लूप में लपेटकर ऐसा करता है जो स्पष्ट रूप से अपभ्रंश (degenerate) आउटपुट उत्पन्न करने से बचता है।

Congren Dai, Danni Zhao, Enyang Liu, Michael Ching Yam, Zhancheng Guo, Siyi Gu, Wentao Yang, Bo Dai, Xiaobing Li, Maoson (…)2026-07-14
🤖 AI

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR एक स्वचालित फ्रेमवर्क है जो सर्किट स्कीमैटिक्स को एक निष्पादन योग्य इंटरमीडिएट रिप्रेजेंटेशन में बदलने के लिए विजन लैंग्वेज मॉडल्स का लाभ उठाता है और सटीक सिम्बोलिक एक्सप्रेशंस उत्पन्न करने के लिए एक सिम्बोलिक सॉल्वर एजेंट का उपयोग करता है, जो सटीकता और दक्षता दोनों में मौजूदा एंड-टू-एंड और विशिष्ट विधियों से काफी बेहतर प्रदर्शन करता है।

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu2026-07-14
🤖 AI

Fail-Aware and Explainable Test Oracle Prediction

यह शोध पत्र FOCAL को प्रस्तुत करता है, जो एक कोड LLM-आधारित विभेदक भविष्यवक्ता (discriminative oracle predictor) है जो उन्नत विफलता पहचान और कथन-स्तरीय स्पष्टीकरणों के साथ सीधे टेस्ट पास/फेल परिणामों का पूर्वानुमान लगाता है, जो अनदेखे प्रोजेक्ट्स के लिए मौजूदा टेस्ट जनरेशन तकनीकों के एक सुदृढ़ पूरक के रूप में कार्य करता है।

Yue Zhao, Binish Tanveer, Jelena Zdravkovic2026-07-14
🤖 AI

Longitudinal Multi-View Breast Cancer Risk Prediction

यह शोध पत्र LMV-Net प्रस्तुत करता है, जो एक डीप लर्निंग मॉडल है जो एक स्पष्ट रूप से संरेखित अनुदैर्ध्य ढांचे के भीतर शारीरिक रूप से पूरक CC और MLO दृश्यों का संयुक्त रूप से विश्लेषण करके स्तन कैंसर के जोखिम की भविष्यवाणी में सुधार करता है, और विभिन्न रोगी उपसमूहों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Solveig Thrun, Zijun Sun, Suaiba A. Salahuddin, Kristoffer Wickstrøm, Elisabeth Wetzer, Stine Hansen, Robert Jenssen, Mi (…)2026-07-14
🤖 AI

Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

यह शोध पत्र एक क्षमता-गेटेड (capability-gated) रनटाइम सिस्टम प्रस्तुत करता है जो मानक संचालन प्रक्रियाओं को निष्पादन योग्य सूडो-कोड (pseudo-code) में संकलित करता है और प्रोग्राम-निर्देशित पेजिंग (program-guided paging) का उपयोग करता है ताकि प्रक्रियात्मक एलएलएम (LLM) एजेंटों की सुरक्षा और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके, विशेष रूप से उन मॉडलों के लिए जिनमें मजबूत स्टेट डिसिप्लिन (state discipline) होता है।

Chenglin Yu, Li Yin, Ying Yu, Hongxia Yang, Ming Li2026-07-14
🤖 AI

From Neural Network Decisions to Training Cases: An Exact Account via Case-Based Decision Theory

यह शोध पत्र यह प्रदर्शित करता है कि एक निश्चित न्यूरल नेटवर्क प्रतिनिधित्व पर फिट किया गया एक ऑर्डिनरी लीस्ट स्क्वायर्स (OLS) रीडआउट, निर्णय स्कोर का प्रशिक्षण मामलों के परिणामों के भारित योगों में एक सटीक अपघटन सक्षम बनाता है, जिससे मॉडल को पुन: प्रशिक्षित करने की आवश्यकता के बिना केस-बेस्ड डिसीजन थ्योरी पर आधारित एक कठोर, ऑडिट-रेडी केस-आधारित स्पष्टीकरण प्राप्त होता है।

Manli Yan, Yuebin Lin, Yaowen Yu, Yong Zhao2026-07-14
🤖 AI

Understanding the Impact of AI Code Assistants on Security API Usage: An Empirical Study

44 पेशेवर डेवलपर्स के इस अनुभवजन्य अध्ययन से पता चलता है कि जहाँ GitHub Copilot कार्यात्मक शुद्धता (functional correctness) में सुधार करता है और कुछ असुरक्षित पैटर्न को मामूली रूप से कम करता है, वहीं यह सुरक्षित सुरक्षा API उपयोग को महत्वपूर्ण रूप से बढ़ाने में विफल रहता है, जिससे अक्सर डेवलपर्स शेष कमजोरियों के प्रति अनभिज्ञ रह जाते हैं।

Zahra Mousavi, Chadni Islam, M. Ali Babar, Alsharif Abuadbba, Kristen Moore2026-07-14
💬 NLP

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

यह शोध पत्र एपिस्टेमिक एसिमेट्री शेलिंग टास्क (EAST) को प्रस्तुत करता है, जो एक नवीन संवाद-आधारित बेंचमार्क है जो लार्ज लैंग्वेज मॉडल्स की कार्यात्मक थ्योरी ऑफ माइंड और एपिस्टेमिक ट्रैकिंग क्षमताओं में महत्वपूर्ण अंतराल को प्रकट करता है, यह प्रदर्शित करते हुए कि पारंपरिक स्थिर परीक्षणों पर उच्च प्रदर्शन के बावजूद भी फ्रंटियर मॉडल्स गतिशील सामाजिक समन्वय में संघर्ष करते हैं।

Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street2026-07-14
🤖 AI

A Glimpse into Long-term Physical Coexistence with Intelligent Robots

यह शोध पत्र PHILIA को प्रस्तुत करता है, जो एक रोबोट गेटवे एब्स्ट्रैक्शन के इर्द-गिर्द निर्मित एक मल्टी-रोबोट एजेंट आर्किटेक्चर है जो उच्च-स्तरीय तर्क (high-level reasoning) को निम्न-स्तरीय निष्पादन (low-level execution) से अलग करता है ताकि विविध स्वरूपों (embodiments) और इंटरफेसों के बीच बुद्धिमान रोबोटों के साथ संरचनात्मक, दीर्घकालिक भौतिक सह-अस्तित्व को सक्षम बनाया जा सके।

Weiqi Jin, Peijun Tang, Kuncheng Luo, Baifu Huang, Binyan Sun, Haotian Yang, Shangjin Xie, Jianan Wang2026-07-14