🤖 machine learning

Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

यह शोध पत्र एक सिमेंटिक्स-अवेयर मेमोरी पदानुक्रम प्रस्तुत करता है जो शून्य-अनुमान त्रुटि के साथ कम-महत्व वाले रीजनिंग टोकन को सीपीयू मेमोरी में ऑफलोड करता है, यह प्रदर्शित करते हुए कि रीजनिंग सटीकता केवल स्थायी निष्कासन अनुपात (परमानेंट इविक्शन रेशियो) पर निर्भर करती न कि एचबीएम अधिभोग (एचबीएम ऑक्यूपेंसी) पर, जिससे न्यूनतम प्रदर्शन गिरावट के साथ महत्वपूर्ण मेमोरी बचत संभव हो पाती है।

Aojie Yuan, Tianqi Shen, Dajun Zhang2026-05-12
🤖 machine learning

Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models

यह शोध पत्र ट्रिफॉर्म बेंचमार्क (TriForm Benchmark) प्रस्तुत करता है और बड़े भाषा मॉडलों (large language models) के भीतर एक फॉर्मेट-एग्नोस्टिक रीजनिंग सबस्पेस (Format-Agnostic Reasoning Subspace - FARS) के लिए अभिसरण साक्ष्य प्रदान करता है, जो यह प्रदर्शित करता है कि एक संक्षिप्त 10-आयामी आंतरिक प्रतिनिधित्व विविध सतही रूपों (गद्य, कोड और गणित) में अमूर्त तर्क अवधारणाओं को कैप्चर करता है, साथ ही एक मौलिक विषमता को प्रकट करता है जहाँ घोषणात्मक प्रारूप (declarative formats) एक दूसरे के साथ प्रक्रियात्मक कोड (procedural code) की तुलना में अधिक अनुकूल होते हैं।

Aojie Yuan, Zhiyuan Su2026-05-12
🤖 machine learning

Spectral Transformer Neural Processes

यह शोध पत्र स्पेक्ट्रल ट्रांसफॉर्मर न्यूरल प्रोसेसिस (STNPs) को प्रस्तुत करता है, जो ट्रांसफॉर्मर न्यूरल प्रोसेसिस का एक आवृत्ति-जागरूक विस्तार है जो स्पेक्ट्रल-मिक्सचर-कर्नेल बायस को इंजेक्ट करने के लिए एक स्पेक्ट्रल एग्रीगेटर को शामिल करता है, जिससे समय श्रृंखला, स्थानिक और छवि अनुप्रयोगों में आवधिक और अर्ध-आवधिक डेटा की मॉडलिंग में महत्वपूर्ण सुधार होता है।

Xianhe Chen, Hao Chen, Yingzhen Li2026-05-12
🤖 AI

Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

यह शोध पत्र यह प्रदर्शित करता है कि जबकि लार्ज लैंग्वेज मॉडल्स (LLMs) अपने हिडन स्टेट्स (hidden states) में एक मजबूत आंतरिक "हिडन एरर अवेयरनेस" (hidden error awareness) रखते हैं जिसे पहचाना जा सकता है, यह डायग्नोस्टिक सिग्नल मौलिक रूप से गैर-कारण (non-causal) है और विभिन्न इंटरवेंशन तकनीकों के माध्यम से तर्क संबंधी त्रुटियों को सुधारने के लिए इसका लाभ नहीं उठाया जा सकता है।

Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang, Yi Nian, Yue Zhao2026-05-12
🤖 AI

Position: AI Security Policy Should Target Systems, Not Models

यह शोध पत्र "स्वार्म-अटैक" (swarm-attack) का परिचय देता है, जो एक ओपन-सोर्स फ्रेमवर्क है और यह प्रदर्शित करता है कि एक परिष्कृत सिस्टम स्कैफोल्ड के माध्यम से समन्वित कई हल्के, कमोडिटी एलएलएम (LLM) एजेंट, फ्रंटियर मॉडल्स के सुरक्षा गार्डरेल्स को प्रभावी ढंग से बायपास करने और लगभग शून्य लागत पर सॉफ्टवेयर कमजोरियों को खोजने में सक्षम हैं, और यह तर्क देता है कि एआई (AI) सुरक्षा नीति को व्यक्तिगत मॉडलों के बजाय इन सिस्टम आर्किटेक्चर को लक्षित करना चाहिए।

Michael A. Riegler, Inga Strümke2026-05-12
📊 statistics

Empirical Bayes 1-bit matrix completion

यह शोध पत्र 1-बिट मैट्रिक्स पूर्णता (matrix completion) के लिए एक एम्पेरिकल बेयस (Empirical Bayes) विधि प्रस्तुत करता है, जो एफ्रोन-मॉरिस एस्टिमेटर (Efron–Morris estimator) से प्रेरित है, जो मौजूदा दृष्टिकोणों की तुलना में बेहतर भविष्य कहनेवाला सटीकता (predictive accuracy), अंशांकन विश्वसनीयता (calibration reliability) और गणनात्मक दक्षता प्राप्त करने के लिए लो-रैंक संरचनाओं का लाभ उठाता है।

Takeru Matsuda2026-05-12
🤖 machine learning

End-to-End Keyword Spotting on FPGA Using Graph Neural Networks with a Neuromorphic Auditory Sensor

यह शोध पत्र एक कीवर्ड स्पॉटिंग सिस्टम के पहले एंड-टू-एंड FPGA कार्यान्वयन को प्रस्तुत करता है जो एक न्यूरोमॉर्फिक ऑडिटरी सेंसर को ग्राफ न्यूरल नेटवर्क के साथ एकीकृत करता है, जो 87.43% सटीकता और सब-35 माइक्रोसेकंड विलंबता के साथ कच्चे इवेंट-आधारित ऑडियो स्ट्रीम के वास्तविक समय, कम-शक्ति प्रसंस्करण को प्राप्त करता है।

Wiktor Matykiewicz, Piotr Wzorek, Kamil Jeziorek, Tomás Muñoz, Antonio Rios-Navarro, Angel Jiménez-Fernández, Tomasz Kry (…)2026-05-12
🤖 machine learning

Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-Training

यह शोध पत्र ज्योमेट्री-कॉन्फ्लिक्ट वासरस्टीन मर्जिंग (GCWM) को प्रस्तुत करता है, जो एक डेटा-मुक्त विधि है जो टास्क ज्योमेट्री संघर्षों का विश्लेषण करके और उन अपडेट्स को एकीकृत करने के लिए गॉसियन वासरस्टीन बैरीसेंटर्स का उपयोग करके, जो मॉडल की विकसित होती अवस्था के साथ संगत बने रहते हैं, LLM निरंतरिक पोस्ट-ट्रेनिंग में कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) की व्याख्या और शमन करता है।

Yuanyi Wang, Yifan Yang, Su Lu, Yanggan Gu, Pengkai Wang, Wenjun Wang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Jialun Cao (…)2026-05-12
🤖 machine learning

Minimal Filling Architectures of Polynomial Neural Networks: Counterexamples, Frontier Search, and Defects

यह शोधपत्र फ्रंटियर सर्च के माध्यम से खोजे गए और रिकर्सिव डायमेंशन बाउंड्स द्वारा प्रमाणित किए गए एक प्रति-उदाहरण को प्रस्तुत करके, जिसमें पूर्व अवलोकनों के विपरीत बड़े डिफेक्ट्स वाले सब-आर्किटेक्चर शामिल हैं, पॉलीनोमियल न्यूरल नेटवर्क के लिए मिनिमल यूनिमोडल कंजेक्चर का खंडन करता है।

Kevin Dao, Jose Israel Rodriguez2026-05-12
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

यह शोध पत्र SmartEval को प्रस्तुत करता है, जो 9,000 LLM-जनित सॉलिडिटी (Solidity) अनुबंधों के एक संग्रह, एक पांच-आयामी मूल्यांकन मानदंड और एक प्रमाणित पाइपलाइन से युक्त एक व्यापक बेंचमार्क है, जो विशिष्ट विफलता मोड को प्रकट करता है और यह प्रदर्शित करता है कि LLM-जनित अनुबंध कार्यात्मक अनुपालन में ग्राउंड-ट्रुथ कार्यान्वयन से बेहतर प्रदर्शन कर सकते हैं।

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah2026-05-12