🤖 AI

Introspection Adapters: Training LLMs to Report Their Learned Behaviors

यह शोध पत्र इंट्रोस्पेक्शन एडेप्टर्स (Introspection Adapters) का परिचय देता है, जो एक स्केलेबल विधि है जिसमें LoRA का उपयोग करके बड़े भाषा मॉडलों को उनके अपने सीखे हुए व्यवहारों को मौखिक रूप से रिपोर्ट करने के लिए प्रशिक्षित किया जाता है, जिससे उन सूक्ष्म या हानिकारक लक्षणों के प्रभावी ऑडिटिंग को सक्षम बनाया जा सके जो तब भी मौजूद हो सकते हैं जब उन मॉडलों को एडेप्टर के प्रशिक्षण डेटा से भिन्न तरीके से प्रशिक्षित किया गया हो।

Keshav Shenoy, Li Yang, Abhay Sheshadri, Sören Mindermann, Jack Lindsey, Sam Marks, Rowan Wang2026-04-29
💻 computer science

Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers

यह शोधपत्र हार्डवेयर-त्वरित सिंगल-बोर्ड कंप्यूटरों पर लार्ज लैंग्वेज मॉडल्स के प्रदर्शन और दक्षता का मूल्यांकन करने के लिए एक बहु-आयामी बेंचमार्किंग पद्धति प्रस्तावित करता है, जो गोपनीयता-संवेदनशील और कनेक्टिविटी-सीमित एज वातावरण में जनरेटिव एआई को तैनात करने के लिए व्यावहारिक मार्गदर्शन प्रदान करता है।

Harri Renney, Fouad Trad, Michael Mattarock, Zena Wood2026-04-29
🤖 machine learning

Liquid Neural Network Models for Natural Gas Spot Price Time-Series Forecasting

यह शोध पत्र हेनरी हब प्राकृतिक गैस स्पॉट कीमतों की अल्पकालिक पूर्वानुमान सटीकता में सुधार के लिए लिक्विड न्यूरल नेटवर्क का उपयोग करने का प्रस्ताव देता है, जो बाजार की अस्थिर, गैर-स्थिर और शासन-परिवर्तित (regime-shifting) गतिशीलता के प्रति निरंतर अनुकूलित होने की उनकी क्षमता का लाभ उठाता है।

Yiqian Liu, Jiayi Niu, Adam Kelleher, Subhabrata Das2026-04-29
🤖 machine learning

Architecture Determines Observability in Transformers

यह शोध पत्र प्रदर्शित करता है कि एक ट्रांसफार्मर की अपने स्वयं के निर्णय की गुणवत्ता के बारे में संकेतों को आंतरिक रूप से संरक्षित करने की क्षमता (अवलोकनीयता) एक सामान्य गुण नहीं है, बल्कि विशिष्ट वास्तुशिल्प विकल्पों और प्रशिक्षण विधियों द्वारा निर्धारित एक उभरत् विशेषता है, जो अक्सर उन मॉडलों में भी समाप्त हो जाती है जो अन्यथा कम लॉस (loss) प्राप्त करते हैं।

Thomas Carmichael2026-04-29
💻 computer science

Versioned Late Materialization for Ultra-Long Sequence Training in Recommendation Systems at Scale

यह शोधपत्र एक वर्शन्ड लेट मटेरियलाइजेशन (versioned late materialization) प्रतिमान प्रस्तुत करता है जो उपयोगकर्ता इंटरैक्शन इतिहास को एक बार संग्रहीत करके और अनुक्रमों को जस्ट-इन-टाइम (just-in-time) पुनर्गठित करके अल्ट्रा-लॉन्ग सीक्वेंस ट्रेनिंग में डेटा रिडंडेंसी को समाप्त करता है, जिससे स्केलेबल, उच्च-गुणवत्ता वाले डीप लर्निंग रिकमेंडेशन मॉडल्स को सक्षम करने के लिए स्टोरेज और I/O बाधाओं को दूर किया जा सके।

Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Srees (…)2026-04-29
🤖 machine learning

A Comparative Analysis on the Performance of Upper Confidence Bound Algorithms in Adaptive Deep Neural Networks

यह शोध पत्र एज कंप्यूटिंग में सटीकता, ऊर्जा खपत और विलंबता के बीच के संतुलन को अनुकूलित करने के लिए एडेप्टिव डीप न्यूरल नेटवर्क्स के भीतर चार उन्नत अपर कॉन्फिडेंस बाउंड रणनीतियों (UCB-V, UCB-Tuned, UCB-Bayes, और UCB-BwK) को प्रस्तुत और मूल्यांकित करता है, जो यह प्रदर्शित करता है कि UCB-V और UCB-Tuned पारेटो फ्रंटियर्स पर बेहतर प्रदर्शन प्राप्त करते हैं।

Grigorios Papanikolaou, Ioannis Kontopoulos, Konstantinos Tserpes2026-04-29
🤖 machine learning

Time-varying Interaction Graph ODE for Dynamic Graph Representation Learning

यह शोधपत्र TI-ODE का प्रस्ताव करता है, जो एक नवीन ढांचा है जो ग्राफ ODE विकास को समय-निर्भर सीखने योग्य इंटरेक्शन बेसिस फंक्शन्स में विघटित करके डायनेमिक ग्राफ रिप्रजेंटेशन लर्निंग को बढ़ाता है, जिससे विविध और विकसित होते इंटर-नोड पैटर्न को प्रभावी ढंग से कैप्चर करने के साथ-साथ अत्याधुनिक प्रदर्शन और बेहतर मजबूती प्राप्त होती है।

Xiaoyi Wang, Zhiqiang Wang, Jianqing Liang, Xingwang Zhao, Chuangyin Dang, Zhen Jin, Jiye Liang2026-04-29
🤖 machine learning

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

यह शोध पत्र संरचित पीढ़ी कार्यों (structured generation tasks) पर मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स (MDMs) की प्रशिक्षण क्षमता की जांच करता है, जो यह प्रकट करता है कि मानक रैंडम-मास्किंग दृष्टिकोण अस्थिरता से ग्रस्त हैं और ऑटोरेग्रेसिव स्थिरता के साथ डिफ्यूजन-आधारित योजना के लाभों को प्रभावी ढंग से संतुलित करने के लिए नवीन ब्लॉकवाइज़ लोकैलिटी-अवेयर मॉडल्स, जिगसॉ (Jigsaw) और स्कैटर (Scatter), का प्रस्ताव करता है।

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu2026-04-29
💻 computer science

MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives

MotionBricks एक स्केलेबल, रियल-टाइम जनरेटिव फ्रेमवर्क है जो मोशन सिंथेसिस में उद्योग की सीमाओं को दूर करने के लिए स्मार्ट प्रिमिटिव्स के साथ एक मॉड्यूलर लेटेंट बैकबोन को जोड़ता है, जो एनिमेशन प्रोडक्शन और रोबोटिक अनुप्रयोगों दोनों के लिए 15,000 FPS पर उच्च-गुणवत्ता वाला, मल्टी-मोडल नियंत्रण सक्षम करता है।

Tingwu Wang, Olivier Dionne, Michael De Ruyter, David Minor, Davis Rempe, Kaifeng Zhao, Mathis Petrovich, Ye Yuan, Chenr (…)2026-04-29
⚛️ phenomenology

spectroxide: A code package for computing cosmic microwave background spectral distortions

यह शोध पत्र *spectroxide* को प्रस्तुत करता है, जो कॉस्मिक माइक्रोवेव बैकग्राउंड स्पेक्ट्रल विरूपणों की गणना के लिए एक AI-सहायता प्राप्त रस्ट (Rust) और पायथन (Python) कोड पैकेज है, और इसे एक केस स्टडी के रूप में प्रस्तुत करता है जो AI-संचालित वैज्ञानिक सॉफ्टवेयर विकास के दौरान स्वचालित परीक्षणों द्वारा अनदेखी की गई भौतिकी-विशिष्ट त्रुटियों की पहचान करने में मानव डोमेन विशेषज्ञता की महत्वपूर्ण भूमिका को प्रदर्शित करता है।

Ethan Baker, Hongwan Liu, Siddharth Mishra-Sharma2026-04-29