💬 NLP

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

यह शोध पत्र FlashBlock का प्रस्ताव करता है, जो एक नवीन तंत्र है जो वर्तमान ब्लॉक के बाहर के टोकन से स्थिर क्रॉस-स्टेप अटेंशन आउटपुट को कैश और पुन: उपयोग करके लॉन्ग-कॉन्टेक्स्ट ब्लॉक डिफ्यूजन को त्वरित करता है, जिससे जनरेशन की गुणवत्ता बनाए रखते हुए कम्प्यूटेशनल ओवरहेड और KV कैश एक्सेस को महत्वपूर्ण रूप से कम किया जा सकता है।

Zhuokun Chen, Jianfei Cai, Bohan Zhuang2026-07-07
💻 computer science

Geometric Observability Index: An Operator-Theoretic Framework for Per-Feature Sensitivity, Weak Observability, and Dynamic Effects in SE(3) Pose Estimation

यह शोध पत्र ज्योमेट्रिक ऑब्जर्वेबिलिटी इंडेक्स (GOI) प्रस्तुत करता है, जो एक ऑपरेटर-थ्योरेटिक ढांचा है जो SE(3) पोज़ एस्टीमेशन में प्रति-विशेषता संवेदनशीलता को परिमाणित करता है ताकि सूचनात्मक और हानिकारक मापों के बीच स्पष्ट रूप से अंतर किया जा सके, जिससे ची-स्क्वायर गेटिंग की मजबूती की व्याख्या होती है और साथ ही यह प्रदर्शित होता है कि यह कमजोर रूप से अवलोकन योग्य ज्यामिति (weakly observable geometries) में कैसे विफल होता है जहाँ रॉ-इन्फ्लुएंस गेटिंग त्रुटिवश उच्च-लीवरेज वाले इनलियर्स को अस्वीकार कर देती है।

Joe-Mei Feng, Sheng-Wei Yu, Hsin-Hsiung Kao2026-07-07
🤖 machine learning

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

यह शोध पत्र "ज्यामितीय हस्तक्षेप" (Geometric Interference) को मानक डिफ्यूजन ट्रांसफॉर्मर के प्रतिनिधित्व एनकोडर (representation encoders) पर अभिसरण (converge) करने में विफल होने के मौलिक कारण के रूप में पहचान करता है और जेकोबी नियमितीकरण (Jacobi Regularization) के साथ रिमानियन फ्लो मैचिंग (Riemannian Flow Matching - RJF) का प्रस्ताव करता है ताकि जनरेटिव प्रक्रियाओं को मैनिफोल्ड जियोडेसिक्स (manifold geodesics) तक सीमित किया जा सके, जिससे कम्प्यूटेशनल रूप से महंगे विड्थ स्केलिंग (width scaling) के बिना कुशल उच्च-निष्ठा संश्लेषण (high-fidelity synthesis) सक्षम हो सके।

Amandeep Kumar, Vishal M. Patel2026-07-07
🤖 machine learning

LGQ: Learnable Geometric Quantization for Image Tokenization

यह शोधपत्र लर्नबल ज्योमेट्रिक क्वांटाइजेशन (LGQ) प्रस्तुत करता है, जो एक नवीन इमेज टोकनाइजेशन विधि है जो एक डायवर्सिटी और पीक्डनेस टर्म द्वारा नियमित सॉफ्ट-टू-हार्ड असाइनमेंट रणनीति के साथ एक लर्नबल कोडबुक को जोड़कर कोलैप्स-फ्री ट्रेनिंग और श्रेष्ठ रिकंस्ट्रक्शन एवं जनरेशन प्रदर्शन प्राप्त करती है, जिससे EMA या कोडबुक रीपैरामीट्राइजेशन जैसे जटिल ह्यूरिस्टिक्स की आवश्यकता समाप्त हो जाती है।

Idil Bilge Altun, Mert Onur Cakiroglu, Elham Buxton, Mehmet Dalkilic, Hasan Kurban2026-07-07
💻 computer science

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

Difix3D-W एक नवीन फ्यू-शॉट 3D गॉसियन स्प्लेटिंग फ्रेमवर्क है जिसे अनकन्स्ट्रेंड रियल-वर्ल्ड परिदृश्यों के लिए डिज़ाइन किया गया है जो एक पुनर्गठित डिफ्यूजन मॉडल के साथ संदर्भ-निर्देशित दृश्य परिशोधन (रेफरेंस-गाइडेड व्यू रिफाइनमेंट), एक स्पर्सिटी-अवेयर गॉसियन रेप्लिकेशन रणनीति और LoRA-आधारित रेगुलाइजेशन का लाभ उठाकर उच्च-गुणवत्ता वाले रेंडरिंग को प्राप्त करता है और विचलित करने वाले तत्वों (डिस्ट्रैक्टर्स), अवरोधों (ऑक्लूजन) और विरल दृष्टिकोणों (स्पार्स व्यूपॉइंट्स) को प्रभावी ढंग से संभालता है।

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi2026-07-07
💻 computer science

Nano-U: Efficient Terrain Segmentation for Tiny Robot Navigation

यह शोध पत्र Nano-U प्रस्तुत करता है, जो एक अत्यधिक कॉम्पैक्ट बाइनरी सेगमेंटेशन नेटवर्क है जिसे क्वांटिज़ेशन-अवेयर डिस्टिलेशन (Quantization-Aware Distillation) के माध्यम से प्रशिक्षित किया गया है और एक Rust-आधारित कंपाइलर का उपयोग करके कम लागत वाले ESP32-S3 माइक्रोकंट्रोलर पर तैनात किया गया है ताकि अनस्ट्रक्चर्ड वातावरण में छोटे रोबोटों के लिए कुशल, कम-विलंबता वाली टेरेन परसेप्शन (terrain perception) को सक्षम बनाया जा सके।

Federico Pizzolato, Francesco Pasti, Nicola Bellotto2026-07-07
💻 computer science

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

यह शोध पत्र AudioX-Turbo को प्रस्तुत करता है, जो एक एकीकृत और कुशल ढांचा है जो लचीले 'एनीथिंग-टू-ऑडियो' जनरेशन के लिए टीचर-स्टूडेंट डिस्टिलेशन प्रतिमान (paradigm) और एक बड़े पैमाने पर क्यूरेटेड डेटासेट का लाभ उठाता है ताकि मल्टी-स्टेप बेसलाइन्स की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ उच्च-निष्ठा (high-fidelity), कुछ-चरणों वाला संश्लेषण (few-step synthesis) प्राप्त किया जा सके।

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike (…)2026-07-07
💻 computer science

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

यह शोध पत्र UNITY को प्रस्तुत करता है, जो एक यूनिवर्सल-टू-स्पेशलाइज्ड अडैप्टर है जो डिफ्यूजन-आधारित इमेज जनरेशन में अंतर्निहित आर्किटेक्चर को बदले बिना कुशल, स्केलेबल और अत्याधुनिक कंपोजिट कंडीशनिंग प्राप्त करने के लिए दो-चरणीय प्रशिक्षण प्रतिमान (two-stage training paradigm) और मॉर्फेबल अटेंशन फ्लो नेटवर्क का उपयोग करता है।

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma2026-07-07
💻 computer science

What Does the Brain See? Multiview Neural Representations to Demystify the Brain-Visual Alignment

यह शोध पत्र एक एकीकृत मल्टीव्यू ईईजी (EEG) प्रतिनिधित्व शिक्षण ढांचे का प्रस्ताव करता है जो अत्याधुनिक ज़ीरो-शॉट विज़ुअल डिकोडिंग और THINGS-EEG बेंचमार्क पर विषयों और सत्रों के बीच बेहतर सामान्यीकरण प्राप्त करने के लिए टेम्पोरल, स्पेक्ट्रल और स्थानिक न्यूरल डायनेमिक्स को संयुक्त रूप से मॉडल करता है।

Salini Yadav, Taveena Lotey, Pravendra Singh, Partha Pratim Roy2026-07-07
💻 computer science

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

यह शोध पत्र VulcanVoxel को प्रस्तुत करता है, जो एक स्थानिक अनुमान ढांचा (spatial inference framework) है जो अव्यवस्थित वातावरण में बिना एनोटेट किए गए वास्तविक दुनिया के डेटा से सीधे मल्टी-मोडल ब्लेड इंसर्शन अफोर्डेंस (multi-modal blade insertion affordances) सीखने के लिए 3D ऑक्यूपेंसी फील्ड्स पर मास्क किए गए ऑटोएनकोडर्स का उपयोग करता है, जो कवरेज और अनुमान गति दोनों में पारंपरिक पोज़-आधारित विधियों से काफी बेहतर प्रदर्शन करता है।

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal2026-07-07