💻 computer science

From Reconstruction to Interpretation: Zero-Setup Multi-Phase Segmentation of X-ray Tomography Data

यह शोध पत्र एक शून्य-सेटअप (zero-setup) ढांचे को प्रस्तुत करता है जो सिंक्रोट्रॉन एक्स-रे टोमोग्राफी डेटा के तीव्र, स्वचालित और व्याख्या योग्य मल्टी-फेज सेगमेंटेशन को सक्षम करने के लिए एक सामग्री-अज्ञेय (material-agnostic) मास्क तैयारी रणनीति को एक पूर्व-प्रशिक्षित सिमेंटिक सेगमेंटेशन नेटवर्क के साथ जोड़ता है, जिसके लिए किसी मैनुअल इनपुट, पुनर्रशिक्षण या डेटासेट-विशिष्ट एनोटेशन की आवश्यकता नहीं होती है।

Pradyumna Elavarthi, Arun J. Bhattacharjee, Harrison Lisabeth, Anca Ralescu, Petrus H. Zwart, Dilworth Parkinson, Elizab (…)2026-07-15
💻 computer science

Compos3D: Interactive Part-Based Composition for Creative Control in Generative 3D Models

Compos3D एक इंटरैक्टिव सिस्टम है जो जनरेटिव 3D मॉडलिंग में रचनात्मक नियंत्रण को बढ़ाता है, जिससे उपयोगकर्ता अनिश्चित बार-बार पुनरुत्पादन (रिजनरेशन) पर निर्भर रहने के बजाय कई उम्मीदवारों से चुने गए हिस्सों के रीमिक्सिंग वर्कफ़्लो के माध्यम से सुसंगत डिज़ाइन तैयार कर सकते हैं।

Faraz Faruqi, Sean J. Liu, George Fitzmaurice, Justin Matejka2026-07-15
💻 computer science

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

RegHead एक तेज़, फीड-फॉरवर्ड फ्रेमवर्क पेश करता है जो एक बड़े पैमाने के डेटासेट और एक सघन स्टोकेस्टिक एंकर मोशन रिप्रजेंटेशन का लाभ उठाकर एनिमेटेबल नॉन-ह्यूमनॉइड हेड अवतारों के लिए व्याख्यात्मक, सिमेंटिक ब्लेंडशेप सेट्स का निर्माण करता है ताकि मानव ट्रैकिंग संकेतों से उच्च-निष्ठा, वास्तविक समय वाला एक्सप्रेशन रिटारगेटिंग प्राप्त किया जा सके।

Jiahao Luo, Hao Zhang, Jianqi Chen, Yijie He, Jiaxu Zou, Michael Vasilkovsky, Sergei Korolev, Sergey Tulyakov, Chaoyang (…)2026-07-15
💻 computer science

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST-Engine एक नियत (deterministic) प्रणाली है जो प्राकृतिक भाषा को पूर्णतः एनोटेटेड, बहु-पात्र सिंथेटिक वीडियो में अनुवादित करती है, जो एक वाणिज्यिक गेम इंजन को संचालित करने के लिए पहले एक स्पष्ट, निरीक्षण योग्य "स्पेस और टाइम में इवेंट्स के ग्राफ" (GEST) को उत्पन्न करती है, जिससे टेम्पोरल कंसिस्टेंसी (temporal consistency) और ऑब्जेक्ट परमानेंस (object permanence) की गारंटी मिलती है और शून्य सीमांत एनोटेशन लागत पर समृद्ध ग्राउंड-ट्रुथ डेटा का उत्पादन होता है।

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu2026-07-15
💻 computer science

How to Realize Recursively Self-Improving Agents and Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

यह स्थिति और सिस्टम-डिज़ाइन पेपर पुनरावर्ती रूप से स्वयं को सुधारने वाले एजेंटों के लिए एक शासित मल्टी-एजेंट आर्किटेक्चर प्रस्तावित करता है जो लक्ष्य अनुबंधों (goal contracts), स्कोप्ड टूल उपयोग और सुरक्षा इनवेरियंट्स को औपचारिक रूप देकर "पर्सनल सिंगुलैरिटी" — एक सीमित मानव-AI सह-विकास उद्देश्य — प्राप्त करता है, ताकि नियंत्रण या सुरक्षा से समझौता किए बिना उपयोगकर्ता की क्षमताओं का विस्तार किया जा सके।

Chengshuai Yang2026-07-15
💻 computer science

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

यह शोध पत्र MobileSAM2 को प्रस्तुत करता है, जो संसाधन-सीमित उपकरणों पर छवियों और वीडियो में वस्तुओं को खंडित (segment) करने के लिए एक हल्का मॉडल परिवार है, जिसे एक नवीन हाइपरग्राफिकल नॉलेज डिस्टिलेशन (HyperKD) फ्रेमवर्क का उपयोग करके भारी-भरकम SAM2 को डिस्टिल करके प्राप्त किया गया है, जो प्रभावी रूप से टेम्पोरल और मल्टी-ग्रैनुलैरिटी ज्ञान को स्थानांतरित करता है।

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao2026-07-15
🤖 machine learning

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

यह शोधपत्र टेम्पोरल वीडियो VLM बेंचमार्क स्कोर को विघटित करने के लिए एक लेबल-मुक्त "रिवर्ज़ल-ड्रॉप" (reversal-drop) मीट्रिक प्रस्तुत करता है, जो यह प्रकट करता है कि मॉडल अक्सर विज़ुअल कंटेंट के बजाय पोजीशनल एनकोडिंग पर निर्भर होते हैं और यह प्रदर्शित करता है कि एग्रीगेट स्कोर, पोजीशन-डोमिनेंट और विज़ुअल-सीक्वेंस-डोमिनेंट आर्किटेक्चर के बीच विशिष्ट, गैर-परिवर्तनीय विफलता मोड को छिपा देते हैं।

Farrukh Rahman2026-07-15
💻 computer science

ProtoPointNet: Prototype-Based Interpretable Classification of 3D Dental Point Clouds with Verifiable Spatial Activations

यह शोध पत्र ProtoPointNet को प्रस्तुत करता है, जो एक व्याख्यात्मक प्रोटोटाइप-आधारित मॉडल है जो रजिस्टर्ड इंट्राओरल आर्क पेयर्स पर मल्टी-टास्क लर्निंग का लाभ उठाकर 3D डेंटल ऑक्लूजन को वर्गीकृत करता है और Bits2Bites डेटासेट पर उच्च प्रदर्शन प्राप्त करने के साथ-साथ अपने भविष्यवाणियों के लिए स्थानिक रूप से ग्राउंडेड और शारीरिक रूप से प्रशंसनीय दृश्य स्पष्टीकरण प्रदान करता है।

George V. Jose, Thao Liang Chiam, Toby Hughes, Dilan Patel, Alan Brook, Lyle J. Palmer, Nikhil Cherian Kurian2026-07-15
💻 computer science

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

यह शोध पत्र एक नवीन BCI-सचेत ढांचे का प्रस्ताव करता है जो धारणात्मक निष्ठा (perceptual fidelity) को अर्थपूर्ण पुनर्प्राप्ति (semantic recoverability) से अलग करके EEG-से-छवि पुनर्निर्माणों का मूल्यांकन करने के लिए विजन लैंग्वेज मॉडल्स का उपयोग करता है, और पारंपरिक पिक्सेल-आधारित एवं प्रतिनिधित्व मेट्रिक्स की सीमाओं को दूर करने के लिए BCI-Coherence Score (BCS) को प्रस्तुत करता है।

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik2026-07-15
💻 computer science

UMSS: Towards Unsupervised Multi-modal Semantic Segmentation

यह शोध पत्र UniM2 को प्रस्तुत करता है, जो अनसुपरवाइज्ड मल्टीमॉडल सिमेंटिक सेगमेंटेशन (UMSS) के लिए एक नवीन फ्रेमवर्क है, जो क्रॉस मोडल कॉरेस्पोंडेंस सिनर्जी और एक क्रॉस मोडल हारमोनाइज़र के माध्यम से एक एकीकृत लेटेंट स्पेस का लाभ उठाता है ताकि मानव एनोटेशन के बिना पूरक सेंसर जानकारी का प्रभावी ढंग से उपयोग किया जा सके, जिससे NYU डेप्थ v2 और MFNet डेटासेट पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Haitian Zhang, Thai Duy Nguyen, Xiangyuan Wang, Mohan Liu, Lin Wang2026-07-15