💻 computer science

CAOA -- Completion-Assisted Object-CAD Alignment

यह शोध पत्र CAOA को प्रस्तुत करता है, जो एक संदर्भ-जागरूक पॉइंट क्लाउड कंप्लीशन मॉड्यूल को समरूपता-जागरूक पोज़ एस्टीमेशन एल्गोरिदम के साथ जोड़ता है ताकि शोर वाले इनडोर RGB-D स्कैनों से CAD मॉडल को संरेखित करने की सटीकता में महत्वपूर्ण सुधार किया जा सके, जिसे एक नई सिंथेटिक-टू-रियल डेटा रणनीति और S2C-Completion बेंचमार्क डेटासेट द्वारा समर्थित किया गया है।

Hiranya Garbha Kumar, Minhas Kamal, Balakrishnan Prabhakaran2026-06-19
💻 computer science

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

RegimeVGGT एक प्रशिक्षण-मुक्त त्वरण विधि है जो स्पेक्ट्रल और कॉज़ल विश्लेषणों के माध्यम से पहचाने गए विशिष्ट कार्यात्मक क्षेत्रों के लिए अनुकूलित लेयर-वाइज, टू-एक्सिस संपीड़न रणनीतियों को लागू करके विजुअल ज्योमेट्री ग्राउंडेड ट्रांसफॉर्मर्स के लिए 6.7 गुना की गति वृद्धि प्राप्त करती है, जिससे घने 3D पुनर्निर्माण की गुणवत्ता को बनाए रखते हुए अनावश्यक क्रॉस-फ्रेम अटेंशन को समाप्त किया जाता है।

Jinhao You (University of Pennsylvania), Shuo Lyu (University of Pennsylvania), Zhuohang Lyu (University of Pennsylvania (…)2026-06-19
💻 computer science

Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

यह शोध पत्र कंसेंसस फ्रेम GRPO (CF-GRPO) को प्रस्तुत करता है, जो एक टेम्पोरल-एनोटेशन-फ्री सुदृढीकरण शिक्षण ढांचा है जो वीडियो संकेतों से प्राप्त एक अंतर्निहित कंसेंसस प्रायर के साथ मॉडल-जनित फ्रेम उपयोग को संरेखित करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में वीडियो तर्क क्षमता को बढ़ाता है, जिससे मानव एनोटेशन की आवश्यकता के बिना व्याख्या योग्य, साक्ष्य-जागरूक मार्गदर्शन प्रदान किया जाता है।

Chengwen Liu, Zhe Huang, Jisheng Dang, Hong Peng, Qi Tian, Tat-Seng Chua2026-06-19
💻 computer science

Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

यह शोध पत्र ReFine3D को प्रस्तुत करता है, जो एक नियमितीकृत फाइन-ट्यूनिंग फ्रेमवर्क है जो चयनात्मक लेयर ट्यूनिंग को मल्टी-व्यू कंसिस्टेंसी, टेक्स्ट डाइवर्सिटी और टेस्ट-टाइम ऑग्मेंटेशन के साथ जोड़कर 3D विजन-लैंग्वेज मॉडल्स की डोमेन जनरलाइजेशन क्षमता को बढ़ाता है, ताकि न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ विभिन्न बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त किया जा सके।

Sneha Paul, Zachary Patterson, Nizar Bouguila2026-06-19
💻 computer science

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

यह शोध पत्र डेटा-फोर्सिंग डिस्टिलेशन (DFD) को प्रस्तुत करता है, जो एक सरल पोस्ट-ट्रेनिंग फ्रेमवर्क है जो टीचर स्कोर विसंगतियों (teacher score discrepancies) का लाभ उठाकर स्टूडेंट मॉडल्स को वास्तविक-डेटा वितरण की ओर निर्देशित करके, कुछ-चरणों वाले वीडियो जनरेशन में विविधता हानि (diversity loss) और ओवर-सैचुरेशन आर्टिफैक्ट्स को हल करता है, जिससे फिडेलिटी प्रभावी रूप से बहाल होती है और न्यूनतम फाइन-ट्यूनिंग के साथ टीचर के प्रदर्शन को भी पार कर जाती है।

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao2026-06-19
💻 computer science

Vines-DB: An RGB image dataset for multi-species ornamental vine segmentation

Vines-DB डेटासेट सात सजावटी बेल प्रजातियों की 1,218 उच्च-रिज़ॉल्यूशन वाली RGB छवियां प्रदान करता है जिन्हें विविध क्षेत्रीय स्थितियों के तहत मैन्युअल बहुभुज एनोटेशन के साथ कैप्चर किया गया है, जिन्हें सटीक बागवानी और शहरी पारिस्थितिकी में मल्टी-क्लास इंस्टेंस सेगमेंटेशन के लिए डीप लर्निंग मॉडल के विकास और मूल्यांकन का समर्थन करने के लिए 2,307 छवियों तक बढ़ाया गया है।

Saroj Burlakoti (Utah State University), Utsav Bhandari (Utah State University), Aaron Etienne (Utah State University) (…)2026-06-19
💻 computer science

Neural Phase Correlation

यह शोध पत्र "न्यूरल फेज कोरिलेशन" प्रस्तुत करता है, जो शास्त्रीय फेज कोरिलेशन विधि का एक सीखा हुआ सामान्यीकरण है जो रिजिड और नॉन-रिजिड विरूपणों को संभालने के लिए ट्रांसफॉर्मेशन बेसिस को सीखता है, चिकित्सा इमेज रजिस्ट्रेशन में अत्याधुनिक प्रदर्शन प्राप्त करता है और अवलोकन युग्मों से क्वांटम मैकेनिकल गुणों को सफलतापूर्वक पुनर्प्राप्त करता है।

Cole Reynolds2026-06-19
💻 computer science

Architectural Bias in Face Presentation Attack Detection: A Comparative Study of Vision Transformers and Convolutional Neural Networks

यह अध्ययन प्रदर्शित करता है कि प्रीट्रेन्ड विजन ट्रांसफॉर्मर आर्किटेक्चर, विशेष रूप से DeiT-S, उच्च सटीकता प्राप्त करके, विभिन्न जातीय समूहों के बीच जनसांख्यिकीय पूर्वाग्रह को काफी कम करके, और अनदेखी आबादी के प्रति बेहतर सामान्यीकरण प्रदान करके, फेस प्रेजेंटेशन अटैक डिटेक्शन में कनवल्शनल बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Ngela Landon Ntung, Floride Tuyisenge, Jema David Ndibwile2026-06-19
💻 computer science

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops

यह शोध पत्र CHIEF को प्रस्तुत करता है, जो एक मानव-AI सह-सृजन ढांचा (human-AI co-creation framework) है जो निर्माता-संचालित पुनरावृत्ति परिशोधन (creator-driven iterative refinement) को स्वचालित, व्यक्तित्व-आधारित बहुविध फीडबैक लूप्स (persona-conditioned multimodal feedback loops) के साथ एकीकृत करके दीर्घ-रूप वीडियो निर्माण की कथात्मक सुसंगतता और रचनात्मक दिशा को बढ़ाता है।

Denis Savytski, Aiden Lei, Heding Liu, Warren Yang, Sihan Liang, Alexander Liu, Zhe Zhao2026-06-19
💻 computer science

BrainFusionNet: a deep learning and XAI model to understand local, global, and sequential features of MRI images for improved brain tumour detection

ब्रेनफ्यूजननेट (BrainFusionNet) एक नवीन हाइब्रिड डीप लर्निंग मॉडल है जो शोर युक्त एमआरआई (MRI) छवियों से स्थानीय, वैश्विक और अनुक्रमिक विशेषताओं को प्रभावी ढंग से कैप्चर करने के लिए सीएनएन (CNNs), विजन ट्रांसफॉर्मर्स (Vision Transformers) और जीआरयू (GRUs) को व्याख्यात्मक एआई (explainable AI) तकनीकों के साथ एकीकृत करता है, जो ब्रेन ट्यूमर का पता लगाने में 98% सटीकता प्राप्त करता है और यह प्रदर्शित करता है कि पिक्सेल तीव्रता वितरण वर्गीकरण प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है।

Md Taimur Ahad, Bo Song, Yan Li2026-06-19