🤖 AI

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

FLUX3D एक स्केलेबल इमेज-टू-3D गॉसियन स्प्लेटिंग फ्रेमवर्क है जो डिफ्यूजन-अलाइन्ड स्ट्रक्चर्ड लेटेंट्स (DA-SLAT) और एक स्पार्स-स्ट्रक्चर-अवेयर डिफ्यूजन ट्रांसफार्मर (SMDiT) को पेश करके उच्च-निष्ठा वाले 3D जनरेशन में संरचनात्मक बाधाओं को दूर करता है ताकि प्रतिनिधित्व शिक्षण (representation learning) को बढ़ाया जा सके और सटीक 2D-3D संरेखण प्राप्त किया जा सके।

Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo2026-06-24
💻 computer science

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

FLAT एक नवीन फीडफॉरवर्ड फ्रेमवर्क पेश करता है जो विशेष रोटेशन पैरामीट्राइजेशन और एक प्रोडक्ट विंडो फंक्शन का उपयोग करके संकुचित वीडियो डिफ्यूजन लेटेंट्स को सीधे सतह-संरेखित (surface-aligned) ट्राएंगल स्प्लैट्स में डिकोड करता है, जो मौजूदा 3D गॉसियन-आधारित विधियों की तुलना में बेहतर ज्यामितीय सटीकता और गेम-इंजन-रेडी आउटपुट प्राप्त करता है।

Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari2026-06-24
💻 computer science

Build Once, Monitor Continuously: Persistent Semantic Mapping via Autonomous Exploration and Open-Vocabulary Object Updates

यह शोध पत्र एक मॉड्यूलर दो-चरणीय प्रणाली प्रस्तुत करता है जो ज्यामितीय मैपिंग को सिमेंटिक अपडेटिंग से अलग करती है ताकि एक बार 2D ऑक्यूपेंसी ग्रिड बनाकर और तत्पश्चात कई रोबोटिक दौरों के दौरान वस्तुओं के परिवर्तनों को निरंतर ट्रैक करने के लिए लाइटवेट ओपन-वोकेबुलरी डिटेक्शन का उपयोग करके इनडोर वातावरण की कुशल और निरंतर निगरानी सक्षम की जा सके।

Sai Haneesh Allu, Itay Kadosh, Tyler Summers, Yu Xiang2026-06-23
💻 computer science

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

यह शोध पत्र प्रकट करता है कि जनरेटिव एआई मॉडल, जिनमें स्टेबल डिफ्यूजन, चैटजीपीटी और जेमिनी शामिल हैं, इनपुट प्रॉम्प्ट के बावजूद भय उत्पन्न करने वाली छवियां बनाने की ओर एक व्यवस्थित पूर्वाग्रह प्रदर्शित करते हैं, जो संभवतः उनके प्रशिक्षण डेटा में भयपूर्ण सामग्री की अत्यधिक उपस्थिति के कारण है।

Maneet Mehta, Cody Buntain2026-06-23
🤖 machine learning

Is Oracle Pruning the True Oracle?

यह शोध पत्र इस लंबे समय से चली आ रही धारणा को चुनौती देता है कि ओरैकल प्रूनिंग (oracle pruning) प्रभावी रूप से महत्वहीन भारों की पहचान करती है, और व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि प्री-रिट्रेनिंग प्रदर्शन का पोस्ट-रिट्रेनिंग परिणामों के साथ नगण्य सहसंबंध है, जिससे यह सुझाव मिलता है कि कई मौजूदा प्रूनिंग विधियों का मौलिक आधार संदिग्ध है और प्रूनिंग मानदंडों को रिट्रेनिंग चरण को ध्यान में रखना चाहिए।

Sicheng Feng, Keda Tao, Huan Wang2026-06-23
🤖 AI

Automatic Vehicle Detection using DETR: A Transformer-Based Approach for Navigating Treacherous Roads

यह शोध पत्र डिटेक्शन ट्रांसफॉर्मर (DETR) आर्किटेक्चर को एक कोलाबोरेटिव हाइब्रिड असाइनमेंट्स ट्रेनिंग स्कीम (Co-DETR) के साथ अनुकूलित करके चुनौतीपूर्ण ड्राइविंग वातावरण में स्वचालित वाहन पहचान के लिए एक नवीन दृष्टिकोण प्रस्तुत करता है, जो BadODD डेटासेट पर YOLO और Faster R-CNN जैसे पारंपरिक CNN-आधारित तरीकों की तुलना में बेहतर सटीकता और दक्षता प्रदर्शित करता है।

Istiaq Ahmed Fahad, Abdullah Ibne Hanif Arean, Nazmus Sakib Ahmed, Mahmudul Hasan2026-06-23
🔬 physics

AI-Augmented Thyroid Scintigraphy for Robust Classification of Disease

यह अध्ययन प्रदर्शित करता है कि फ्लो मैचिंग-आधारित डेटा ऑग्मेंटेशन, थायराइड स्किंटिग्राफी के लिए डीप लर्निंग मॉडल्स की वर्गीकरण सटीकता और इमेज फिडेलिटी को बढ़ाने में स्टेबल डिफ्यूजन और पारंपरिक तरीकों दोनों से बेहतर प्रदर्शन करता है, जो सीमित और असंतुलित डेटासेट से थायराइड विकारों के निदान के लिए एक सुदृढ़ समाधान प्रदान करता है।

Maziar Sabouri, Ghasem Hajianfar, Alireza Rafiei Sardouei, Milad Yazdani, Azin Asadzadeh, Soroush Bagheri, Mohsen Arabi (…)2026-06-23
🤖 AI

Brain-Inspired Stochastic Joint Embedding Representation Learning

यह शोध पत्र PhiNet v2 प्रस्तुत करता है, जो एक मस्तिष्क-प्रेरित आर्किटेक्चर है जो मजबूत स्व-पर्यवेक्षित (self-supervised) निरूपण सीखने के लिए टेम्पोरल विजुअल सीक्वेंस और वेरिएशनल इन्फरेंस का लाभ उठाता है, जो बिना किसी सशक्त डेटा ऑग्मेंटेशन पर निर्भर हुए प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और मानव दृश्य प्रसंस्करण के साथ अधिक निकटता से संरेखित होता है।

Makoto Yamada, Kian Ming A. Chai, Ayoub Rhim, Satoki Ishikawa, Mohammad Sabokrou, Yao-Hung Hubert Tsai2026-06-23
🤖 AI

Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering

Render-FM एक फीडफॉरवर्ड मॉडल है जो एनाटॉमी-गाइडेड प्राइमिंग मैकेनिज्म के माध्यम से सेगमेंटेशन मास्क और ट्रांसफर फंक्शन्स को शामिल करके, पारंपरिक न्यूरल विधियों के अत्यधिक अनुकूलन समय की बाधा को दूर करते हुए, सीधे 2.8 सेकंड में 6D गॉसियन स्प्लेटिंग मापदंडों को रिग्रेस करके CT स्कैन का वास्तविक समय में, फोटो-यथार्थवादी वॉल्यूमेट्रिक रेंडरिंग प्राप्त करता है।

Zhongpai Gao, Benjamin Planche, Meng Zheng, Anwesa Choudhuri, Terrence Chen, Ziyan Wu2026-06-23
💻 computer science

Thalia: A Global, Multi-Modal Dataset for Volcanic Activity Monitoring

यह शोध पत्र थालिया (Thalia) को प्रस्तुत करता है, जो 38 स्थानिक-कालिक डेटा क्यूब्स (spatiotemporal datacubes), विशेषज्ञ एनोटेशन और वायुमंडलीय चरों से युक्त एक वैश्विक, बहु-मोडल डेटासेट है, जिसका उद्देश्य डेटा की कमी को दूर करना और इनसार (InSAR) का उपयोग करके ज्वालामुखीय विरूपण की डीप लर्निंग-आधारित स्वचालित निगरानी को उन्नत करना है।

Nikolas Papadopoulos, Nikolaos Ioannis Bountos, Maria Sdraka, Andreas Karavias, Gustau Camps-Valls, Ioannis Papoutsis2026-06-23✓ Author reviewed