💻 computer science

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

यह शोध पत्र प्रकट करता है कि जनरेटिव एआई मॉडल, जिनमें स्टेबल डिफ्यूजन, चैटजीपीटी और जेमिनी शामिल हैं, इनपुट प्रॉम्प्ट के बावजूद भय उत्पन्न करने वाली छवियां बनाने की ओर एक व्यवस्थित पूर्वाग्रह प्रदर्शित करते हैं, जो संभवतः उनके प्रशिक्षण डेटा में भयपूर्ण सामग्री की अत्यधिक उपस्थिति के कारण है।

Maneet Mehta, Cody Buntain2026-06-23
🤖 machine learning

Is Oracle Pruning the True Oracle?

यह शोध पत्र इस लंबे समय से चली आ रही धारणा को चुनौती देता है कि ओरैकल प्रूनिंग (oracle pruning) प्रभावी रूप से महत्वहीन भारों की पहचान करती है, और व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि प्री-रिट्रेनिंग प्रदर्शन का पोस्ट-रिट्रेनिंग परिणामों के साथ नगण्य सहसंबंध है, जिससे यह सुझाव मिलता है कि कई मौजूदा प्रूनिंग विधियों का मौलिक आधार संदिग्ध है और प्रूनिंग मानदंडों को रिट्रेनिंग चरण को ध्यान में रखना चाहिए।

Sicheng Feng, Keda Tao, Huan Wang2026-06-23
🤖 AI

Automatic Vehicle Detection using DETR: A Transformer-Based Approach for Navigating Treacherous Roads

यह शोध पत्र डिटेक्शन ट्रांसफॉर्मर (DETR) आर्किटेक्चर को एक कोलाबोरेटिव हाइब्रिड असाइनमेंट्स ट्रेनिंग स्कीम (Co-DETR) के साथ अनुकूलित करके चुनौतीपूर्ण ड्राइविंग वातावरण में स्वचालित वाहन पहचान के लिए एक नवीन दृष्टिकोण प्रस्तुत करता है, जो BadODD डेटासेट पर YOLO और Faster R-CNN जैसे पारंपरिक CNN-आधारित तरीकों की तुलना में बेहतर सटीकता और दक्षता प्रदर्शित करता है।

Istiaq Ahmed Fahad, Abdullah Ibne Hanif Arean, Nazmus Sakib Ahmed, Mahmudul Hasan2026-06-23
🔬 physics

AI-Augmented Thyroid Scintigraphy for Robust Classification of Disease

यह अध्ययन प्रदर्शित करता है कि फ्लो मैचिंग-आधारित डेटा ऑग्मेंटेशन, थायराइड स्किंटिग्राफी के लिए डीप लर्निंग मॉडल्स की वर्गीकरण सटीकता और इमेज फिडेलिटी को बढ़ाने में स्टेबल डिफ्यूजन और पारंपरिक तरीकों दोनों से बेहतर प्रदर्शन करता है, जो सीमित और असंतुलित डेटासेट से थायराइड विकारों के निदान के लिए एक सुदृढ़ समाधान प्रदान करता है।

Maziar Sabouri, Ghasem Hajianfar, Alireza Rafiei Sardouei, Milad Yazdani, Azin Asadzadeh, Soroush Bagheri, Mohsen Arabi (…)2026-06-23
🤖 AI

Brain-Inspired Stochastic Joint Embedding Representation Learning

यह शोध पत्र PhiNet v2 प्रस्तुत करता है, जो एक मस्तिष्क-प्रेरित आर्किटेक्चर है जो मजबूत स्व-पर्यवेक्षित (self-supervised) निरूपण सीखने के लिए टेम्पोरल विजुअल सीक्वेंस और वेरिएशनल इन्फरेंस का लाभ उठाता है, जो बिना किसी सशक्त डेटा ऑग्मेंटेशन पर निर्भर हुए प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और मानव दृश्य प्रसंस्करण के साथ अधिक निकटता से संरेखित होता है।

Makoto Yamada, Kian Ming A. Chai, Ayoub Rhim, Satoki Ishikawa, Mohammad Sabokrou, Yao-Hung Hubert Tsai2026-06-23
🤖 AI

Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering

Render-FM एक फीडफॉरवर्ड मॉडल है जो एनाटॉमी-गाइडेड प्राइमिंग मैकेनिज्म के माध्यम से सेगमेंटेशन मास्क और ट्रांसफर फंक्शन्स को शामिल करके, पारंपरिक न्यूरल विधियों के अत्यधिक अनुकूलन समय की बाधा को दूर करते हुए, सीधे 2.8 सेकंड में 6D गॉसियन स्प्लेटिंग मापदंडों को रिग्रेस करके CT स्कैन का वास्तविक समय में, फोटो-यथार्थवादी वॉल्यूमेट्रिक रेंडरिंग प्राप्त करता है।

Zhongpai Gao, Benjamin Planche, Meng Zheng, Anwesa Choudhuri, Terrence Chen, Ziyan Wu2026-06-23
💻 computer science

Thalia: A Global, Multi-Modal Dataset for Volcanic Activity Monitoring

यह शोध पत्र थालिया (Thalia) को प्रस्तुत करता है, जो 38 स्थानिक-कालिक डेटा क्यूब्स (spatiotemporal datacubes), विशेषज्ञ एनोटेशन और वायुमंडलीय चरों से युक्त एक वैश्विक, बहु-मोडल डेटासेट है, जिसका उद्देश्य डेटा की कमी को दूर करना और इनसार (InSAR) का उपयोग करके ज्वालामुखीय विरूपण की डीप लर्निंग-आधारित स्वचालित निगरानी को उन्नत करना है।

Nikolas Papadopoulos, Nikolaos Ioannis Bountos, Maria Sdraka, Andreas Karavias, Gustau Camps-Valls, Ioannis Papoutsis2026-06-23✓ Author reviewed
🤖 AI

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

यह शोध पत्र CLAR का प्रस्ताव करता है, जो एक नवीन 3D प्री-ट्रेनिंग फ्रेमवर्क है जो स्थानिक-ज्यामितीय (spatial-geometric) और अर्थ संबंधी (semantic) विशेषताओं के बीच के समझौते को दूर करने के लिए मास्क्ड ऑटोएनकोइंग (masked autoencoding) को बहु-स्तरीय कंट्रास्टिव अलाइनमेंट (multi-level contrastive alignment) के साथ समन्वित करता है, जिससे रोबोटिक मैनिपुलेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang2026-06-23
🤖 machine learning

L-SR1: Learned Symmetric-Rank-One Preconditioning

यह शोध पत्र L-SR1 का प्रस्ताव करता है, जो एक हल्का सीखा हुआ (learned) सेकंड-ऑर्डर ऑप्टिमाइज़र है जो बेहतर सामान्यीकरण और प्रदर्शन प्राप्त करने के लिए क्लासिकल सिमेट्रिक-रैंक-वन एल्गोरिदम को एक ट्रेन करने योग्य प्रीकंडीशनिंग यूनिट के साथ बढ़ाता है, जिसमें एनोटेटेड डेटा या फाइन-ट्यूनिंग की आवश्यकता नहीं होती है।

Gal Lifshitz, Shahar Zuler, Ori Fouks, Dan Raviv2026-06-23
🤖 AI

Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

यह शोध पत्र FOCUS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) और आर्किटेक्चर-अज्ञेय (architecture-agnostic) विधि है जो आंशिक रूप से मास्क किए गए इनपुट्स से लॉजिट्स (logits) को एकत्रित करके और उन्हें केवल शोर-आधारित संदर्भों (noise-only references) के साथ परिष्कृत करके लार्ज विजन-लैंग्वेज मॉडल्स में क्रॉस-इमेज सूचना रिसाव को कम करती है, जिससे मल्टी-इमेज और वीडियो समझ के कार्यों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe2026-06-23