🤖 AI

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

यह शोध पत्र DiffUE को प्रस्तुत करता है, जो एक नवीन विधि है जो डिफ्यूजन-आधारित ऑटोएनकोडर के माध्यम से सिमेंटिक स्पेस में अदृश्य शोर (imperceptible noise) इंजेक्ट करके इमेज उपयोगिता और अनलर्नैबिलिटी (unlearnability) के बीच के संतुलन को बेहतर बनाती है, जिससे प्रभावी रूप से पुन: सीखने की रणनीतियों का विरोध करने वाली और दृश्य निष्ठा (visual fidelity) बनाए रखने वाली मजबूत, उच्च-गुणवत्ता वाली छवियां निर्मित होती हैं।

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu2026-07-14
🤖 machine learning

End-to-End Real-Time Drone-Based Person Detection Framework Using Deep Learning

यह शोध पत्र ड्रोन-आधारित निगरानी के लिए एक एंड-टू-एंड रियल-टाइम व्यक्ति पहचान फ्रेमवर्क प्रस्तुत करता है जो ऊंचाई में बदलाव के कारण होने वाले स्केल परिवर्तनों को प्रभावी ढंग से संभालने के लिए VisDrone2019 डेटासेट पर प्रशिक्षित YOLOv8-nano मॉडल का लाभ उठाता है, जिससे 16 और 25 मीटर के बीच की ऊंचाइयों पर 41 FPS से अधिक की विश्वसनीय पहचान प्राप्त होती है।

Payel Sarmah, Ayush Ranjan, Piyush Kaushik Bhattacharyya, Anil Kr. Shaw, Pradip Kr. Das2026-07-14
🤖 AI

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

यह शोधपत्र WasteAssistant को प्रस्तुत करता है, जो एक विनियमन-निर्देशित विजुअल क्वेश्चन अनस्वियरिंग फ्रेमवर्क है जो अपशिष्ट पृथक्करण की सटीकता में सुधार करने और भारत के ठोस अपशिष्ट प्रबंधन नियम 2016 का अनुपालन सुनिश्चित करने के लिए मल्टीमॉडल लैंग्वेज मॉडल्स और एक नए डेटासेट का लाभ उठाता है।

Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya2026-07-14
🔬 materials science

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

यह शोध पत्र औद्योगिक विज़ुअल निरीक्षण के फ्यू-शॉट (few-shot) कार्यों के लिए छोटे विज़न-लैंग्वेज मॉडल्स को तेज़ी से अनुकूलित करने हेतु 'आंसर-कंडीशन्ड चेन-ऑफ-थॉट डिस्टिलेशन' का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि सही लेबल पर आधारित तर्क उत्पन्न करना, न्यूनतम डेटा पर प्रशिक्षित होने पर, डायरेक्ट फाइन-ट्यूनिंग और यहाँ तक कि GPT-4.1 जैसे बड़े मॉडल्स की तुलना में भी काफी बेहतर प्रदर्शन करता है।

Shubham Rao2026-07-14
💻 computer science

Incremental Online Scene Reconstruction by 3D Gaussian Triangulation

यह शोध पत्र एक वृद्धिशील ऑनलाइन ढांचे (incremental online framework) का प्रस्ताव करता है जो एक नवीन मेशिंग एल्गोरिदम, प्लेन-आधारित संरेखण बाधाओं (plane-based alignment constraints) और अनुकूलित क्षेत्रों के गतिशील फ्रीजिंग (dynamic freezing) के माध्यम से ऑफलाइन निहित रूपांतरणों (offline implicit conversions) की सीमाओं को पार करते हुए, घने 3D गॉसियन प्रिमिटिव्स को सीधे उच्च-निष्ठा वाले स्पष्ट मेश (high-fidelity explicit meshes) में त्रिकोणीयकरण (triangulate) करता है, ताकि बेहतर रेंडरिंग गुणवत्ता और पुनर्निर्माण सटीकता प्राप्त की जा सके।

Yanjin Zhu, Shaofan Liu, Jianke Zhu2026-07-14
🤖 machine learning

On the modality gap and the contrastive loss in multi-modal representation learning

यह शोध पत्र CLIP-शैली के कंट्रास्टिव लर्निंग में मोडैलिटी गैप (modality gap) को स्वतंत्र एनकोडर के साथ InfoNCE ऑब्जेक्टिव की लो-टेम्परेचर विफलता के रूप में पहचानता है और xNCE का प्रस्ताव देता है, जो एक संशोधित लॉस फंक्शन है जिसमें इंट्रा-मोडैलिटी नेगेटिव्स (intra-modality negatives) शामिल हैं जो रिट्रीवल एक्यूरेसी से समझौता किए बिना ज़ीरो-शॉट क्लासिफिकेशन प्रदर्शन में सुधार करते हुए इस गैप को समाप्त करता है।

Fabian Mager, Hiba Nassar, Lars Kai Hansen2026-07-14
💻 computer science

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

यह शोध पत्र प्रदर्शित करता है कि रेक्टिफाइड-फ्लो ड्राइविंग वर्ल्ड मॉडल्स में बिना पुन: प्रशिक्षण के, नियोजित प्रक्षेप पथों (ट्रैजेक्टरीज) को निर्देशित करने के लिए डिफरेंशिएबल एनर्जी फंक्शन्स को इंजेक्ट करके सैंपलिंग समय पर नियंत्रणीयता प्राप्त की जा सकती है, हालांकि यह सुनिश्चित करने के लिए बेहतर क्रॉस-स्ट्रीम कपलिंग की आवश्यकता की पहचान करता है कि उत्पन्न वीडियो इन निर्देशित पथों का निष्ठापूर्वक अनुसरण करे।

Xiyan Su, Frank Diermeyer, Markus Lienkamp2026-07-14
💻 computer science

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

MAC-Splat एक नवीन प्रशिक्षण ढांचा (training framework) है जो स्पार्स-व्यू 3D पुनर्निर्माण के लिए MASt3R बैकबोन और DINOv3 एनकोडर का लाभ उठाकर सिमेंटिक रूप से सूचित 2D पत्राचार स्थापित करता है, जो एक सुदृढ़ मल्टी-एट्रीब्यूट कंसिस्टेंसी (MAC) लॉस को सक्षम बनाता है जो 3D गॉसियन गुणों को संयुक्त रूप से नियमित करता है ताकि उच्च-फिडेलिटी दृश्य निर्माण में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन किया जा सके।

Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia2026-07-14
💻 computer science

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

यह शोध पत्र h-Flow प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो इमेज एडिटिंग को कंडीशनल जनरेशन के रूप में पुनर्गठित करने के लिए Doob's h-Transform का लाभ उठाता है, जिससे क्लोज्ड-फॉर्म गाइडेंस और वेलोसिटी ऑर्थोगोनल डिकंपोजिशन के माध्यम से सोर्स कंसिस्टेंसी और टारगेट अलाइनमेंट पर लचीला और मजबूत नियंत्रण सक्षम होता है।

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen2026-07-14
🤖 AI

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

यह शोध पत्र 3D-DefectBench का परिचय देता है, जो एक व्यापक बेंचमार्क और फैक्टोरियल अध्ययन है जो यह प्रदर्शित करता है कि स्वचालित 3D दोष पहचान (defect detection) की विश्वसनीयता केवल अंतर्निहित विजन-लैंग्वेज मॉडल पर नहीं, बल्कि संपूर्ण मूल्यांकन पाइपलाइन—जिसमें कैमरा प्रोटोकॉल और प्रॉम्प्ट स्कीमा शामिल हैं—पर निर्भर करती है, साथ ही एक लागत प्रभावी छह-व्यू RGB सेटअप की पहचान करता है और वर्तमान AI जजों एवं मानव लेबलर्स के बीच प्रदर्शन के अंतर को रेखांकित करता है।

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen (…)2026-07-14