💻 computer science

Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report

यह तकनीकी रिपोर्ट मार्च 2026 तक चौदह जनरेटिव इमेज मॉडल्स का मूल्यांकन करती है और पाती है कि जबकि सभी निजी मॉडल्स काल्पनिक पात्रों, मशहूर हस्तियों और लोगो के बीच भिन्न-भिन्न रिफ्यूज़ल दरों के साथ आईपी (IP) गार्डरेल्स लागू करते हैं, प्रत्येक परीक्षित मॉडल पहचानने योग्य बौद्धिक संपदा उत्पन्न करने में सक्षम बना हुआ है।

Austin T. Hoag, Apostolos Modas, Yunhao Ba, Julienne M. LaChance, Jinru Xue, Wiebke Hutiri, Jan Simson, Tiffany Georgiev (…)2026-07-07
🤖 AI

An automated method of identifying incorrectly labelled images based on the sequences of loss functions of deep learning networks

यह शोध पत्र डीप लर्निंग लॉस फंक्शन सीक्वेंसों का विश्लेषण करके गलत तरीके से लेबल की गई मेडिकल छवियों की पहचान करने के लिए एक स्वचालित विधि का प्रस्ताव और सत्यापन करता है, जो यह प्रदर्शित करता है कि इन त्रुटियों को सुधारने से डायबिटिक रेटिनोपैथी स्क्रीनिंग में डेटासेट की गुणवत्ता और मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu2026-07-07
💻 computer science

CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning

यह शोधपत्र CV-DCLR का प्रस्ताव करता है, जो एक नवीन ढांचा है जो दृश्य-अर्थ संबंधी संबंधों (visual-semantic associations) को गतिशील रूप से परिष्कृत करने के लिए काउंटरफैक्चुअल हस्तक्षेप (counterfactual intervention) के साथ एक द्वैत-प्रवाह पारस्परिक सुधार तंत्र (dual-stream mutual correction mechanism) का उपयोग करता है, जो वास्तविक वर्ग पहचानों को भ्रामक दृश्य समानताओं से अलग करके ज़ीरो-शॉट लर्निंग में सिमेंटिक एंटैंगलमेंट बॉटलनेक (semantic entanglement bottleneck) को प्रभावी ढंग से दूर करता है।

Can Wang, Jiangnan Li, Mingyu Li, Yining Song, Kangrui Ren, Min Gan, Jinfu Fan2026-07-07
🤖 AI

Federated Learning for Object Detection: Enabling Collaborative Drone Learning Without Centralizing Data

यह शोध पत्र प्रदर्शित करता है कि फेडरेटेड लर्निंग (Federated Learning) वितरित ड्रोन बेड़े को स्थानीय डेटा पर उच्च-प्रदर्शन वाले, गोपनीयता-संरक्षित ऑब्जेक्ट डिटेक्शन मॉडल को सहयोगात्मक रूप से प्रशिक्षित करने में सक्षम बनाता है, जो डेटा केंद्रीकरण की आवश्यकता के बिना, एकल-ड्रोन दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करते हुए केंद्रीकृत प्रशिक्षण के करीब प्रदर्शन प्राप्त करता है।

Daniel M. Jimenez-Gutierrez, Enrique Zuazua, Georgios Kellaris, Joaquin del Rio, Oleksii Sliusarenko, Xabi Uribe-Etxebar (…)2026-07-07
🧬 biology

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

CLABTOOLKIT एक ओपन-सोर्स पायथन टूलकिट है जो विविध न्यूरोइमेजिंग डेटा प्रकारों—जिसमें वॉल्यूमेट्रिक, सरफेस और स्ट्रीमलाइन फॉर्मेट शामिल हैं—के प्रसंस्करण, हेरफेर और विज़ुअलाइज़ेशन को एक एकल, इंटरऑपरेबल फ्रेमवर्क में एकीकृत करता है ताकि नियमित अनुसंधान वर्कफ़्लो को सुव्यवस्थित किया जा सके और असंगत उपकरणों के बीच ऑपरेशन्स को पुन: लागू करने की आवश्यकता को समाप्त किया जा सके।

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann2026-07-07
🤖 AI

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

यह शोध पत्र K9-Bench प्रस्तुत करता है, जो 907 घरेलू कुत्तों के वीडियो से प्राप्त लगभग 5,000 प्रश्न-उत्तर युग्मों वाला एक नवीन बेंचमार्क है, जो एक स्केलेबल और पूर्वाग्रह-मुक्त डेटा जनरेशन पाइपलाइन का उपयोग करता है ताकि यह प्रकट किया जा सके कि वर्तमान मल्टीमॉडल LLMs जटिल कैनिन (canine) क्रियाओं और अंतःक्रियाओं को समझने के लिए आवश्यक सूक्ष्म-स्तरीय (fine-grained) और दीर्घकालिक (long-horizon) तर्क करने में संघर्ष करते हैं।

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira2026-07-07
🤖 AI

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

यह शोधपत्र S-EMBER को प्रस्तुत करता है, जो स्मार्ट-ग्लासेस के 388 घंटों के फुटेज का एक बड़े पैमाने का बेंचमार्क है जिसे एआई एजेंटों की कारण संबंधी (causal), स्ट्रीमिंग एपिसोडिक मेमोरी रिट्रीवल करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि सिमेंटिक रीजनिंग मॉडल के आकार के साथ बढ़ती है, सटीक टेम्पोरल ग्राउंडिंग एक निरंतर आर्किटेक्चरल बाधा बनी हुई है।

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Gho (…)2026-07-07
💻 computer science

RayTun3R: Online Camera Adaptation in 3D Foundation Models

RayTun3R एक हल्का, पैरामीटर-कुशल ऑनलाइन अनुकूलन विधि है जो पोजीशनल एनकोडिंग और प्रेडिक्शन ग्रिड के अवशिष्ट समायोजन (residual adjustments) को सीखकर 3D फाउंडेशन मॉडल्स में पिनहोल कैमरा बायस को ठीक करता है, जिससे प्रीट्रेन्ड नेटवर्क को संशोधित किए बिना या अतिरिक्त रनटाइम लागत उठाए बिना फिशआई इमेजरी पर सटीक डेप्थ और पोज़ अनुमान सक्षम होता है।

Daniil Sinitsyn, Nikita Araslanov, Daniel Cremers2026-07-07
💻 computer science

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

यह शोध पत्र GRCD को प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक कठोरता से स्वच्छ डेटासेट और एक ड्यूल-पाथवे इंटीग्रेशन स्ट्रैटेजी वाले रीजन-गाइडेड चेंज टोकन मॉड्यूल का लाभ उठाकर सटीक टेम्पोरल चेंज डिटेक्शन के साथ स्थानिक रूप से ग्राउंडेड, मल्टी-फाइंडिंग चेस्ट एक्स-रे रिपोर्ट उत्पन्न करता है।

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai2026-07-07
🤖 machine learning

Provable Pruning for Efficient 3D Gaussian Splatting via Coresets

यह शोधपत्र संवेदनशीलता-आधारित सैंपलिंग (sensitivity-based sampling) के माध्यम से रिज़ॉल्यूशन-निर्भर वेटेड कोरेसेट्स (resolution-dependent weighted coresets) का निर्माण करके 3D गॉसियन स्प्लेटिंग दृश्यों को कंप्रेस करने के लिए पहला सैद्धांतिक रूप से आधारित तरीका प्रस्तुत करता है, जो रेंडरिंग उद्देश्यों को प्रमाणित रूप से सुरक्षित रखता है और न्यूनतम या बिना किसी पोस्ट-प्रूनिंग फाइन-ट्यूनिंग के अत्याधुनिक प्रदर्शन प्राप्त करता है।

Waseem Mousa, Alaa Maalouf2026-07-07