🤖 AI

Sparsity-Inducing Divergence Losses for Biometric Verification

यह शोध पत्र Q-Margin को प्रस्तुत करता है, जो एक नवीन α\alpha-डाइवर्जेंस लॉस है जो स्पार्स समाधानों (sparse solutions) को प्रेरित करने के लिए संदर्भ मापों में संभाव्य मार्जिन को एनकोड करता है, जिससे कम फॉल्स एक्सेप्टेंस रेट्स पर बेहतर प्रदर्शन प्राप्त होता है और बड़े पैमाने पर बायोमेट्रिक सत्यापन के लिए मेमोरी-कुशल प्रशिक्षण सक्षम होता है।

Dimitrios Koutsianos, Ladislav Mošner, Yannis Panagakis, Themos Stafylakis2026-07-01
🤖 AI

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

यह शोध पत्र WorldRoamBench प्रस्तुत करता है, जो एक नवीन ओपन-वर्ल्ड बेंचमार्क है जिसे चार महत्वपूर्ण आयामों—एक्शन (action), विजन (vision), फिजिक्स (physics) और मेमोरी (memory)—में इंटरैक्टिव वर्ल्ड मॉडल्स की लॉन्ग-होरिज़न स्थिरता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल्स अभी भी निरंतर इंटरैक्टिव वातावरण में विश्वसनीय, भौतिक रूप से आधारित और मेमोरी-फिथफुल प्रदर्शन प्राप्त करने के लिए संघर्ष कर रहे हैं।

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jia (…)2026-07-01
💻 computer science

Practical High-Fidelity Novel-View Synthesis of Mounted Lepidoptera

यह शोध पत्र एक एंड-टू-एंड पाइपलाइन प्रस्तुत करता है जो हैंडहेल्ड फोकस स्टैकिंग, एक नॉन-कॉन्टैक्ट मिरर सिस्टम और एक मिरर-अवेयर 3D गॉसियन स्प्लैटिंग एक्सटेंशन को जोड़ता है ताकि माउंटेड तितलियों के फोटो-रियलिस्टिक 3D मॉडल तैयार किए जा सकें, जो उनकी नाजुकता, सूक्ष्म विवरणों और अप्राप्य वेंट्रल सतहों से संबंधित चुनौतियों पर विजय प्राप्त करता है।

Kristof Overdulve, Lode Jorissen, Nick Michiels2026-07-01
💻 computer science

ShellMaker: Language-Guided Exterior Completion under Structural Constraints

शेलमेकर (ShellMaker) एक भाषा-निर्देशित ढांचा है जो निश्चित आंतरिक स्कैफोल्ड्स को पूरा करते हुए, ज्यामितीय और अर्थपूर्ण बाधाओं का कड़ाई से पालन करते हुए, शैलीगत रूप से सुसंगत और संरचनात्मक रूप से सुसंगत बाहरी इमारतों, जिनमें अग्रभाग (फसाड) और छतें शामिल हैं, का संश्लेषण करता है।

Ruiqi Xu, Daniel Aliaga2026-07-01
🤖 AI

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

यह शोध पत्र यह प्रदर्शित करता है कि जबकि स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders) डिफ्यूजन मॉडल्स में सिमेंटिक अवधारणाओं का प्रभावी ढंग से पता लगाते हैं, इन फीचर्स का उपयोग करके किया गया प्रत्यक्ष लेटेंट हस्तक्षेप (direct latent intervention) दृश्य विसंगतियों (visual artifacts) का कारण बनता है, जो एक डिटेक्शन-आधारित प्रतिस्थापन रणनीति (detection-based replacement strategy) को प्रेरित करता है जो मॉडल के एक्टिवेशन सांख्यिकी (activation statistics) को संरक्षित करके बेहतर ऑब्जेक्ट इरेज़र (object erasure) प्राप्त करती है।

Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz2026-07-01
🤖 machine learning

WIDER-FAIR: An Annotated Version of the WIDER-FACE Dataset for Fairness Evaluation

यह शोध पत्र WIDER-FAIR को प्रस्तुत करता है, जो निष्पक्षता मूल्यांकन को सक्षम करने के लिए जातीयता और लिंग के मैनुअल एनोटेशन के साथ WIDER-FACE बेंचमार्क का विस्तार करने वाला एक नया डेटासेट है, जो प्रयोगों के माध्यम से यह प्रदर्शित करता है कि फेस डिटेक्शन मॉडल प्रदर्शन में महत्वपूर्ण असमानताएं प्रदर्शित करते हैं, विशेष रूप से अश्वेत व्यक्तियों के विरुद्ध।

Maxime Moussi, Benoît Ronval, Siegfried Nijssen, Félicien Schiltz2026-07-01
💻 computer science

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो डेंस रिवॉर्ड्स के लिए प्रतीकात्मक विशेषता संरेखण (symbolic attribute alignment) और स्थानीय इष्टतम (local optima) से बचने के लिए संदर्भ-निर्देशित कोड अनुकूलन का उपयोग करके विजुअल-टू-कोड जनरेशन में मानक मल्टीमॉडल मॉडलों की सीमाओं को दूर करता है, जिससे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue2026-07-01
💻 computer science

MemLearner: Learning to Query Context memory for Video World Models

मेमलर्नर (MemLearner) प्री-ट्रेंड विजुअल प्रायर्स और एक मल्टी-डेटासेट ट्रेनिंग स्ट्रैटेजी का लाभ उठाने वाले एक लर्निंग-बेस्ड अडैप्टिव कॉन्टेक्स्ट क्वेरी मेथड को पेश करके वीडियो वर्ल्ड मॉडल्स में मेमोरी सीमाओं को संबोधित करता है, जो विशेष रूप से ओक्लूजन (occlusions) और डायनेमिक ऑब्जेक्ट्स वाले परिदृश्यों में सीन कंसिस्टेंसी में महत्वपूर्ण सुधार करता है।

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu2026-07-01
💻 computer science

Rhythm-Structured Predictive Learning for Remote Photoplethysmography

यह शोध पत्र RhythmJEPA का प्रस्ताव करता है, जो एक स्व-पर्यवेक्षित (self-supervised) रिमोट फोटोप्लेथिस्मोग्राफी फ्रेमवर्क है जो मास्क किए गए वीडियो से लेटेंट टीचर रिप्रेजेंटेशन्स का पूर्वानुमान लगाकर और पल्स सिग्नल्स की चक्रीय टेम्पोरल संरचना को स्पष्ट रूप से मॉडल करने के लिए ड्यूल ऑर्डर मंबा एनकोडर के साथ एक साइक्लिक रिदम-स्टेट प्लानर का उपयोग करके शारीरिक संकेत अनुमान में सुधार करता है।

Ba-Thinh Nguyen, Huu-Dung Nguyen, Thi-Duyen Ngo, Thanh-Ha Le2026-07-01
🤖 AI

JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering

यह शोधपत्र JL1-CC&QA प्रस्तुत करता है, जो एक मल्टी-टास्क बेंचमार्क है जो 5,000 जिलिन-1 (Jilin-1) उपग्रह छवि युग्मों से व्युत्पन्न 17,021 परिवर्तन विवरणों (change captions) और 20,060 प्रश्न-उत्तर युग्मों के साथ JL1-CD डेटासेट का विस्तार करता है, ताकि लैंड-कवर परिवर्तनों के सूक्ष्म विवरण और संवादात्मक पूछताछ को सक्षम बनाकर रिमोट सेंसिंग चेंज डिटेक्शन में सिमेंटिक गैप को पाटा जा सके।

Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu2026-07-01