💻 computer science

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

यह शोध पत्र DivRL का प्रस्ताव करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो स्ट्रक्चरल डायवर्सिटी (संरचनात्मक विविधता) और आइडेंटिटी कंसिस्टेंसी (पहचान की निरंतरता) को संयुक्त रूप से अनुकूलित करने के लिए एक गेटेड कंस्ट्रेंट के साथ "एक्सप्लोर-एंड-सप्रेस" रणनीति का उपयोग करके सब्जेक्ट-ड्रिवन जनरेशन में आइडेंटिटी-डायवर्सिटी विरोधाभास को हल करता है।

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka2026-06-24
🧬 biology

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

यह शोध पत्र प्रदर्शित करता है कि 3D मास्क किए गए ऑटोएनकोडर (masked autoencoders), विशेष रूप से जब उन्हें प्रोटीन लैंग्वेज मॉडल्स के साथ क्रॉस-मोडल अलाइनमेंट और विशिष्ट 3D-सचेत आर्किटेक्चरल घटकों के साथ उन्नत किया जाता है, प्रोटीन लोकलाइजेशन और इंटरेक्शन प्रेडिक्शन जैसे सिंगल-सेल माइक्रोस्कोपी कार्यों के लिए मजबूत वॉल्यूमेट्रिक रिप्रजेंटेशन सीखने में 2D-आधारित दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr2026-06-24
🤖 machine learning

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

यह शोध पत्र "चक्रीय डीनॉइज़िंग" (cyclic denoising) को प्रस्तुत करता है, जो एक भौतिकी-प्रेरित हमला है जो जनरेटिव मॉडल्स में अत्यंत स्थिर अट्रैक्टर्स (ultrastable attractors) को उजागर करने के लिए बार-बार फॉरवर्ड और रिवर्स डिफ्यूजन लागू करता है, जो बिना ग्रेडिएंट्स, प्रॉम्प्ट्स या डेटासेट के पूर्व ज्ञान के, वास्तव में याद किए गए प्रशिक्षण चित्रों को प्रकट करता है।

Rishabh Sharma, Stefano Martiniani2026-06-24
💻 computer science

Token-to-Token Alignment of Text Embeddings for Semantic Blending

यह शोध पत्र एक टोकन-टू-टोकन संरेखण (alignment) ढांचे को प्रस्तुत करता है जो टेक्स्ट प्रॉम्प्ट्स को पुनर्गठित करता है और उनके एम्बेडिंग्स को संरेखित करता है ताकि एक अंतर्निहित निरंतर अर्थपूर्ण स्थान (continuous semantic space) को प्रकट किया जा सके, जिससे जनरेटिव मॉडल को संशोधित किए बिना सरल रैखिक इंटरपोलेशन के माध्यम से सहज इमेज ब्लेंडिंग और निरंतर संपादन सक्षम हो सके।

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or2026-06-24
💻 computer science

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA एक बर्ड्स-आई-व्यू-आधारित विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो डीपस्टैक-शैली के BEV निरूपणों, संवेदी निरंतरता के लिए रेंडर-टीचर अलाइनमेंट, और प्रक्षेपवक्र परिशोधन के लिए एक सेल्फ-क्रिटिक मॉड्यूल को एकीकृत करके स्वायत्त ड्राइविंग में स्थानिक बुद्धिमत्ता और मोशन प्लानिंग को बढ़ाता है, जिससे NAVSIM और Bench2Drive बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yo (…)2026-06-24
💻 computer science

Ingredient-Level Food Image Segmentation for Nutrition Awareness

यह शोध पत्र FoodSeg103 डेटासेट के लिए एक SegFormer-आधारित सामग्री-स्तरीय सिमेंटिक सेगमेंटेशन सिस्टम प्रस्तुत करता है जो एक छोटे बेसलाइन मॉडल से बेहतर प्रदर्शन करता है और विशिष्ट पोषण संबंधी मूल्यों का अनुमान लगाए बिना पोषण जागरूकता का समर्थन करने के लिए अनुमानित मास्क को दृश्य सामग्री-क्षेत्र प्रतिशत में परिवर्तित करता है।

Jonesh Shrestha2026-06-24
💻 computer science

ObsGraph: Hierarchical Observation Representation for Embodied Reasoning and Exploration

यह शोध पत्र ObsGraph को प्रस्तुत करता है, जो एक पदानुक्रमित अवलोकन प्रतिनिधित्व (hierarchical observation representation) है जो दृश्य साक्ष्यों को रूम-व्यू-ऑब्जेक्ट परतों में व्यवस्थित करके और रिट्रीवल परिणामों का उपयोग लक्षित सूचना संग्रह के लिए मार्गदर्शन हेतु करके, जटिल वातावरणों में रोबोटिक प्रदर्शन को बढ़ाने के लिए दृश्य मॉडलिंग, रिट्रीवल और अनुकूलन योग्य बहु-पैमाने वाले अन्वेषण (adaptive multi-scale exploration) को एकीकृत करता है।

Taekbeom Lee, Youngseok Jang, Jeonghwa Heo, Jeongjun Choi, H. Jin Kim2026-06-24
💻 computer science

Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection

यह शोध पत्र PNAFusion को प्रस्तुत करता है, जो एक नवीन मल्टीस्पेक्ट्रल ऑब्जेक्ट डिटेक्शन फ्रेमवर्क है जो स्थानीय मिसअलाइनमेंट और गैर-रेखीय स्थानिक पत्राचारों पर ध्यान केंद्रित करते हुए और कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम करते हुए, एक इटरेटिव फीडबैक लूप के भीतर पिक्सेल-नेबरहुड क्रॉस-अटेंशन मॉड्यूल और एक एडेप्टिव डफॉर्मेबल अलाइनमेंट मैकेनिज्म को जोड़कर कुशल, उच्च-सटीक फीचर फ्यूजन प्राप्त करता है।

Tian Qiu, Jifeng Shen, Xin Zuo2026-06-24
💻 computer science

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

यह शोध पत्र एक सार्वभौमिक गाइडलाइन-ड्रिवन इमेज क्लस्टरिंग एजेंट प्रस्तुत करता है जो टेक्स्टुअल गाइडलाइन्स के माध्यम से विविध क्लस्टरिंग परिदृश्यों को एकीकृत करता है, जिसमें गाइडलाइन-जागरूक एम्बेडिंग्स के लिए जेनेरेटिव कॉन्सेप्ट प्रॉक्सी मॉडलिंग और स्वचालित क्लस्टर डिस्कवरी के लिए मिनिमम स्पैनिंग ट्री पर आधारित एलएलएम ट्रैवर्सल का उपयोग किया गया है, जिससे यह बिना किसी कार्य-विशिष्ट प्रशिक्षण के विभिन्न कार्यों में विशिष्ट विधियों से बेहतर प्रदर्शन करता है।

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarm (…)2026-06-24
🤖 AI

Beyond Bayer: Task-Optimal Sensor Co-Design for Robust Autonomous-Driving Segmentation

यह शोध पत्र प्रदर्शित करता है कि स्वायत्त ड्राइविंग (ऑटोनॉमस ड्राइविंग) के लिए कैमरा सेंसरों का सह-डिज़ाइन (को-डिज़ाइन) सबसे प्रभावी ढंग से एक आइडेंटिटी पॉइंट-स्प्रेड-फंक्शन को बनाए रखते हुए टास्क-ऑप्टिमल 2x2 स्पेक्ट्रल कलर-फिल्टर-एरे वेट्स सीखकर प्राप्त किया जाता है, जो एक सेंसर-स्तरीय हस्तक्षेप है जो डाउनस्ट्रीम मॉडल आर्किटेक्चर से स्वतंत्र रूप से विविध मौसम स्थितियों में सेगमेंटेशन मजबूती में सुधार करता है।

Reeshad Khan, John Gauch2026-06-24