🤖 machine learning

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

यह शोध पत्र "चक्रीय डीनॉइज़िंग" (cyclic denoising) को प्रस्तुत करता है, जो एक भौतिकी-प्रेरित हमला है जो जनरेटिव मॉडल्स में अत्यंत स्थिर अट्रैक्टर्स (ultrastable attractors) को उजागर करने के लिए बार-बार फॉरवर्ड और रिवर्स डिफ्यूजन लागू करता है, जो बिना ग्रेडिएंट्स, प्रॉम्प्ट्स या डेटासेट के पूर्व ज्ञान के, वास्तव में याद किए गए प्रशिक्षण चित्रों को प्रकट करता है।

Rishabh Sharma, Stefano Martiniani2026-06-24
💻 computer science

Token-to-Token Alignment of Text Embeddings for Semantic Blending

यह शोध पत्र एक टोकन-टू-टोकन संरेखण (alignment) ढांचे को प्रस्तुत करता है जो टेक्स्ट प्रॉम्प्ट्स को पुनर्गठित करता है और उनके एम्बेडिंग्स को संरेखित करता है ताकि एक अंतर्निहित निरंतर अर्थपूर्ण स्थान (continuous semantic space) को प्रकट किया जा सके, जिससे जनरेटिव मॉडल को संशोधित किए बिना सरल रैखिक इंटरपोलेशन के माध्यम से सहज इमेज ब्लेंडिंग और निरंतर संपादन सक्षम हो सके।

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or2026-06-24
💻 computer science

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA एक बर्ड्स-आई-व्यू-आधारित विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो डीपस्टैक-शैली के BEV निरूपणों, संवेदी निरंतरता के लिए रेंडर-टीचर अलाइनमेंट, और प्रक्षेपवक्र परिशोधन के लिए एक सेल्फ-क्रिटिक मॉड्यूल को एकीकृत करके स्वायत्त ड्राइविंग में स्थानिक बुद्धिमत्ता और मोशन प्लानिंग को बढ़ाता है, जिससे NAVSIM और Bench2Drive बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yo (…)2026-06-24
💻 computer science

Ingredient-Level Food Image Segmentation for Nutrition Awareness

यह शोध पत्र FoodSeg103 डेटासेट के लिए एक SegFormer-आधारित सामग्री-स्तरीय सिमेंटिक सेगमेंटेशन सिस्टम प्रस्तुत करता है जो एक छोटे बेसलाइन मॉडल से बेहतर प्रदर्शन करता है और विशिष्ट पोषण संबंधी मूल्यों का अनुमान लगाए बिना पोषण जागरूकता का समर्थन करने के लिए अनुमानित मास्क को दृश्य सामग्री-क्षेत्र प्रतिशत में परिवर्तित करता है।

Jonesh Shrestha2026-06-24
💻 computer science

ObsGraph: Hierarchical Observation Representation for Embodied Reasoning and Exploration

यह शोध पत्र ObsGraph को प्रस्तुत करता है, जो एक पदानुक्रमित अवलोकन प्रतिनिधित्व (hierarchical observation representation) है जो दृश्य साक्ष्यों को रूम-व्यू-ऑब्जेक्ट परतों में व्यवस्थित करके और रिट्रीवल परिणामों का उपयोग लक्षित सूचना संग्रह के लिए मार्गदर्शन हेतु करके, जटिल वातावरणों में रोबोटिक प्रदर्शन को बढ़ाने के लिए दृश्य मॉडलिंग, रिट्रीवल और अनुकूलन योग्य बहु-पैमाने वाले अन्वेषण (adaptive multi-scale exploration) को एकीकृत करता है।

Taekbeom Lee, Youngseok Jang, Jeonghwa Heo, Jeongjun Choi, H. Jin Kim2026-06-24
💻 computer science

Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection

यह शोध पत्र PNAFusion को प्रस्तुत करता है, जो एक नवीन मल्टीस्पेक्ट्रल ऑब्जेक्ट डिटेक्शन फ्रेमवर्क है जो स्थानीय मिसअलाइनमेंट और गैर-रेखीय स्थानिक पत्राचारों पर ध्यान केंद्रित करते हुए और कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम करते हुए, एक इटरेटिव फीडबैक लूप के भीतर पिक्सेल-नेबरहुड क्रॉस-अटेंशन मॉड्यूल और एक एडेप्टिव डफॉर्मेबल अलाइनमेंट मैकेनिज्म को जोड़कर कुशल, उच्च-सटीक फीचर फ्यूजन प्राप्त करता है।

Tian Qiu, Jifeng Shen, Xin Zuo2026-06-24
💻 computer science

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

यह शोध पत्र एक सार्वभौमिक गाइडलाइन-ड्रिवन इमेज क्लस्टरिंग एजेंट प्रस्तुत करता है जो टेक्स्टुअल गाइडलाइन्स के माध्यम से विविध क्लस्टरिंग परिदृश्यों को एकीकृत करता है, जिसमें गाइडलाइन-जागरूक एम्बेडिंग्स के लिए जेनेरेटिव कॉन्सेप्ट प्रॉक्सी मॉडलिंग और स्वचालित क्लस्टर डिस्कवरी के लिए मिनिमम स्पैनिंग ट्री पर आधारित एलएलएम ट्रैवर्सल का उपयोग किया गया है, जिससे यह बिना किसी कार्य-विशिष्ट प्रशिक्षण के विभिन्न कार्यों में विशिष्ट विधियों से बेहतर प्रदर्शन करता है।

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarm (…)2026-06-24
🤖 AI

Beyond Bayer: Task-Optimal Sensor Co-Design for Robust Autonomous-Driving Segmentation

यह शोध पत्र प्रदर्शित करता है कि स्वायत्त ड्राइविंग (ऑटोनॉमस ड्राइविंग) के लिए कैमरा सेंसरों का सह-डिज़ाइन (को-डिज़ाइन) सबसे प्रभावी ढंग से एक आइडेंटिटी पॉइंट-स्प्रेड-फंक्शन को बनाए रखते हुए टास्क-ऑप्टिमल 2x2 स्पेक्ट्रल कलर-फिल्टर-एरे वेट्स सीखकर प्राप्त किया जाता है, जो एक सेंसर-स्तरीय हस्तक्षेप है जो डाउनस्ट्रीम मॉडल आर्किटेक्चर से स्वतंत्र रूप से विविध मौसम स्थितियों में सेगमेंटेशन मजबूती में सुधार करता है।

Reeshad Khan, John Gauch2026-06-24
🤖 AI

DramaDirector: Geometry-Guided Short Drama Generation

यह शोध पत्र DramaDirector प्रस्तुत करता है, जो एक ज्यामिति-निर्देशित (geometry-guided) ढांचा है जो शॉट्स को स्थिर और गतिशील स्थितियों में विभाजित करके, वास्तविक सिनेमैटोग्राफी से डेप्थ-पोज़ रिट्रीवल का लाभ उठाकर, और स्कीमा-प्रतिबंधित प्रशिक्षण का उपयोग करके दृश्य रूप से आधारित लघु नाटक उत्पन्न करता है, साथ ही व्यापक मूल्यांकन के लिए नए DramaBoard बेंचमार्क का भी उपयोग करता है।

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie2026-06-24
💻 computer science

An LMM for Precisely Grounding Elements in Documents

यह शोधपत्र PreciseDoc को प्रस्तुत करता है, जो एक लार्ज मल्टीमॉडल मॉडल है जिसे बड़े पैमाने पर उत्पादित सिंथेटिक प्रशिक्षण डेटा और एक संयुक्त सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) प्रतिमान के उपयोग के माध्यम से टेक्स्ट-समृद्ध दस्तावेजों में विजुअल ग्राउंडिंग की सटीकता में सुधार करने के लिए डिज़ाइन किया गया है, जो ग्राउंडिंग को रीजनिंग के साथ एकीकृत करता है।

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Juanzi Li, Ji Qi2026-06-24