💻 computer science

Simple Supervision Is Hard to Beat: A Bitter Lesson from Sparse Target Labels in Domain-Adaptive Object Detection

यह शोध पत्र यह प्रदर्शित करता है कि विरल लक्ष्य लेबल (sparse target labels) वाले सोर्स-फ्री डोमेन-एडेप्टिव ऑब्जेक्ट डिटेक्शन में, रैंडम-टारगेट सुपरवाइज्ड मिक्सिंग (RTSM) नामक एक सरल विधि, जो सीधे तौर पर सुपरवाइज्ड लॉस के माध्यम से एनोटेशन को शामिल करती है, लगातार जटिल सेल्फ-ट्रेनिंग फीडबैक तंत्रों से बेहतर प्रदर्शन करती है, जो यह प्रकट करता है कि सरल पर्यवेक्षण (simple supervision) को हराना कठिन है।

Lijun Zhang, Ruinian Xu, Mudit Agrawal2026-07-01
💻 computer science

Knowledge-Driven Dimension Estimation from a Single Image -3D Asset Generation Technology for Digital Twin Construction

यह शोध पत्र एक ज्ञान-संचालित पद्धति प्रस्तावित करता है जो एकल मोनोकुलर छवियों से उच्च-ऊंचाई वाले यातायात संकेतों जैसी वस्तुओं के पैमाने का अनुमान लगाने के लिए उन्हें संरचनात्मक तत्वों में विभाजित करती है और डिजिटल ट्विन निर्माण तथा इन-व्हीकल कैमरा सत्यापन के लिए सटीक 3D परिसंपत्तियों को उत्पन्न करने हेतु बाहरी डिज़ाइन नियमों को एकीकृत करती है।

Hidenori Sakaniwa, Akihito Akai, Akihiko Hyodo2026-07-01
💻 computer science

GRAPE: Graph-Augmented Prototype Explanations for Interactive Medical Image Diagnosis

GRAPE एक संवादात्मक चिकित्सा इमेज निदान के लिए एक एकीकृत आर्किटेक्चर है जो ग्राफ अटेंशन के माध्यम से शारीरिक सह-अस्तित्व (anatomical co-occurrence) को मॉडल करके, एनोटेशन त्रुटियों का पता लगाने के लिए एक नवीन कॉन्सेप्ट-मिसमैच सुरक्षा जांच पेश करके, और पूर्ण पुन: प्रशिक्षण के बिना नए निष्कर्षों को जोड़ने के लिए ओपन-वोकेबुलरी लर्निंग को सक्षम करके प्रोटोटाइप-आधारित क्लासिफायर की प्रमुख सीमाओं को दूर करता है, और यह सब न्यूनतम विलंबता (latency) बनाए रखते हुए करता है।

Rasul Khanbayov, Hasan Kurban2026-07-01
💻 computer science

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

PhotoQuilt एक ट्रेनिंग-फ्री फ्रेमवर्क है जो एक लो-रिज़ॉल्यूशन ग्लोबल लेआउट को बूटस्ट्रैप्ड टाइलड डिनोइजिंग प्रक्रिया के साथ जोड़कर उच्च-रिज़ॉल्यूशन, मनचाहे आकार के फोटोमोसिक्स (photomosaics) उत्पन्न करता है, जो प्रभावी रूप से क्वाड्रेटिक अटेंशन की कम्प्यूटेशनल लागतों से बचते हुए ग्लोबल स्ट्रक्चरल कोहेरेंस और लोकल टाइल रियलिज्म के बीच संतुलन बनाता है।

Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati2026-07-01
💻 computer science

Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit

यह शोध पत्र VidAudit टूलकिट और एक छह-नियंत्रण ऑडिटिंग प्रोटोकॉल प्रस्तुत करता है जो AI-जनित वीडियो डिटेक्शन में बढ़ा-चढ़ाकर किए गए सामान्यीकरण के दावों को उजागर करता है, जो यह प्रदर्शित करता है कि कठोर मूल्यांकन लीडरबोर्ड रैंकिंग को महत्वपूर्ण रूप से बदल देता है और डिटेक्टर प्रदर्शन का आकलन करने के लिए एक अधिक सुदृढ़ ढांचा स्थापित करता है।

Mert Onur Cakiroglu, Zhihe Lu, Mehmet Dalkilic, Hasan Kurban2026-07-01
💻 computer science

TerraDiT-Ω\Omega: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

यह शोध पत्र TerraDiT-Ω\Omega को प्रस्तुत करता है, जो एक एकीकृत जनरेटिव फ्रेमवर्क है जो एक नवीन ज्योमेट्री-अवेयर लोकल अटेंशन मैकेनिज्म के माध्यम से विविध नेटिव जियोस्पेशियल प्रिमिटिव्स (जैसे कि पॉलीगोंस, पॉलीलाइन्स, बाउंडिंग बॉक्स और पॉइंट्स) से सीधे सैटेलाइट इमेजरी को सिंथेसाइज करता है, जिससे शहरी नियोजन के लिए लचीला स्थानिक नियंत्रण सक्षम होता है और कंट्रोलेबल सिंथेटिक डेटा ऑग्मेंटेशन के माध्यम से डाउनस्ट्रीम GeoAI कार्यों को बढ़ाया जाता है।

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs2026-07-01
💬 NLP

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

यह शोध पत्र ADAPT को प्रस्तुत करता है, जो एक अटेंशन-आधारित फ्रेमवर्क है जो विजुअल एंकर्स, ऑनलाइन करेक्शन मैकेनिज्म और प्रेफरेंस ट्यूनिंग के माध्यम से टेक्स्ट-टू-इमेज क्रॉस-अटेंशन डायनेमिक्स को संरेखित करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे सामान्य क्षमताओं को बनाए रखते हुए मतिभ्रम में महत्वपूर्ण कमी आती है।

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao2026-07-01
🔢 mathematics

Online TT-ALS for Streaming Tensor Decomposition with Incremental Orthogonalization

यह शोध पत्र ऑनलाइन TT-ALS प्रस्तुत करता है, जो एक स्ट्रीमिंग टेंसर अपघटन एल्गोरिदम है जो सटीक कोर अपडेट, एकदिष्ट अभिसरण (monotonic convergence) और रैखिक रैंक जटिलता प्राप्त करने के लिए वृद्धिशील ऑर्थोगोनलाइजेशन (incremental orthogonalization) को लागू करता है, जिससे यह पुनर्निर्माण सटीकता और वास्तविक समय प्रसंस्करण गति दोनों में मौजूदा ऑनलाइन और डीप लर्निंग विधियों से बेहतर प्रदर्शन करता है।

Hiroki Takeda, Yuto Miyatake, Daisuke Furihata2026-07-01
💻 computer science

Hybrid Unet-Transformer Model for Generating Stress and Strain Fields from Composite Geometrics

यह शोध पत्र एक हाइब्रिड UNet-Transformer आर्किटेक्चर प्रस्तावित करता है जो फाइनाइट एलीमेंट सिमुलेशन के लिए एक गणनात्मक रूप से कुशल सरोगेट के रूप में कार्य करता है, जो कंपोजिट माइक्रोस्ट्रक्चर ज्योमेट्री से विविध स्ट्रेस और स्ट्रेन फील्ड्स की सटीक भविष्यवाणी करता है और आवधिक टेसेलेशन (periodic tessellations) पर मजबूत प्रदर्शन और भौतिक रूप से सार्थक अटेंशन लोकलाइजेशन प्रदर्शित करता है, हालांकि यह तीव्र स्ट्रेस विच्छेदन (sharp stress discontinuities) वाले अनियमित ज्योमेट्री के साथ चुनौतियों का सामना करता है।

Shrey Patel2026-07-01
💻 computer science

Fleet: Few Shots Lead Effective AI-generated Image Detection

यह शोध पत्र 'फ्लीट' (Fleet) का परिचय देता है, जो एक ऐसा ढांचा है जो एआई-जनित छवि पहचान को 'कन्स्ट्रेंड रूटिंग करेक्शन' (constrained routing correction) के माध्यम से स्थिर सामान्यीकरण से गतिशील अनुकूलन की ओर स्थानांतरित करता है, जो फ्यू-शॉट लर्निंग (few-shot learning) के माध्यम से उभरते हुए जनरेटरों पर काफी बेहतर प्रदर्शन प्रदर्शित करता है और व्यापक 'ट्रेजर' (Treasure) बेंचमार्क के साथ इस दृष्टिकोण को प्रमाणित करता है।

Jiaan Wang, Sirui Liu, Yu Li, Kaiyuan Yang, Juan Cao, Sheng Tang2026-07-01