🤖 AI

Identifying Latent Concepts and Structures for Generalized Category Discovery

यह शोध पत्र कंपोजिशनल प्रिमिटिव फील्ड्स (CPF-GCD) को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले प्रतिनिधित्व शिक्षण ढांचा है जो छवियों को पुन: प्रयोज्य दृश्य प्रिमिटिव और उनके स्थानिक व्यवस्था में विघटित करने के लिए एक लो-रैंक कंपोजिशनल संरचना को लागू करके जनरलाइज्ड कैटेगरी डिस्कवरी में मानक विजन बैकबोन की सीमाओं को संबोधित करता है, जिससे ज्ञात और नवीन दोनों श्रेणियों की अधिक प्रभावी पहचान सक्षम होती है।

Boyang Dai, Chaoqi Chen, Yizhou Yu2026-07-02
🤖 machine learning

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

यह शोधपत्र डोमेन एरीथमेटिक (DART) प्रस्तुत करता है, जो एक सादृश्य-आधारित (analogy-based) विधि है जो सबस्पेस-अलाइन्ड डोमेन-विशिष्ट जानकारी के साथ वेट वेक्टर अंकगणित (weight vector arithmetic) करके विजन-लैंग्वेज-एक्शन मॉडलों को पर्यावरणीय बदलावों के प्रति कुशल वन-शॉट अनुकूलन सक्षम बनाती है, जिससे बहु-प्रदर्शन प्रशिक्षण (multi-demonstration training) की लागतपूर्ण आवश्यकता समाप्त हो जाती है।

Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi2026-07-02
💻 computer science

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

यह शोध पत्र इंस्टेंस-स्पेसिफिक पैरामीट्रिक एब्जॉर्प्शन (ISPA) का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो क्लोज्ड-फॉर्म वेट मॉड्यूलेशन के माध्यम से ऐतिहासिक संदर्भ को मॉडल वेट्स में डिस्टिल करके ऑटोरिग्रेसिव वीडियो जनरेशन में मेमोरी बॉटलनेक को कम करता है, जिससे लगभग लॉसलेस विजुअल क्वालिटी के साथ 50% तक KV कैश में कमी संभव हो पाती है।

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han2026-07-02
🤖 AI

ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition

ConRTF एक वास्तविक समय की तालिका संरचना पहचान विधि है जो प्रशिक्षण के दौरान पंक्तियों और स्तंभों के बीच संरचनात्मक विषमता को एनकोड करने के लिए एक एज-कन्स्ट्रेंड फाइन-ग्रेन्ड लोकलाइजेशन (EFL) लॉस पेश करती है, जिससे इन्फरेंस पाइपलाइन को बदले बिना सार्वजनिक और निजी दोनों डेटासेट पर सीमा वितरण को परिष्कृत किया जाता है और सटीकता में सुधार किया जाता है।

Eliott Thomas, Tri-Cong Pham, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier (…)2026-07-02
💻 computer science

Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation

यह शोध पत्र FlexDepth को प्रस्तुत करता है, जो एक लचीला, स्केल-संचालित स्व-पर्यवेक्षित (self-supervised) मोनोक्यूलर डेप्थ एस्टीमेशन मॉडल्स का परिवार है, जो बिना किसी ग्राउंड ट्रुथ या सहायक जानकारी के, रिसोर्स-कंस्ट्रेंड ऑटोमोटिव एज डिवाइसेस पर स्टेट-ऑफ-द-आर्ट प्रदर्शन और रियल-टाइम दक्षता प्राप्त करने के लिए एक स्टैटिक-डायनामिक डिकपल्ड ट्रेनिंग स्ट्रैटेजी और एक स्केल-ड्रिवन डिकोडर का उपयोग करता है।

Zhaowen Zhu, Li Zhang, Yujie Chen, Tian Zhang, Yingjie Wang, Mingxia Zhan2026-07-02
🤖 AI

Active Learning for Cascaded Object Detection: Balancing Coverage and Uncertainty in Table Extraction Pipelines

यह शोध पत्र एक नवीन सक्रिय शिक्षण (active learning) ढांचे को प्रस्तुत करता है जो दो पाइपलाइन-जागरूक वेरिएंट्स, RankFusion और CAPA का प्रस्ताव करके कैस्केड टेबल निष्कर्षण पाइपलाइनों के लिए अनिश्चितता हर्डिंग (Uncertainty Herding) को अनुकूलित करता है, जो कवरेज और अनिश्चितता को प्रभावी ढंग से संतुलित करते हुए कई डेटासेट्स पर मानक बेसलाइन से बेहतर प्रदर्शन करते हुए एनोटेशन लागत को महत्वपूर्ण रूप से कम करते हैं।

Eliott Thomas, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier2026-07-02
💻 computer science

Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization

यह शोधपत्र डिकपल्ड गाइडेंस (DeGu) को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो एक गतिशील स्थानिक मिश्रण तंत्र (dynamic spatial mixing mechanism) के साथ विषय की पहचान और दृश्य संदर्भ को स्वतंत्र मार्गदर्शन धाराओं में अलग करके टेक्स्ट-टू-इमेज पर्सनलाइजेशन में फिडेलिटी-एडिटेबिलिटी ट्रेड-ऑफ को हल करता है।

Seongmin Kim, Kyucheol Shin, Heesun Jung, Jinseo Kim, Sungyong Baik2026-07-02
💻 computer science

SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference

SpiralFovea एक पैरामीटर-मुक्त, इनपुट-अनुकूल टोकनाइजेशन पद्धति पेश करता है जो मानक फिक्स्ड-ग्रिड पैचेस को स्थानीय दृश्य एंट्रॉपी (visual entropy) के आधार पर कंटेंट-संचालित, मल्टी-स्केल स्पाइरल रिंग्स से गतिशील रूप से बदल देता है, जिससे फाउंडेशन मॉडल्स के लिए सटीकता और थ्रूपुट में उल्लेखनीय वृद्धि होती है और साथ ही कम्प्यूटेशनल लागत कम होती है।

Kyan Mahajan, Mohammad Saqlain2026-07-02
🤖 AI

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

LeVLJEPA पहला पूर्णतः गैर-कंट्रास्टिव एंड-टू-एंड विजन-लैंग्वेज प्रीट्रेनिंग तरीका पेश करता है जो बिना नेगेटिव्स के क्रॉस-मोडल प्रेडिक्शन का उपयोग करता है, जो विजुअल क्वेश्चन अनसरिंग और सिमेंटिक सेगमेंटेशन जैसे डाउनस्ट्रीम कार्यों के लिए सघन सिमेंटिक फीचर्स उत्पन्न करने में उत्कृष्ट प्रदर्शन करता है और वैश्विक रीडआउट्स में प्रतिस्पर्धात्मकता बनाए रखता है।

Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner2026-07-02
💻 computer science

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

यह शोध पत्र ClinRAG-GRAPH प्रस्तुत करता है, जो एक नवीन ढांचा है जो क्लिनिकल-प्रायर ग्राफ्स, डोमेन-एडवर्सियल लर्निंग, और एलएलएम-संचालित रिट्रीवल-ऑगमेंटेड जनरेशन को एकीकृत करता है ताकि नियोएडजुवेंट कीमोथेरेपी से गुजर रहे स्तन कैंसर के रोगियों में पैथोलॉजिकल कम्प्लीट रिस्पॉन्स का सुदृढ़, व्याख्यात्मक और क्रॉस-सेंटर सटीक पूर्वानुमान प्राप्त किया जा सके।

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He (…)2026-07-02