🤖 machine learning

Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging

यह शोध पत्र डिकम्पोजिशन, थ्रेशोल्डिंग और स्केलिंग (DTS) का प्रस्ताव करता है, जो एक अत्यधिक स्टोरेज-कुशल व्यक्तिगत मॉडल मर्जिंग फ्रेमवर्क है जो सिंगुलर वैल्यू डिकम्पोजिशन और सिमेंटिक सिमिलरिटी का लाभ उठाकर प्रति कार्य केवल 1% अतिरिक्त स्टोरेज के साथ कार्य-विशिष्ट प्रदर्शन को सुरक्षित रखता है और अनदेखे कार्यों के लिए सामान्यीकरण करता है।

Kuangpu Guo, Aijing Yu, Jian Liang, Yuhe Ding, Zilei Wang, Ran He, Tieniu Tan2026-06-30
💬 NLP

See, Think, Learn: A Self-Taught Multimodal Reasoner

यह शोध पत्र "सी-थिंक-लर्न" (STL) का प्रस्ताव करता है, जो एक लागत प्रभावी स्व-प्रशिक्षण ढांचा है जो एक संरचित "सोचने से पहले देखना" की प्रक्रिया को लागू करके और नकारात्मक तर्कों (negative rationales) को शामिल करके विजन-लैंग्वेज मॉडल्स को बढ़ाता है, ताकि महंगे मानवीय एनोटेशन पर निर्भर हुए बिना दृश्य धारणा और सुदृढ़ मल्टीमॉडल तर्क को संयुक्त रूप से सुधारा जा सके।

Sourabh Sharma, Sonam Gupta, Sadbhawna2026-06-30
💻 computer science

Distribution Matching Variational AutoEncoder

यह शोध पत्र डिस्ट्रीब्यूशन-मैचिंग वीएई (DMVAE) पेश करता है, जो एक ऐसा ढांचा है जो एक एनकोडर के लेटेंट डिस्ट्रीब्यूशन को निश्चित प्रायर्स (priors) के बजाय मनचाहे रेफरेंस डिस्ट्रीबशन्स के साथ स्पष्ट रूप से संरेखित करता है, यह प्रदर्शित करते हुए कि SSL-व्युत्पन्न डिस्ट्रीबशन्स बेहतर पुनर्निर्माण निष्ठा (reconstruction fidelity) और मॉडलिंग दक्षता प्राप्त करते हैं, जैसे कि मात्र 64 एपोक्स में इमेजनेट पर 3.2 का gFID प्राप्त करना।

Sen Ye, Jianning Pei, Mengde Xu, Shuyang Gu, Chunyu Wang, Liwei Wang, Han Hu2026-06-30
💻 computer science

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

इफिशिएंट-वीएलएन (Efficient-VLN) एक सुदृढ़ बेसलाइन है जो रियल-टाइम इन्फरेंस के लिए केवी-कैश (KV-cache) पुन: उपयोग, लीकेज को रोकने के लिए एक्शन-आइसोलेटेड पैक्ड ट्रेनिंग और संतुलित डेटा संग्रह के लिए एडेप्टिव डैगर (Adaptive DAgger) को पेश करके विजन-लैंग्वेज नेविगेशन प्रदर्शन को महत्वपूर्ण रूप से आगे बढ़ाती है और लेटेंसी को कम करती है।

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang2026-06-30
💻 computer science

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

यह शोध पत्र CoSPlan प्रस्तुत करता है, जो स्टेप कंप्लीशन और एरर करेक्शन की आवश्यकता वाले कार्यों के माध्यम से विजन लैंग्वेज मॉडल्स की विजुअल सीक्वेंशियल प्लानिंग क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क है, और सीन ग्राफ इंक्रीमेंटल (SGI) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री विधि है जो टेक्स्टुअल सीन ग्राफ अपडेट्स के माध्यम से इटरेटिव रीजनिंग को सक्षम बनाकर प्रदर्शन में सुधार करती है।

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat2026-06-30
💻 computer science

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

यह शोध पत्र STAR फ्रेमवर्क प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को एक व्यापक वीडियो टूलकिट और एक रणनीतिक शेड्यूलिंग तंत्र से सुसज्जित करता है ताकि स्पैटियोटेम्पोरल रीजनिंग (स्थानिक-कालिक तर्क) को बढ़ाया जा सके, जिसके परिणामस्वरूप VideoMME और LongVideoBench जैसे चुनौतीपूर्ण VideoQA बेंचमार्क पर महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang2026-06-30
💻 computer science

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

यह शोध पत्र DiTracker प्रस्तुत करता है, जो एक सुदृढ़ पॉइंट ट्रैकिंग विधि है जो ज़ीरो-शॉट विश्लेषण और हल्के अनुकूलन के माध्यम से वीडियो डिफ्यूजन ट्रांसफॉर्मर फीचर्स की उत्कृष्ट टेम्पोरल कोहेरेंस का लाभ उठाती है, जो केवल सिंथेटिक सुपरविजन पर निर्भर रहते हुए भी व्यापक वास्तविक दुनिया के डेटा पर प्रशिक्षित मौजूदा मॉडलों से बेहतर प्रदर्शन करती है।

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim2026-06-30
💻 computer science

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA एक डेटासेट-मुक्त, मॉडल-अज्ञेय (model-agnostic) ढांचा है जो बैकग्राउंड-अवेयर रीजनिंग और टेस्ट-टाइम एडेप्टेशन के लिए एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल का लाभ उठाता है ताकि गैर-लक्ष्य फोरग्राउंड को प्रभावी ढंग से बाहर निकाला जा सके और विविध बैकग्राउंड सबटाइप्स को एकत्रित किया जा सके, जिससे मौजूदा तरीकों की तुलना में न्यूनतम फोरग्राउंड पुनरुत्पादन और उच्च संरचनात्मक निष्ठा के साथ श्रेष्ठ ऑब्जेक्ट रिमूवल प्राप्त किया जा सके।

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim2026-06-30
💻 computer science

Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation

DreamTacVLA एक नवीन फ्रेमवर्क है जो पदानुक्रमित स्थानिक संरेखण (hierarchical spatial alignment) के माध्यम से उच्च-रिज़ॉल्यूशन स्पर्श "माइक्रो-विज़न" को बहु-पैमाने वाले दृश्य इनपुट के साथ एकीकृत करके और भविष्य की संपर्क गतिशीलता (contact dynamics) की भविष्यवाणी करने के लिए वास्तविक दुनिया और डिजिटल ट्विन के हाइब्रिड डेटासेट पर प्रशिक्षित एक स्पर्श विश्व मॉडल (tactile world model) के माध्यम से संपर्क-समृद्ध हेरफेर (contact-rich manipulation) के लिए विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है।

Guo Ye, Zexi Zhang, Xu Zhao, Shang Wu, Haoran Lu, Shihan Lu, Han Liu2026-06-30
💻 computer science

From Local Windows to Adaptive Candidates via Individualized Exploratory: Rethinking Attention for Image Super-Resolution

यह शोध पत्र इंडिविजुअलाइज्ड एक्सप्लोरेटरी ट्रांसफॉर्मर (IET) का प्रस्ताव करता है, जो एक नवीन इंडिविजुअलाइज्ड एक्सप्लोरेटरी अटेंशन (IEA) तंत्र पेश करता है जो प्रत्येक टोकन को फिक्स्ड-ग्रुप अटेंशन की सीमाओं को दूर करने के लिए स्वतंत्र, कंटेंट-अवेयर अटेंशन उम्मीदवारों को अनुकूल रूप से चुनने की अनुमति देता है, जिससे तुलनीय कम्प्यूटेशनल दक्षता के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Chunyu Meng, Wei Long, Shuhang Gu2026-06-30