💬 NLP

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

यह शोध पत्र "हाइड टू सी" (Hide to See) नामक एक नवीन वीएलएम (VLM) डिस्टिलेशन फ्रेमवर्क प्रस्तुत करता है जो विचार प्रक्रिया के दौरान दृश्य साक्ष्यों पर निर्भरता को मजबूर करने के लिए प्रमुख रीजनिंग-प्रिफिक्स मास्किंग (salient reasoning-prefix masking) और सेल्फ-पेस्ड शेड्यूलिंग (self-paced scheduling) का उपयोग करके कॉम्पैक्ट स्टूडेंट मॉडल्स की मल्टीमॉडल रीजनिंग को बढ़ाता है, जिससे यह मौजूदा डिस्टिलेशन और सेल्फ-डिस्टिलेशन विधियों से बेहतर प्रदर्शन करता है।

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son2026-05-13
🤖 AI

Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark

यह शोध पत्र एक नवीन द्विपद मल्टीबिट (binomial multibit) LLM वॉटरमार्किंग योजना प्रस्तुत करता है जो कम एनकोड किए गए बिट्स को गतिशील रूप से प्राथमिकता देने के लिए एक स्टेटफुल एनकोडर का उपयोग करके प्रत्येक टोकन स्थिति पर पेलोड के प्रत्येक बिट को एनकोड करता है, जिससे मौजूदा बेसलाइन की तुलना में बेहतर सटीकता और मजबूती प्राप्त होती है और मूल्यांकन के लिए एक अधिक व्यावहारिक प्रति-बिट कॉन्फिडेंस स्कोरिंग मीट्रिक प्रस्तावित किया जाता है।

Thibaud Gloaguen, Robin Staab, Mark Vero, Martin Vechev2026-05-13
🤖 AI

Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery

यह शोधपत्र SkyPart को प्रस्तुत करता है, जो विज़न ट्रांसफॉर्मर्स के लिए एक हल्का, प्रोटोटाइप-आधारित सिमेंटिक पार्ट डिस्कवरी मॉड्यूल है, जो लेआउट को बनावट (टेक्सचर) से स्पष्ट रूप से अलग करके, ऊंचाई के बदलावों को हाशिए पर रखकर (marginalizing), और अनिश्चितता-भारित बहु-उद्देश्यीय प्रशिक्षण का उपयोग करके मौसम-रोबस्ट क्रॉस-व्यू जियो-लोकलाइजेशन में अत्याधुनिक (state-of-the-art) परिणाम प्राप्त करता है।

Chi-Nguyen Tran, Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Long Tran-Thanh2026-05-13
🤖 machine learning

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

यह शोध पत्र इवोल्यूशनरी टास्क डिस्कवरी (EvoTD) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो डेटा संश्लेषण को कौशल संरचना और जटिलता गुणों पर एक निर्देशित खोज के रूप में मानकर लार्ज लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है, और डेटा की एकरूपता को दूर करने तथा सुदृढ़ सामान्यीकरण प्राप्त करने के लिए संरचित विकासवादी ऑपरेटरों और एक गतिशील कठिनाई फ़िल्टर का उपयोग करता है।

Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang2026-05-13
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

यह शोध पत्र कोचीज़ (Cochise) का परिचय देता है, जो कि स्वायत्त पेनिट्रेशन टेस्टिंग के लिए एक पृथक प्लानर-एक्जीक्यूटर (Planner-Executor) आर्किटेक्चर को लागू करने वाला एक न्यूनतम 597-लाइन का पायथन रेफरेंस हार्नेस है, जो शोधकर्ताओं को गेम ऑफ एक्टिव डायरेक्टरी (GOAD) टेस्टबेड के विरुद्ध LLM-संचालित एजेंटों का मूल्यांकन करने में सक्षम बनाता है और साथ ही रिप्ले, विश्लेषण और ट्राजेक्टरी डेटा साझा करने के लिए ओपन-सोर्स टूल्स प्रदान करता है।

Andreas Happe, Jürgen Cito2026-05-13
🤖 AI

A CAP-like Trilemma for Large Language Models: Correctness, Non-bias, and Utility under Semantic Underdetermination

CAP प्रमेय से प्रेरित होकर, यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए एक त्रिशंकु (trilemma) प्रस्तावित करता है, जो यह दावा करता है कि सिमेंटिक अनडिटरमिनेशन (semantic underdetermination) के तहत, पूर्ण शुद्धता (strong correctness), सख्त गैर-पक्षपात (strict non-bias) और उच्च उपयोगिता (high utility) की एक साथ गारंटी देना असंभव है, क्योंकि निर्णायकता प्राप्त करने के लिए ऐसी असमर्थित प्राथमिकताओं को शामिल करना आवश्यक होता है जो तटस्थता या शुद्धता से समझौता करती हैं।

Vinu Ellampallil Venugopal2026-05-13
🤖 machine learning

Shaping Zero-Shot Coordination via State Blocking

यह शोध पत्र स्टेट-ब्लॉक्ड कोऑर्डिनेशन (SBC) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो स्टेट ब्लॉकिंग के माध्यम से विविध आभासी वातावरण उत्पन्न करके ज़ीरो-शॉट कोऑर्डिनेशन को बढ़ाता है, जिससे एजेंट बिना अंतर्निहित वातावरण को संशोधित किए, मनुष्यों सहित अनदेखे भागीदारों के प्रति प्रभावी ढंग से सामान्यीकरण करने में सक्षम होते हैं।

Mingu Kang, Sunwoo Lee, Yonghyeon Jo, Seungyul Han2026-05-13
🤖 AI

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

यह शोध पत्र MM-Eval प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो विखंडित एकल-मोडल मूल्यांकन विधियों की सीमाओं को संबोधित करते हुए, तथ्यात्मक पाठ गुणवत्ता, छवि-पाठ संरेखण और दृश्य विविधता को मानव प्राथमिकताओं के अनुरूप एक एकल व्याख्या योग्य मीट्रिक में एकीकृत करके मल्टीमॉडल सारांशों का समग्र रूप से आकलन करता है।

Abid Ali, Diego Molla-Aliod, Usman Naseem2026-05-13
🤖 AI

Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning

यह शोध पत्र प्रदर्शित करता है कि विषम दृश्य एजेंट (heterogeneous visual agents) केवल विकेंद्रीकृत शिक्षण और स्थानीय संवेदी मूल्यांकन के माध्यम से साझा, सूचनात्मक संचार प्रतीकों को विकसित कर सकते हैं, जिसमें परिणामी भाषा की विशिष्टता और समरूपता सीधे उनके अंतर्निहित दृश्य निरूपणों की समानता द्वारा आकार लेती है।

Mikako Ochiai, Masatoshi Nagano, Tadahiro Taniguchi2026-05-13
🤖 machine learning

Debiased Model-based Representations for Sample-efficient Continuous Control

यह शोध पत्र DR.Q का प्रस्ताव करता है, जो एक डिबायस्ड मॉडल-आधारित प्रतिनिधित्व एल्गोरिदम (debiased model-based representation algorithm) है जो स्टेट-एक्शन पेयर्स और नेक्स्ट स्टेट्स के बीच म्यूचुअल इंफॉर्मेशन को अधिकतम करके और ओवरफिटिंग एवं रिप्रेजेंटेशन बायस को कम करने के लिए फेड ड प्राथमिकता प्राप्त अनुभव पुनरावृत्ति (faded prioritized experience replay) का उपयोग करके निरंतर नियंत्रण (continuous control) में सैंपल दक्षता को बढ़ाता है।

Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong Yang, Zongqing Lu, Deheng Ye2026-05-13