⚡ electrical engineering

Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space

यह शोध पत्र इको (Echo) को प्रस्तुत करता है, जो एक 25 मिलियन-पैरामीटर वाला प्रूफ-ऑफ-कांसेप्ट ऑडियो सिस्टम है, जो जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPA) के साथ प्रीट्रेन किए गए एकल ViT एनकोडर का उपयोग करता है ताकि प्रति-कार्य फाइन-ट्यूनिंग के बिना एक साझा लेटेंट स्पेस में स्पीकर डायराइजेशन, स्पीच सेपरेशन और फोनेटिक एनकोडिंग को संयुक्त रूप से निष्पादित किया जा सके, जो एंड-टू-एंड ASR में वर्तमान सीमाओं को उजागर करते हुए मल्टी-टास्क सह-अस्तित्व की व्यवहार्यता को प्रदर्शित करता है।

Louis Mouchon2026-06-02
💻 computer science

Parameter-Efficient Fine-Tuning of Large Pretrained Models for Instance Segmentation Tasks

यह अध्ययन प्रदर्शित करता है कि डिफॉर्मेबल अटेंशन (deformable attention) पर एडेप्टर्स (adapters) और लो-रैंक अडैप्टेशन (LoRA) जैसे पैरामीटर-कुशल फाइन-ट्यूनिंग तरीकों को लागू करने से, ट्रांसफॉर्मर-आधारित मॉडल केवल 1-6% पैरामीटर्स को फाइन-ट्यून करके प्रतिस्पर्धी इंस्टेंस सेगमेंटेशन प्रदर्शन प्राप्त करने में सक्षम होते हैं, जो पारंपरिक फाइन-ट्यूनिंग की तुलना में कम्प्यूटेशनल लागत को काफी कम कर देता है।

Nermeen Abou Baker, David Rohrschneider, Uwe Handmann2026-06-02
🤖 AI

Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks

यह शोध पत्र OpenEvolve का उपयोग करते हुए एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि कैसे वेरिफायर-गाइडेड (verifier-guided) LLM एजेंट टेंसर नेटवर्क कॉन्ट्रैक्शन ऑर्डर ऑप्टिमाइज़ेशन के लिए एल्गोरिदम को प्रभावी ढंग से विकसित और सुधार सकते हैं, जबकि मूल्यांकन, सत्यापन और व्याख्या में मानव वैज्ञानिकों की महत्वपूर्ण भूमिका पर जोर दिया गया है।

Fabian Hoppe, Melven Röhrig-Zöllner, Philipp Knechtges2026-06-02
💬 NLP

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

यह शोध पत्र MMG2Skill प्रस्तुत करता है, जो एक क्लोज्ड-लूप फ्रेमवर्क और संबंधित बेंचमार्क (MMG2Skill-Bench) है जो AI एजेंटों को संरचित संकलन (structured compilation) और प्रक्षेपवक्र-संचालित संशोधन (trajectory-driven revision) के माध्यम से शोरयुक्त, मल्टीमॉडल वेब गाइड्स को स्व-विकसित निष्पादन योग्य कौशलों में परिष्कृत करने में सक्षम बनाता है, जो विविध डोमेन में बेसलाइन एजेंटों की तुलना में काफी बेहतर प्रदर्शन करता है।

Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming (…)2026-06-02
🤖 machine learning

Why Do Time Series Models Need Long Context Windows?

यह शोध पत्र तर्क देता है कि टाइम सीरीज़ फोरकास्टिंग (समय श्रृंखला पूर्वानुमान) में लंबी संदर्भ खिड़कियाँ (लॉन्ग कॉन्टेक्स्ट विंडोज़) न केवल दीर्घकालिक निर्भरताओं को पकड़ने के लिए आवश्यक हैं, बल्कि मुख्य रूप से अंतर्निहित डेटा-जनरेटिंग प्रक्रिया की पहचान करने में अनिश्चितता को कम करने के लिए भी अनिवार्य हैं, जो एक ऐसी आवश्यकता है जो न्यूनतम त्रुटि प्राप्त करने के लिए प्रक्रिया की मेमोरी लंबाई से अधिक होने के रूप में सिद्ध हुई है।

Luca Butera, Giovanni De Felice, Andrea Cini, Cesare Alippi2026-06-02
🤖 AI

Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

यह शोध पत्र यह प्रदर्शित करता है कि जबकि लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) में आक्रामक 2-बिट क्वांटाइजेशन अक्सर दोहराव वाले लूप और विलंबित प्रतिबद्धता (delayed commitment) जैसी जनरेशन पैथोलॉजी के कारण एंड-टू-एंड धीमापन का कारण बनता है, इन समस्याओं को FP16 प्लानिंग और लूप रेस्क्यू जैसे हल्के नियंत्रणों के माध्यम से प्रभावी ढंग से कम किया जा सकता है, जिससे वास्तविक अनुमान गति (real inference speed) को बनाए रखते हुए उच्च सटीकता प्राप्त की जा सकती है।

Ekaterina Alimaskina, Darya Rudas, Denis Shveykin, Gleb Molodtsov, Pavel Vasiliev, Aleksandr Beznosikov2026-06-02
🤖 AI

RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network

यह शोध पत्र RL-ACRGNet का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) आधारित एनकोडर-डिकोडर मॉडल है जो नैदानिक रूप से सुसंगत चेस्ट रेडियोग्राफी रिपोर्ट के स्वचालित निर्माण को सुव्यवस्थित करने के लिए एक प्री-ट्रेंड DenseNet और मल्टीलेवल LSTM को एकीकृत करता है, जो IU-Xray और MIMIC-CXR डेटासेट पर अत्याधुनिक बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Yogesh Kumar Meena, Saurabh Agarwal, K. V. Arya2026-06-02
🤖 AI

Attention mechanisms and transfer learning for robust peach leaf damage classification under domain shift

यह अध्ययन एक इमेज-आधारित वर्गीकरण ढांचे का प्रस्ताव करता है जो आड़ू के पत्तों की क्षति का पता लगाने के लिए एफीशिएंटनेट (EfficientNet) आर्किटेक्चर का उपयोग करता है, जिसे विभिन्न पर्यावरणीय डोमेन में मजबूत प्रदर्शन और सशक्त सामान्यीकरण प्राप्त करने के लिए कन्वोल्यूशनल ब्लॉक अटेंशन मॉड्यूल (CBAM) और ट्रांसफर लर्निंग रणनीतियों के साथ उन्नत किया गया है।

Adrián Cánovas-Rodriguez, Miguel A. González-Illán, Maria Fernanda García-Cruz, Pedro Nortes Tortosa, José Salvador Rubi (…)2026-06-02