cs.AI
23200 पेपर
Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space
यह शोध पत्र इको (Echo) को प्रस्तुत करता है, जो एक 25 मिलियन-पैरामीटर वाला प्रूफ-ऑफ-कांसेप्ट ऑडियो सिस्टम है, जो जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPA) के साथ प्रीट्रेन किए गए एकल ViT एनकोडर का उपयोग करता है ताकि प्रति-कार्य फाइन-ट्यूनिंग के बिना एक साझा लेटेंट स्पेस में स्पीकर डायराइजेशन, स्पीच सेपरेशन और फोनेटिक एनकोडिंग को संयुक्त रूप से निष्पादित किया जा सके, जो एंड-टू-एंड ASR में वर्तमान सीमाओं को उजागर करते हुए मल्टी-टास्क सह-अस्तित्व की व्यवहार्यता को प्रदर्शित करता है।
Parameter-Efficient Fine-Tuning of Large Pretrained Models for Instance Segmentation Tasks
यह अध्ययन प्रदर्शित करता है कि डिफॉर्मेबल अटेंशन (deformable attention) पर एडेप्टर्स (adapters) और लो-रैंक अडैप्टेशन (LoRA) जैसे पैरामीटर-कुशल फाइन-ट्यूनिंग तरीकों को लागू करने से, ट्रांसफॉर्मर-आधारित मॉडल केवल 1-6% पैरामीटर्स को फाइन-ट्यून करके प्रतिस्पर्धी इंस्टेंस सेगमेंटेशन प्रदर्शन प्राप्त करने में सक्षम होते हैं, जो पारंपरिक फाइन-ट्यूनिंग की तुलना में कम्प्यूटेशनल लागत को काफी कम कर देता है।
Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks
यह शोध पत्र OpenEvolve का उपयोग करते हुए एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि कैसे वेरिफायर-गाइडेड (verifier-guided) LLM एजेंट टेंसर नेटवर्क कॉन्ट्रैक्शन ऑर्डर ऑप्टिमाइज़ेशन के लिए एल्गोरिदम को प्रभावी ढंग से विकसित और सुधार सकते हैं, जबकि मूल्यांकन, सत्यापन और व्याख्या में मानव वैज्ञानिकों की महत्वपूर्ण भूमिका पर जोर दिया गया है।
A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
यह शोध पत्र MMG2Skill प्रस्तुत करता है, जो एक क्लोज्ड-लूप फ्रेमवर्क और संबंधित बेंचमार्क (MMG2Skill-Bench) है जो AI एजेंटों को संरचित संकलन (structured compilation) और प्रक्षेपवक्र-संचालित संशोधन (trajectory-driven revision) के माध्यम से शोरयुक्त, मल्टीमॉडल वेब गाइड्स को स्व-विकसित निष्पादन योग्य कौशलों में परिष्कृत करने में सक्षम बनाता है, जो विविध डोमेन में बेसलाइन एजेंटों की तुलना में काफी बेहतर प्रदर्शन करता है।
Why Do Time Series Models Need Long Context Windows?
यह शोध पत्र तर्क देता है कि टाइम सीरीज़ फोरकास्टिंग (समय श्रृंखला पूर्वानुमान) में लंबी संदर्भ खिड़कियाँ (लॉन्ग कॉन्टेक्स्ट विंडोज़) न केवल दीर्घकालिक निर्भरताओं को पकड़ने के लिए आवश्यक हैं, बल्कि मुख्य रूप से अंतर्निहित डेटा-जनरेटिंग प्रक्रिया की पहचान करने में अनिश्चितता को कम करने के लिए भी अनिवार्य हैं, जो एक ऐसी आवश्यकता है जो न्यूनतम त्रुटि प्राप्त करने के लिए प्रक्रिया की मेमोरी लंबाई से अधिक होने के रूप में सिद्ध हुई है।
Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery
यह शोध पत्र यह प्रदर्शित करता है कि जबकि लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) में आक्रामक 2-बिट क्वांटाइजेशन अक्सर दोहराव वाले लूप और विलंबित प्रतिबद्धता (delayed commitment) जैसी जनरेशन पैथोलॉजी के कारण एंड-टू-एंड धीमापन का कारण बनता है, इन समस्याओं को FP16 प्लानिंग और लूप रेस्क्यू जैसे हल्के नियंत्रणों के माध्यम से प्रभावी ढंग से कम किया जा सकता है, जिससे वास्तविक अनुमान गति (real inference speed) को बनाए रखते हुए उच्च सटीकता प्राप्त की जा सकती है।
RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
यह शोध पत्र RL-ACRGNet का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) आधारित एनकोडर-डिकोडर मॉडल है जो नैदानिक रूप से सुसंगत चेस्ट रेडियोग्राफी रिपोर्ट के स्वचालित निर्माण को सुव्यवस्थित करने के लिए एक प्री-ट्रेंड DenseNet और मल्टीलेवल LSTM को एकीकृत करता है, जो IU-Xray और MIMIC-CXR डेटासेट पर अत्याधुनिक बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।
Attention mechanisms and transfer learning for robust peach leaf damage classification under domain shift
यह अध्ययन एक इमेज-आधारित वर्गीकरण ढांचे का प्रस्ताव करता है जो आड़ू के पत्तों की क्षति का पता लगाने के लिए एफीशिएंटनेट (EfficientNet) आर्किटेक्चर का उपयोग करता है, जिसे विभिन्न पर्यावरणीय डोमेन में मजबूत प्रदर्शन और सशक्त सामान्यीकरण प्राप्त करने के लिए कन्वोल्यूशनल ब्लॉक अटेंशन मॉड्यूल (CBAM) और ट्रांसफर लर्निंग रणनीतियों के साथ उन्नत किया गया है।