cs.LG
21965 पेपर
BTI-Net: Bidirectional Decoder-Level Task Interaction via Uncertainty-Aware Gating for Multi-Task Medical Image Analysis
यह शोध पत्र BTI-Net प्रस्तुत करता है, जो एक मल्टी-टास्क मेडिकल इमेज एनालिसिस फ्रेमवर्क है जो अनिश्चितता-जागरूक तंत्र (uncertainty-aware mechanism) के माध्यम से गेटेड द्विदिश डिकोडर-स्तरीय इंटरैक्शन स्थापित करके सेगमेंटेशन और क्लासिफिकेशन प्रदर्शन को बढ़ाता है, ताकि बिना किसी अतिरिक्त इन्फरेंस पास के कार्य-विशिष्ट विशेषताओं को गतिशील रूप से फ़िल्टर किया जा सके।
Few-Step Boltzmann Generators via Scalable Likelihood Flow Maps
यह शोध पत्र SCALLOP को प्रस्तुत करता है, जो फ्लो-आधारित जनरेटिव मॉडल्स के लिए एक स्केलेबल, हचिन्सन-मुक्त (Hutchinson-free) लाइकलीहुड डिस्टिलेशन विधि है, जो मौजूदा बेसलाइन्स जैसे कि F2D2 की तुलना में ट्रेनिंग वेरिएंस और समय को काफी कम करते हुए 10 गुना तक तेज़ इन्फरेंस प्राप्त करता है।
An Information-Geometric Justification for Composite Coherence in Event-Based Narrative Extraction
यह शोधपत्र घटना-आधारित आख्यान निष्कर्षण (event-based narrative extraction) में संयुक्त सुसंगतता मीट्रिक के लिए एक सूचना-ज्यामितीय औचित्य प्रदान करता है, जिसमें यह सिद्ध किया गया है कि ज्यामितीय माध्य (geometric mean) एक उत्पाद मैनिफोल्ड (product manifold) पर चार स्वाभाविक अभिगृहितों (axioms) को संतुष्ट करने वाला अद्वितीय संयोजन है, जहाँ अनुभवजन्य परिणाम फिशर-राओ (Fisher-Rao) मीट्रिक के साथ इसके संरेखण और सुसंगत कथा-धाराओं को यादृच्छिक (random) कथाओं से अलग करने में इसके बेहतर प्रदर्शन की पुष्टि करते हैं।
GPC: Large-Scale Generative Pretraining for Transferable Motor Control
यह शोध पत्र जेनेरेटिव प्रीट्रेंड कंट्रोलर्स (GPC) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विशाल मोशन डेटासेट्स को पुनरुत्पादित करने और स्वाभाविक, उभरते व्यवहारों के साथ विविध डाउनस्ट्रीम कार्यों के अनुकूल होने में सक्षम, मजबूत, सामान्य-उद्देश्य वाले नियंत्रकों को बनाने के लिए टोकनाइज्ड मोशन रिप्रेजेंटेशन को ऑटोरेग्रेसिव नेक्स्ट-टोकन प्रेडिक्शन और रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है।
On the Nonlinearity of Learning Rate Scaling for LLM Training
यह शोध पत्र LLM प्रशिक्षण में लॉग-लीनियर लर्निंग रेट स्केलिंग की धारणा को चुनौती देता है, यह प्रदर्शित करते हुए कि इष्टतम लर्निंग रेट बड़े पैमानों पर ऊपर की ओर वक्रता (upward curvature) प्रदर्शित करते हैं, एक ऐसी गैर-रैखिकता जिसे प्रभावी लर्निंग रेट और डेटा-आधारित एक्सट्रपलेशन का उपयोग करके हल किया जाता है, जिससे अधिक सटीक और लागत-कुशल ट्रांसफर लर्निंग सक्षम होती है।
Invariant Reasoning Directions in Latent Trajectories of Language Models
यह शोध पत्र ट्रजेक्टरी-इनवेरिएंट लेटेंट रिफाइनमेंट (TILR) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो सटीकता से समझौता किए बिना तर्क की निरंतरता में सुधार करने और पैराफ्रेसिंग एवं व्यवधानों के प्रति संवेदनशीलता को कम करने के लिए भाषा मॉडल के लेटेंट ट्रजेक्टरीज के भीतर स्थिर, लो-रैंक इनवेरिएंट दिशाओं की पहचान और हेरफेर करता है।
Symbolic Mechanistic Data Attribution: Tracing Training Influence to Learned Behavioral Policies
यह शोध पत्र सिम्बॉलिक मैकेनिस्टिक डेटा एट्रिब्यूशन (SMDA) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मैकेनिस्टिक इंटरप्रिटेबिलिटी और डेटा एट्रिब्यूशन के बीच सेतु बनाता है, जिससे विश्लेषणात्मक रूप से यह विघटित किया जा सके कि विशिष्ट प्रशिक्षण उदाहरण उच्च-स्तरीय सिम्बॉलिक व्यवहार संबंधी नीतियों को कैसे आकार देते हैं, जिससे बड़े भाषा मॉडलों में व्यवस्थित सुरक्षा अंतराल और फीचर-स्तर के हस्तक्षेप का अनावरण होता है।
Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks
यह शोध पत्र डेड-डायरेक्शन कंडीशनर्स (DDC) को प्रस्तुत करता है, जो एक गेज-इक्विवेरिएंट प्रीकंडीशनिंग फ्रेमवर्क है जो ऑप्टिमाइज़र प्रक्षेप पथों (trajectories) को डीप नेटवर्क पैरामीटर स्पेस के सिमेट्री कोशेंट (symmetry quotient) के साथ संरेखित करता है, जिससे अनुकूलन बहाव (optimization drift) को रोका जा सके, सामान्यीकरण (generalization) में सुधार किया जा सके और AdamW एवं Muon जैसे मानक तरीकों की तुलना में गहरे मिनिमा की खोज को सक्षम बनाया जा सके।
Evidence-Informed LLM Beliefs for Continual Scientific Discovery
यह शोध पत्र एलएलएम (LLM) के साथ निरंतर वैज्ञानिक खोज के लिए एक साक्ष्य-आधारित ढांचे को प्रस्तुत करता है जो स्थिर बेयसियन सरप्राइज (Bayesian surprise) को गैर-स्थिर, विश्वास-अपडेटेड सरप्राइज़ल (belief-updated surprisal) से प्रतिस्थापित करता है और स्पूरियस रिवॉर्ड्स (spurious rewards) को समाप्त करने के लिए फ़िल्टरिंग और विविधता अधिकतमकरण का उपयोग करता है, जिससे कई डोमेन में परिकल्पना अन्वेषण में महत्वपूर्ण सुधार होता है।