cs.LG
22512 पेपर
Persistent Homology as a Theory of Emergent Structure
यह शोध पत्र उद्भव (emergence) के लिए एक गणितीय ढांचे का प्रस्ताव करता है जो मैक्रोस्कोपिक संरचनाओं को एक फिल्ट्रेशन के भीतर निरंतर होमोलॉजी वर्गों (persistent homology classes) के रूप में परिभाषित करता है, और छह उद्भव हस्ताक्षरों को एकीकृत करने तथा विविध जटिल प्रणालियों में सत्यापन योग्य भविष्यवाणियां उत्पन्न करने के लिए हॉज डीकंपोजिशन (Hodge decomposition) और स्पेक्ट्रल विश्लेषण का उपयोग करता है।
Composing Linear Layers from Irreducibles
यह शोध पत्र क्लिफोर्ड बीजगणित (Clifford algebra) का उपयोग करते हुए एक अवकलनीय (differentiable) एल्गोरिदम का प्रस्ताव करता है जो रैखिक परतों (linear layers) को बाइवेक्टर्स (bivectors) और रोटर्स (rotors) के संयोजन में विघटित करता है, जिससे एक पैरामीटर-कुशल प्रतिनिधित्व प्राप्त होता है जो LLM अटेंशन मैकेनिज्म में डेंस मैट्रिसेस (dense matrices) और अन्य सन्निकटन (approximations) के प्रदर्शन के बराबर है।
CP4SBI: Local Conformal Calibration of Credible Sets in Simulation-Based Inference
यह शोध पत्र CP4SBI को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) कॉन्फॉर्मल कैलिब्रेशन फ्रेमवर्क है जो सिमुलेशन-आधारित अनुमान (simulation-based inference) के लिए परिमित-नमूना कवरेज गारंटी के साथ स्थानीय रूप से कैलिब्रेटेड विश्वसनीय सेट (credible sets) का निर्माण करता है, जिससे विभिन्न स्कोरिंग फंक्शन और बेंचमार्क के माध्यम से न्यूरल पोस्टीरियर एस्टिमेटर्स के मिसकैलिब्रेशन को सुधारा जा सके।
The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network
यह अध्ययन प्रदर्शित करता है कि लीला चेस ज़ीरो (Leela Chess Zero) में, न्यूरल नेटवर्क का आंतरिक एल्गोरिद्मिक लुक-अहेड (look-ahead) शतरंज की पहेलियों को सही ढंग से हल करता है, लेकिन ये समाधान अंतिम आउटपुट में सीखे गए सुरक्षा पूर्वाग्रहों (safety priors) द्वारा व्यवस्थित रूप से ओवरराइड कर दिए जाते हैं, जो यह सिद्ध करता है कि एल्गोरिद्मिक संरचना की उपस्थिति एल्गोरिद्मिक व्यवहार की गारंटी नहीं देती है।
Generalizing Beyond Suboptimality: Offline Reinforcement Learning Learns Effective Scheduling through Random Solutions
यह शोध पत्र CDQAC को प्रस्तुत करता है, जो एक ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो स्थिर, उप-इष्टतम (suboptimal) डेटासेट से प्रभावी जॉब शॉप और फ्लेक्सिबल जॉब शॉप शेड्यूलिंग नीतियां सीखता है, और यह प्रदर्शित करता है कि उच्च प्रदर्शन और नमूना दक्षता (sample efficiency) के लिए प्रक्षेपवक्र गुणवत्ता (trajectory quality) की तुलना में व्यापक अवस्था-क्रिया कवरेज (state-action coverage) अधिक महत्वपूर्ण है।
Noise-Guided Transport for Imitation Learning
यह शोध पत्र नॉइज़-गाइडेड ट्रांसपोर्ट (NGT) को प्रस्तुत करता है, जो एक हल्का ऑफ-पॉलिसी इमिटेशन लर्निंग मेथड है जो कार्य को एक ऑप्टिमल ट्रांसपोर्ट समस्या के रूप में तैयार करता है जिसे एडवरसैरियल ट्रेनिंग के माध्यम से हल किया जाता है, और प्रीट्रेनिंग या विशेष आर्किटेक्चर की आवश्यकता के बिना कम-डेटा वाले परिदृश्यों में मजबूत प्रदर्शन प्राप्त करता है।
Reinforcement Learning with Action-Triggered Observations
यह शोध पत्र एक्शन-ट्रिगर स्पोरैडिकली ट्रेसेबल मार्कोव डिसीजन प्रोसेस (ATST-MDPs) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जहाँ चुने गए कार्यों के आधार पर पूर्ण अवस्था अवलोकन स्टोकेस्टिक रूप से होते हैं, और एक आशावादी एल्गोरिदम (ATST-LSVI-UCB) प्रस्तावित करता है जो स्पोरैडिक अवलोकनों के बीच एक्शन-अनुक्रम प्रतिबद्धताओं का लाभ उठाकर लीनियर MDPs के लिए इष्टतम रिग्रेट बाउंड्स प्राप्त करता है।
Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment
यह शोध पत्र सर्टिफिएबल सेफ-आरएलएचएफ (CS-RLHF) प्रस्तुत करता है, जो एक नवीन ढांचा है जो प्रमाणिक सुरक्षा गारंटी प्रदान करने और नाममात्र एवं प्रतिकूल जेलब्रेक प्रॉम्प्ट्स के विरुद्ध दक्षता में महत्वपूर्ण सुधार करने के लिए पारंपरिक द्वैत-चरित (dual-variable) बाधित अनुकूलन को एक अर्थपूर्ण लागत मॉडल और एक सुधारे हुए दंड फॉर्मूलेशन (rectified penalty formulation) से प्रतिस्थापित करता है।
SDQM: Synthetic Data Quality Metric for Object Detection Dataset Evaluation
यह शोधपत्र सिंथेटिक डेटासेट क्वालिटी मेट्रिक (SDQM) को प्रस्तुत करता है, जो ऑब्जेक्ट डिटेक्शन डेटासेट्स के लिए एक नवीन, ट्रेनिंग-मुक्त मूल्यांकन पद्धति है, जो मॉडल प्रदर्शन (mAP) के साथ एक मजबूत सहसंबंध प्रदर्शित करती है और सिंथेटिक डेटा की गुणवत्ता का आकलन करने के लिए मौजूदा मेट्रिक्स के एक अधिक कुशल विकल्प के रूप में कार्य करती है।