cs.LG
23164 पेपर
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
यह शोध पत्र गाइडेड डिनोइज़र सेल्फ-डिस्टिलेशन (GDSD) प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो ELBO-आधारित लाइकलीहुड सरोगेट्स के पूर्वाग्रहों को दरकिनार करते हुए, सीधे एक एडवांटेज-गाइडेड टीचर को डिनोइज़र में डिस्टिल करता है, जिससे अधिक स्थिर प्रशिक्षण और रीजनिंग बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।
Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting
यह शोध पत्र PostTime प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो सुपरवाइज्ड फाइन-ट्यूनिंग और वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग का लाभ उठाता है ताकि LLMs को न्यूमेरिकल टाइम-सीरीज फाउंडेशन मॉडल्स के लिए कॉन्टेक्स्ट-गाइडेड रिविज़र्स के रूप में सक्षम बनाया जा सके, जो गैर-संख्यात्मक संदर्भ को पूर्वानुमान संशोधनों में एकीकृत करके मल्टीमॉडल फोरकास्टिंग प्रदर्शन में महत्वपूर्ण सुधार करता है।
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
AliMark एक सुदृढ़ वाक्य-स्तरीय वॉटरमार्किंग फ्रेमवर्क है जो डिटेक्शन को बिट अनुक्रम संरेखण (bit sequence alignment) समस्या के रूप में पुनर्गठित करता है और वाक्य विभाजन और विलय जैसे संरचनात्मक व्यवधानों का प्रभावी ढंग से सामना करने के लिए एडेप्टिव पुनर्गठित टेक्स्ट वेरिएंट्स के साथ एक दो-चरणीय रणनीति का उपयोग करता है।
A Full-Pipeline Framework for Evaluating Membership Inference Attacks in Machine Learning
यह शोध पत्र एक व्यापक मूल्यांकन ढांचा प्रस्तुत करता है जो विविध मशीन लर्निंग पाइपलाइनों, थ्रेट मॉडल्स और मेट्रिक्स में मेंबरशिप इन्फरेंस अटैक की प्रभावकारिता को व्यवस्थित रूप से अभिलक्षित करता है ताकि मजबूत गोपनीयता ऑडिटिंग के लिए व्यावहारिक दिशा-निर्देश और एक टूलकिट प्रदान किया जा सके।
Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models
यह शोध पत्र क्रोनेकर एम्बेडिंग्स (Kronecker Embeddings) को प्रस्तुत करता है, जो एक नियतात्मक बाइट-स्तरीय गुणनखंडन विधि है जो मानक बड़े एम्बेडिंग टेबल्स के स्थान पर एक निश्चित एनकोडर और एक एकल सीखे गए प्रोजेक्शन का उपयोग करती है, जिससे बड़े भाषा मॉडलों में प्रशिक्षण दक्षता, वर्तनी संबंधी मजबूती और रनटाइम मेमोरी उपयोग में सुधार करते हुए इनपुट-साइड के 91-94% प्रशिक्षित मापदंडों (trainable parameters) को समाप्त किया जाता है।
Honest Lying: Understanding Memory Confabulation in Reflexive Agents
यह शोधपत्र प्रकट करता है कि रिफ्लेक्शन-शैली (Reflexion-style) वाले एजेंट "मेमोरी कॉन्फैब्युलेशन" (स्मृति भ्रम) से ग्रस्त होते हैं, जहाँ वे आत्मविश्वास के साथ गलत आत्म-चिंतन को संग्रहीत करते हैं और बार-बार उसी पर निर्भर रहते हैं, और खुले-अंत वाले आत्म-निदान (self-diagnosis) के स्थान पर प्रोग्रामेटिक विफलता संकेतों (programmatic failure signals) का उपयोग करने वाला एक शमन रणनीति प्रस्तावित करता है, जो इस त्रुटि दर को काफी कम करता है और कार्य प्रदर्शन में सुधार करता है।
Composing Non-Conjugate Factor Graphs with Closed-Form Variational Inference
यह शोध पत्र यह प्रदर्शित करता है कि पांच विशिष्ट फैक्टर-ग्राफ प्रिमिटिव्स (factor-graph primitives) को संयोजित करके गहरे संभाव्य आर्किटेक्चर (deep probabilistic architectures) में क्लोज्ड-फॉर्म वेरिएशनल इन्फरेंस (closed-form variational inference) को संरक्षित किया जा सकता है, जो बिना किसी सीखे गए गेटिंग पैरामीटर्स (learned gating parameters) के निर्णय वृक्षों (decision trees) और कैलिब्रेटेड अनिश्चितता वाले बायेसियन मिश्रण विशेषज्ञों (Bayesian mixture of experts) जैसे सार्वभौमिक फलन सन्निकटों (universal function approximators) के निर्माण को सक्षम बनाता है।
PhoneWorld: Scaling Phone-Use Agent Environments
PhoneWorld एक स्केलेबल पाइपलाइन पेश करता है जो 34 ऐप्स में वास्तविक मोबाइल GUI प्रक्षेप पथों (trajectories) को स्वचालित रूप से नियंत्रणीय, सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है, जिससे मैनुअल बेंचमार्क निर्माण से ध्यान हटाकर फोन-उपयोग वातावरण के बड़े पैमाने पर उत्पादन पर केंद्रित करते हुए कई बेंचमार्क पर एजेंट के प्रदर्शन में महत्वपूर्ण सुधार होता है।
Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging
यह शोध पत्र MergePipe प्रस्तुत करता है, जो एक बजट-जागरूक निष्पादन परत (execution layer) है जो LLM मॉडल मर्जिंग को एक्सपर्ट एक्सेस-सेट समस्या के रूप में मानकर उसे अनुकूलित करता है ताकि उच्च सटीकता को बाउंडेड एरर गारंटी के माध्यम से बनाए रखते हुए I/O को महत्वपूर्ण रूप से कम किया जा सके और प्रक्रिया को तेज किया जा सके।