🤖 machine learning

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

यह शोध पत्र METIS को प्रस्तुत करता है, जो एक नवीन ढांचा है जो LLM सुदृढीकरण फाइन-ट्यूनिंग (Reinforcement Fine-Tuning) के लिए प्रॉम्प्ट-के-भीतर रिवॉर्ड वेरिएंस (within-prompt reward variance) का लाभ उठाकर पाठ्यक्रम निर्णय (curriculum judgment) को एक मूल मेटाकॉग्निटिव क्षमता के रूप में आंतरिक रूप से स्थापित करता है, जिससे बाहरी ह्यूरिस्टिक्स पर निर्भरता समाप्त होती है और काफी तेज़ अभिसरण (convergence) के साथ बेहतर प्रदर्शन प्राप्त होता है।

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu2026-05-13
🤖 AI

Unlocking LLM Creativity in Science through Analogical Reasoning

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में मोड कोलैप्स (mode collapse) को कम करने के लिए एक नवीन दृष्टिकोण के रूप में एनालॉजिकल रीजनिंग (analogical reasoning) को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह कई बायोमेडिकल कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करते हुए उत्पन्न वैज्ञानिक समाधानों की विविधता और नवीनता को महत्वपूर्ण रूप से बढ़ाता है।

Andrew Shen, Shaul Druckmann, James Zou2026-05-13
🤖 machine learning

Curriculum Learning-Guided Progressive Distillation in Large Language Models

यह शोध पत्र करिकुलम लर्निंग-गाइडेड प्रोग्रेसिव डिस्टिलेशन (CLPD) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो प्रशिक्षण डेटा की कठिनाई को धीरे-धीरे बढ़ते शिक्षक मॉडल की क्षमता के साथ संयुक्त रूप से संरेखित करके बड़े भाषा मॉडलों में ज्ञान आसवन (नॉलेज डिस्टिलेशन) को बढ़ाता है, जिससे मौजूदा विधियों की सीमाओं को दूर किया जा जाता है और छोटे छात्र मॉडलों में तर्क प्रदर्शन में सुधार किया जाता है।

Jincheng Cao, Fanzhi Zeng, Leqi Liu, Aryan Mokhtari2026-05-13
📊 statistics

Rethinking external validation for the target population: Capturing patient-level similarity with a generative model

यह शोध पत्र एक नवीन बाह्य सत्यापन ढांचे का प्रस्ताव करता है जो विकास डेटा (डेवलपमेंट डेटा) के साथ रोगी-स्तरीय समानता को मापने के लिए जनरेटिव ऑटोएनकोडर्स का उपयोग करता है, जिससे मॉडल की कमियों और जनसंख्या के अंतरों को अलग किया जा सके ताकि विशिष्ट रोगी उपसमूहों के लिए एक भविष्य कहने वाले मॉडल की परिवहन क्षमता (ट्रांसपोर्टेबिलिटी) और सुरक्षा का अधिक सटीक मूल्यांकन प्रदान किया जा सके।

Mohammad Azizmalayeri (on behalf of the NHR THI registration committee), Ameen Abu-Hanna (on behalf of the NHR THI regis (…)2026-05-13
🤖 machine learning

Beyond Similarity: Temporal Operator Attention for Time Series Analysis

यह शोध पत्र टेम्पोरल ऑपरेटर अटेंशन (TOA) प्रस्तुत करता है, जो स्पष्ट, सीखने योग्य अनुक्रम-स्थान (सीक्वेंस-स्पेस) ऑपरेटरों को शामिल करके टाइम-सीरीज फोरकास्टिंग में मानक सॉफ्टमैक्स अटेंशन की सीमाओं को दूर करने वाला एक ढांचा है ताकि हस्ताक्षरित (साइंड) और दोलनकारी रूपांतरणों को सक्षम बनाया जा सके, जिससे विभिन्न बेंचमार्क पर बेहतर प्रदर्शन प्राप्त किया जा सके।

Jevon Twitty, Vinh Pham, Nitiwith Rotchanarak, Viresh Pati, Yubin Kim, Shihao Yang, Jiecheng Lu2026-05-13
💬 NLP

ReAD: Reinforcement-Guided Capability Distillation for Large Language Models

ReAD एक सुदृढीकरण-निर्देशित (reinforcement-guided) क्षमता आसवन (capability distillation) ढांचा है जो मॉडल क्षमताओं की परस्पर निर्भरता को संबोधित करता है, जो हानिकारक स्पिलओवर और व्यर्थ प्रयास को कम करते हुए डाउनस्ट्रीम उपयोगिता को अनुकूलित करने के लिए एक निश्चित टोकन बजट को गतिशील रूप से आवंटित करता है।

Xueqi Cheng, Xugui Zhou, Tyler Derr, Yushun Dong2026-05-13
🤖 AI

LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

यह शोध पत्र LatentRouter को प्रस्तुत करता है, जो एक नवीन ढांचा है जो रूटिंग को काउंटरफैक्टुअल यूटिलिटी प्रेडिक्शन (counterfactual utility prediction) के रूप में स्वरूपित करके मल्टीमॉडल मॉडल चयन को अनुकूलित करता है, जहाँ सीखे गए कैप्सूल और मॉडल क्षमता टोकन इमेज-क्वेश्चन इनपुट के लिए उम्मीदवार मॉडलों की विशिष्ट शक्तियों का अनुमान लगाने और उन्हें मिलाने के लिए लेटेंट संचार (latent communication) में संलग्न होते हैं, जिससे यह प्रदर्शन और लागत-दक्षता दोनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Xueqi Cheng, Yushun Dong2026-05-13
🤖 machine learning

A Theory of Time-Sensitive Language Generation: Sparse Hallucination Beats Mode Collapse

यह शोध पत्र यह स्थापित करता है कि जबकि एक वैश्विक प्राथमिकता क्रम (global preference ordering) के तहत इवेंचुअली कंसिस्टेंट जनरेटर्स (eventually consistent generators) के लिए समयबद्ध भाषा निर्माण असंभव है, यह तब इष्टतम घनत्व (optimal density) के साथ प्राप्त करना संभव हो जाता है यदि जनरेटर एक लुप्त होते मतिभ्रम दर (vanishing hallucination rate) की अनुमति देता है, बशर्ते कि डेडलाइन फंक्शन सुपरलीनियर (superlinear) हो।

Atul Ganju, Travis McVoy, Shaddin Dughmi, Shang-Hua Teng2026-05-13
🤖 AI

Constraint-Data-Value-Maximization: Utilizing Data Attribution for Effective Data Pruning in Low-Data Environments

यह शोधपत्र कंस्ट्रेंट-डेटा-वैल्यू-मैक्सिमाइजेशन (CDVM) प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है कि डेटा प्रूनिंग को एक बाधित अनुकूलन समस्या (constrained optimization problem) के रूप में फ्रेम करता है ताकि अत्यधिक प्रति-परीक्षण योगदान को दंडित करते हुए मॉडल के प्रभाव को प्रभावी ढंग से अधिकतम किया जा सके, जिससे यह कम-डेटा परिदृश्यों में पारंपरिक शाप्ली-आधारित विधियों से बेहतर प्रदर्शन करता है।

Danilo Brajovic, David A. Kreplin, Marco F. Huber2026-05-13
💻 computer science

Natural Language based Specification and Verification

यह शोध पत्र एक ऐसे नवीन दृष्टिकोण का प्रस्ताव करता है और प्रारंभिक रूप से उसे मान्य करता है जो प्राकृतिक भाषा विनिर्देशों (specifications) को उत्पन्न करने और कोड के कंपोजिशनल वेरिफिकेशन (compositional verification) करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसका लक्ष्य कठोर औपचारिक भाषाओं पर निर्भर हुए बिना असुरक्षित कार्यान्वयनों के उत्पादन को रोकना है।

Zhaorui Li, Chengyu Song2026-05-13