🤖 machine learning

Uncertainty-aware reinforcement learning for chemical language models

यह शोध पत्र दो अनिश्चितता-जागरूक सुदृढीकरण शिक्षण (अनसर्टेन्टी-अवेयर रीइन्फोर्समेंट लर्निंग) ढांचों का प्रस्ताव और मूल्यांकन करता है जो रासायनिक भाषा मॉडलों के लिए अविश्वसनीय रासायनिक स्थान की खोज के जोखिमों को कम करते हैं, या तो अनिश्चितता को एक अनुकूलन उद्देश्य के रूप में मानकर या नीति अपडेट को नियंत्रित करके, जो अंततः काफी उच्च वास्तविक हिट दर के साथ अधिक सुदृढ़ आणविक डिजाइन प्राप्त करता है।

Borja Medina, Jon Paul Janet2026-06-25
🤖 machine learning

The Geometry of Sequential Learning: Lie-Bracket Prediction of Transfer Order

यह शोध पत्र अनुक्रमिक शिक्षण (sequential learning) के लिए एक ज्यामितीय ढांचे का प्रस्ताव करता है जो इष्टतम प्रशिक्षण क्रमों की भविष्यवाणी करने के लिए ग्रेडिएंट अपडेट क्षेत्रों के ली-ब्रैकेट कम्यूटेटर (Lie-bracket commutator) का उपयोग करता है, जिससे एक स्केलेबल टूर्नामेंट-आधारित प्लानर सक्षम होता है जो विविध डोमेन में व्यापक मूल्यांकन की आवश्यकता के बिना, युग्मवार क्रम निर्धारण (pairwise ordering) और पाठ्यक्रम शेड्यूलिंग (curriculum scheduling) में उच्च सटीकता प्राप्त करता है।

John Sweeney2026-06-25
🤖 machine learning

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

एक्स्ट्रा (ExTra) एक GRPO-संगत फ्रेमवर्क है जो विविध सही समाधानों के लिए नवीनता पुरस्कारों (novelty rewards) और आसान एवं कठिन रीजनिंग कार्यों पर मानक RLVR की सीमाओं को दूर करने के लिए एंट्रॉपी-निर्देशित प्रीफिक्स पुनर्जनन (entropy-guided prefix regeneration) को जोड़कर भाषा मॉडल सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है, जिससे सटीकता और इन्फरेंस-टाइम कवरेज में महत्वपूर्ण सुधार होता है।

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low2026-06-25
🤖 machine learning

What's in an Earth Embedding? An Explainability Analysis of Location Encoders

यह शोध पत्र एक व्याख्यात्मकता ढांचा (explainability framework) प्रस्तुत करता है जो भौगोलिक इनहेरेंट न्यूरल रिप्रेजेंटेशन (INR) लोकेशन एम्बेडिंग्स को मानव-व्याख्या योग्य स्पार्स लेटेंट कॉन्सेप्ट्स, प्राकृतिक भाषा के शब्दों और दृश्य विशेषताओं में विघटित करता है, जिससे इन व्यापक रूप से उपयोग किए जाने वाले भूस्थानिक निरूपणों के भीतर एनकोडेड विशिष्ट भौगोलिक और अर्थ संबंधी जानकारी—जैसे कि बायोम्स, शहरी संरचनाएं और लैंडमार्क्स—को प्रकट किया जा सके।

Livia Betti, Sebastian Ricke, Ivica Obadic, Adam J. Stewart, Esther Rolf2026-06-25
🤖 machine learning

Internal Data Repetition Destroys Language Models

यह शोध पत्र यह प्रदर्शित करता है कि चिनचिला-युग के स्केलिंग प्रतिमान (scaling paradigm) में, डेटा पुनरावृत्ति व्यवस्थित रूप से भाषा मॉडल के प्रदर्शन को नुकसान पहुँचाती है, क्योंकि यह एक मध्यवर्ती पुनरावृत्ति संख्या पर एक कंप्यूट-तुल्य हानि शिखर (compute-equivalent loss peak) उत्पन्न करती है जो मॉडल के आकार के साथ बढ़ता है, एक ऐसी घटना जिसे विश्लेषणात्मक रूप से स्मृति (memorization) और सामान्यीकरण (generalization) के बीच एक सांख्यिकीय समझौते के रूप में समझाया गया है।

Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo (…)2026-06-25
🤖 machine learning

A Zeroth-Order Deep Learning Method for Fully Nonlinear Parabolic Partial Differential Equations with Unknown Coefficients

यह शोध पत्र एक पूर्णतः मॉडल-मुक्त, ज़ीरो-ऑर्डर डीप लर्निंग विधि प्रस्तुत करता है जो डेरिवेटिव्स का अनुमान लगाने के लिए विक्षुब्ध मोंटे कार्लो प्रक्षेप पथों (perturbed Monte Carlo trajectories) का उपयोग करके अज्ञात गुणांकों वाले उच्च-आयामी पूर्णतः गैर-रेखीय परवलयिक PDEs को हल करता है, जिससे ऑटोमैटिक डिफरेंशिएशन की अस्थिरता और स्पष्ट डायनेमिक्स ज्ञान की आवश्यकता से बचा जा सकता है और साथ ही कठोर गैर-एसिम्प्टोटिक त्रुटि सीमाएं (non-asymptotic error bounds) प्रदान की जा सकती हैं।

Yanwei Jia, Du Ouyang, Huyên Pham, Xun Yu Zhou2026-06-25
🤖 machine learning

TRACER: Training-Free Closed-Loop Structured Inference for Traffic Accident Reconstruction

TRACER एक प्रशिक्षण-मुक्त, क्लोज्ड-लूप स्ट्रक्चर्ड इन्फरेंस फ्रेमवर्क है जो भौतिक बाधाओं के तहत इवेंट-एंकर वाले मोशन हाइपोथीसिस को पुनरावृत्ति से परिष्कृत करके यातायात दुर्घटनाओं का पुनर्निर्माण करता है, जिससे मौजूदा डेटा-संचालित और भौतिकी-आधारित बेसलाइनों की तुलना में बेहतर ज्यामितीय निष्ठा और टकराव सटीकता प्राप्त होती है।

Yanchen Guan, Chengyue Wang, Bin Rao, Haicheng Liao, Jiaxun Zhang, Shang Gao, Chengzhong Xu, Zhenning Li2026-06-25
🤖 machine learning

Certification of Machine Learning Models via Directional Sharpness

यह शोध पत्र "डायरेक्शनल शार्पनेस" (directional sharpness) प्रस्तुत करता है, जो एक गणनात्मक रूप से कुशल और विश्वसनीय मीट्रिक है जो मशीन लर्निंग मॉडल के सामान्यीकरण को प्रमाणित करने में मौजूदा मापों से बेहतर प्रदर्शन करता है, तब भी जब प्रशिक्षण प्रक्रियाओं को बाधित किया जाता है या ज़ीरो-नॉलेज प्रूफ के माध्यम से डेटा गोपनीयता बनाए रखनी होती है।

Gefei Tan, Adria Gascon, Sarah Meiklejohn, Mariana Raykova2026-06-25
🤖 machine learning

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

यह स्थिति पत्र (position paper) तर्क देता है कि जबकि न्यूरल स्केलिंग लॉ के घातांक (exponents) सॉफ्टमैक्स नॉन-लिनियरिटी (Softmax nonlinearity) और रिप्रजेंटेशनल सुपरपोजिशन (representational superposition) जैसे सार्वभौमिक तंत्रों द्वारा निर्धारित होते हैं, उनके गुणांक (coefficients)—जो व्यावहारिक प्रदर्शन और इष्टतम मॉडल विन्यास को निर्देशित करते हैं—विशिष्ट डेटा और वास्तुशिल्प विवरणों के प्रति संवेदनशील होते हैं, जिससे उनका बोध निकट-अवधि के एआई सुधारों की कुंजी बन जाता है।

Yizhou Liu, Jeff Gore2026-06-25
🤖 machine learning

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर मॉडलों में उभरती हुई क्षमताएं प्रशिक्षण के दौरान कार्य-प्रासंगिक, विरल अटेंशन पैटर्न (sparse attention patterns) के अचानक सीखने के परिणामस्वरूप स्टोकेस्टिक रूप से उत्पन्न होती हैं, जिसमें बड़े मॉडल बेहतर शिक्षण दक्षता के कारण इन पैटर्न को पहले प्राप्त कर लेते हैं।

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov2026-06-25✓ Author reviewed