📊 statistics

Prediction Sets for Counterfactual Decisions: Coverage, Optimality, and Conformal Prediction

यह शोध पत्र प्रतितथ्यात्मक निर्णयों (counterfactual decisions) के लिए एक निर्णय-सैद्धांतिक ढांचे को प्रस्तुत करता है जो अनिश्चितता और क्रिया के बीच इष्टतम कड़ी के रूप में "नीति-युग्मित कवरेज" (policy-coupled coverage) को परिभाषित करता है, जिससे PC-RACP एल्गोरिदम का विकास होता है जो मौजूदा विधियों की तुलना में उच्च उपयोगिता और कठोर परिमित-नमूना वैधता प्राप्त करता है।

Yurui Zheng, Ying Jin2026-07-03
📊 statistics

Aggregation with Exponential Weights is Optimal in Expectation

यह शोध पत्र लेक्यू और मेंडेलसनन द्वारा प्रस्तुत खुली समस्या को यह सिद्ध करके हल करता है कि एग्रीगेशन विद एक्सपोनेंशियल वेट्स (AEW) एस्टीमेटर, रैंडम डिज़ाइन के तहत मॉडल सिलेक्शन एग्रीगेशन के लिए, बिना बर्नस्टीन-प्रकार की मान्यताओं के, पर्याप्त रूप से बड़े टेम्परेचर पैरामीटर के साथ, अपेक्षा में Tlog(M)/(n+1)T \log(M)/(n+1) का मिनिमैक्स-ऑप्टिमल एक्सीस रिस्क रेट प्राप्त करता है।

Mikael Møller Høgsgaard, Patrick Rebeschini, Tobias Wegel2026-07-03
💬 NLP

HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures

HERMES एक पुन: प्रयोज्य, डेटा-व्युत्पन्न पदानुक्रमित लेबलिंग सबस्ट्रेट पेश करता है जो विभिन्न रिज़ॉल्यूशन के माध्यम से इष्टतम डेटा मिश्रण रणनीतियों की खोज को सक्षम करने के लिए सीखे गए सिमेंटिक ट्रांसफॉर्म और रेसिडुअल वेक्टर क्वांटाइजेशन का उपयोग करता है, जिसे निश्चित-ग्रैनुलैरिटी विधियाँ परीक्षण नहीं कर सकती हैं।

Ziyun Qiao, Yue Min, Ruining Chen, Yujun Li2026-07-03
🤖 machine learning

Generalization in offline RL: The structure is more important than the amount of pessimism

यह शोध पत्र तर्क देता है कि ऑफलाइन सुदृढीकरण शिक्षण (ऑफलाइन रिइन्फोर्समेंट लर्निंग) में, सफल सामान्यीकरण (जनरलाइजेशन) निराशावादी मान फलन (पेसिमिस्टिक वैल्यू फंक्शन) की इष्टतम समाधान की सममिति (सिमेट्री) के सापेक्ष संरचनात्मक सममिति पर निर्भर करता है न कि निराशावाद की डिग्री पर, जो यह प्रदर्शित करता है कि नीति निष्कर्षण (पॉलिसी एक्सट्रैक्शन) के दौरान निरंतरता हानि (कंसिस्टेंसी लॉस) के माध्यम से सममिति लागू करना मानक डेटा संवर्धन (डेटा ऑग्मेंटेशन) की तुलना में बेहतर प्रदर्शन प्रदान करता है।

Max Weltevrede, Matthijs T. J. Spaan, Wendelin Böhmer2026-07-03
⚛️ quantum physics

One More Time: Revisiting Neural Quantum States from a Reinforcement Learning Perspective

यह शोध पत्र प्रॉक्सिमल वेवफंक्शन ऑप्टिमाइज़ेशन (PWO) को प्रस्तुत करता है, जो एक ट्रस्ट-रीजन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो संभाव्यता अनुपातों (probability ratios) और चरण वृद्धियों (phase increments) को क्लिप करके ऑटोरेग्रेसिव न्यूरल क्वांटम स्टेट्स के प्रशिक्षण की स्थिरता और स्केलेबिलिटी को बढ़ाता है, जिससे 1.5 बिलियन मापदंडों तक के मॉडलों का कुशल अनुकूलन सक्षम होता है।

Juan Agustín Duque, Sergio García Heredia, Vinicius Hernandes, Eliška Greplová, Thomas Spriggs, Aaron Courville, Anna Da (…)2026-07-03
🤖 machine learning

Transformer Geometry Observatory TGO-II: Representational Similarity Observatory

यह शोध पत्र ट्रांसफॉर्मर ज्योमेट्री ऑब्जर्वेटरी-II (TGO-II) फ्रेमवर्क को प्रस्तुत करता है जो यह प्रकट करता है कि विजन ट्रांसफॉर्मर्स प्रशिक्षण के दौरान मजबूत टोकन इंटरेक्शन संरचनाओं को बनाए रखते हुए प्रगतिशील मैनिफोल्ड विस्तार और समृद्ध रूपांतरणों के माध्यम से प्रतिनिधित्व संबंधी जटिलता और परत विशेषज्ञता विकसित करते हैं।

Kaustubh Kapil, Kishor P. Upla2026-07-03
🤖 machine learning

Bringing Agentic Search to Earth Observation Data Discovery

यह शोध पत्र एक एजेंटिक सर्च सिस्टम प्रस्तुत करता है जो नासा (NASA) के अर्थ ऑब्जर्वेशन डेटासेट्स और टूल्स की खोज में महत्वपूर्ण सुधार करने के लिए लार्ज लैंग्वेज मॉडल्स और नॉलेज ग्राफ का लाभ उठाता है, जिसे एक नए बेंचमार्क (NASA-EO-Bench) द्वारा प्रमाणित किया गया है और एक हाइब्रिड रिट्रीवल पाइपलाइन द्वारा सुदृढ़ किया गया है जो रिट्रीवल प्रदर्शन में पर्याप्त वृद्धि प्राप्त करने के लिए सुपरवाइज्ड स्कोरिंग को ज़ीरो-शॉट एजेंटिक रीरैंकिंग के साथ जोड़ता है।

Minghan Yu, Youran Sun, Chugang Yi, Yixin Wen, Haizhao Yang2026-07-03
🤖 machine learning

DecompRL: Solving Harder Problems by Learning Modular Code Generation

यह शोध पत्र DecompRL प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो लार्ज लैंग्वेज मॉडल्स (LLMs) को कार्यों को मॉड्यूलर उप-कार्यों (sub-functions) में विभाजित करना सीखने में सक्षम बनाता है, जिन्हें फिर पुनर्संयोजित करके खोज स्थान (search space) को तेजी से विस्तारित किया जाता है और GPU इन्फरेंस लागत को काफी कम किया जाता है, जिससे वे पहले असाध्य कोडिंग समस्याओं को हल कर पाते हैं।

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve2026-07-03
🤖 machine learning

WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

WattGPU एक नया ढांचा पेश करता है जो केवल सार्वजनिक मेटाडेटा का उपयोग करके, अनदेखे GPU और LLM पर लार्ज लैंग्वेज मॉडल्स की बिजली खपत और इन्फरेंस लेटेंसी (inference latency) की सटीक भविष्यवाणी करता है, जो हार्डवेयर प्रोफाइलिंग की आवश्यकता के बिना पारंपरिक भौतिक आधारों (physical baselines) से काफी बेहतर प्रदर्शन करता है।

Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez2026-07-03
🤖 AI

Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

यह शोध पत्र RFM-AGOP के माध्यम से फास्ट मल्टी-डायमेंशनल रिफ्यूज़ल सबस्पेस (Fast Multi-dimensional Refusal Subspaces) को प्रस्तुत करता है, जो एक कुशल विधि है जो प्रोब-इन्फॉर्म्ड इनिशियलाइज़ेशन (probe-informed initialization) के साथ रिकर्सिव फीचर मशीन एल्गोरिदम को अनुकूलित करती है ताकि रीजनिंग और नॉन-रीजनिंग दोनों प्रकार के LLMs में मल्टी-डायमेंशनल रिफ्यूज़ल सबस्पेसों की तेजी से और सटीक रूप से पहचान की जा सके, जिससे मौजूदा तकनीकों की कम्प्यूटेशनल सीमाओं को दूर किया जा सके।

Thomas Winninger2026-07-03