📊 statistics

PAC-Bayesian Reinforcement Learning Trains Generalizable Policies

यह शोध पत्र सुदृढीकरण लर्निंग (reinforcement learning) के लिए एक नवीन PAC-Bayesian सामान्यीकरण बाउंड (generalization bound) प्रस्तुत करता है जो मिक्सिंग टाइम (mixing time) के माध्यम से मार्कोव निर्भरताओं (Markov dependencies) को ध्यान में रखता है, और PB-SAC का प्रस्ताव करता है, जो निरंतर नियंत्रण कार्यों (continuous control tasks) में प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए गैर-रिक्त सामान्यीकरण प्रमाण (non-vacuous generalization certificates) प्रदान करने के लिए इस बाउंड को अनुकूलित करता है।

Abdelkrim Zitouni, Mehdi Hennequin, Juba Agoun, Ryan Horache, Nadia Kabachi, Omar Rivasplata2026-06-01
🤖 AI

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

यह शोध पत्र हर्मिस (Hermes) को प्रस्तुत करता है, जो एक नवीन टूल-असिस्टेड एजेंट है जो मौजूदा दृष्टिकोणों की तुलना में बड़े भाषा मॉडलों (large language models) में अधिक सटीक, कुशल और सत्यापन योग्य गणितीय तर्क प्राप्त करने के लिए लीन (Lean) में अनौपचारिक तर्क को औपचारिक रूप से सत्यापित प्रमाणों के साथ अंतर्निहित करता है।

Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia2026-06-01
🤖 AI

Mixture of Horizons in Action Chunking

यह शोध पत्र 'मिक्सचर ऑफ होराइजन्स' (MoH) का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले रणनीति है जो एक्शन चंक्स को विभिन्न क्षितिजों (horizons) वाले खंडों में पुनर्व्यवस्थित करती है ताकि दीर्घकालिक दूरदर्शिता और अल्पकालिक सटीकता को एक साथ अनुकूलित किया जा सके, जिससे विजन-लैंग्वेज-एक्शन मॉडलों में निहित अंतर्निहित ट्रेड-ऑफ पर विजय प्राप्त की जा सके और गतिशील अनुमान क्षमताओं के साथ अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Dong Jing, Gang Wang, Jiaqi Liu, Weiliang Tang, Zelong Sun, Yunchao Yao, Zhenyu Wei, Yunhui Liu, Zhiwu Lu, Mingyu Ding2026-06-01
🤖 AI

DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training

यह शोध पत्र DTop-p को प्रस्तुत करता है, जो एक विरलता-नियंत्रणीय (sparsity-controllable) गतिशील रूटिंग तंत्र है जो अनुकूल रूप से Top-p थ्रेशोल्ड सीखता है और वैश्विक विरलता बाधाओं को लागू करता है ताकि फाउंडेशन मॉडल प्री-ट्रेनिंग में कम्प्यूटेशनल दक्षता बनाए रखते हुए मानक Top-k और फिक्स्ड Top-p MoE बेसलाइनों से बेहतर प्रदर्शन किया जा सके।

Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohiremen Dibua, Yifan Gong, Yan Kang, Dimit (…)2026-06-01
🤖 AI

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs

यह शोध पत्र FEM-Bench प्रस्तुत करता है, जो कम्प्यूटेशनल मैकेनिक्स कार्यों पर आधारित एक संरचित बेंचमार्क है जिसे वैज्ञानिक रूप से वैध फाइनाइट एलीमेंट मेथड कोड उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी इन गैर-तुच्छ समस्याओं को लगातार हल करने में संघर्ष करते हैं।

Saeed Mohammadzadeh, Erfan Hamdi, Joel Shor, Emma Lejeune2026-06-01✓ Author reviewed
🤖 AI

Regret-Based Federated Causal Discovery with Unknown Interventions

यह शोध पत्र I-PERI प्रस्तावित करता है, जो एक नवीन फेडरेटेड एल्गोरिदम है जो एक यूनियन ग्राफ को रिकवर करके और एक टाइटर Φ\Phi-मार्कोव इक्विवेलेंस क्लास प्राप्त करने के लिए अतिरिक्त किनारों (edges) को ओरिएंट करके अज्ञात क्लाइंट-स्तरीय हस्तक्षेपों के तहत कॉज़ल डिस्कवरी को सक्षम बनाता है, जबकि अभिसरण (convergence) और गोपनीयता पर सैद्धांतिक गारंटी भी प्रदान करता है।

Federico Baldo, Charles K. Assaad2026-06-01
🤖 AI

Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments

यह शोध पत्र फ्लो इक्विवेरिएंट वर्ल्ड मॉडल्स (Flow Equivariant World Models) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो आंशिक रूप से प्रेक्षित गतिशील वातावरणों में स्थिर, दीर्घ-क्षितिज भविष्यवाणी सक्षम करने के लिए एक लेटेंट मेमोरी (latent memory) के भीतर समय-पैरामीटराइज्ड समरूपताओं (time-parameterized symmetries) का लाभ उठाता है, जिससे यह सुनिश्चित होता है कि मेमोरी स्व-गतिशीलता और बाहरी वस्तु की गतिशीलता के साथ इक्विवेरिएंट रूप से स्थानांतरित और रूपांतरित होती है।

Hansen Jin Lillemark, Benhao Huang, Fangneng Zhan, Yilun Du, Thomas Anderson Keller2026-06-01
🤖 AI

SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction

यह शोध पत्र SKETCH का प्रस्ताव करता है, जो एक सिमेंटिक की-पॉइंट कंडीशनिंग फ्रेमवर्क है जो कार्य को 'नेक्स्ट की-पॉइंट' के माध्यम से वैश्विक नेविगेशनल इंटेंट अनुमान और स्थानीय मोशन मॉडलिंग में विभाजित करके लॉन्ग-होरिज़न वेसल ट्रेजेक्टरी प्रेडिक्शन में सुधार करता है, जिससे अत्याधुनिक विधियों की तुलना में दिशात्मक निरंतरता में उल्लेखनीय वृद्धि होती है और ड्रिफ्ट कम होता है।

Linyong Gan, Zimo Li, Wenxin Xu, Xingjian Li, Jianhua Z. Huang, Enmei Tu, Shuhang Chen2026-06-01
💬 NLP

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data

यह शोध पत्र Gap-K% का प्रस्ताव करता है, जो एक नवीन विधि है बड़े भाषा मॉडलों (Large Language Models) में प्रीट्रेनिंग डेटा का पता लगाने के लिए, जो बेंचमार्क डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए टॉप-1 प्रेडिक्शन और टारगेट टोकन के बीच लॉग प्रोबेबिलिटी गैप को एक स्लाइडिंग विंडो रणनीति के साथ जोड़ता है।

Minseo Kwak, Jaehyung Kim2026-06-01
🤖 AI

Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory

यह शोध पत्र आइटम रिस्पॉन्स थ्योरी के ग्रेडेड रिस्पॉन्स मॉडल पर आधारित एक दो-चरणीय नैदानिक ढांचे को प्रस्तुत करता है, जो प्रॉम्प्ट विविधताओं के तहत इसकी अंतर्निहित निरंतरता और मानव गुणवत्ता मूल्यांकन के साथ इसके संरेखण का मूल्यांकन करके 'एलएलएम-एज़-अ-जज' (LLM-as-a-Judge) की विश्वसनीयता का व्यवस्थित रूप से आकलन करता है।

Junhyuk Choi, Sohhyung Park, Chanhee Cho, Hyeonchu Park, Bugeun Kim2026-06-01