🤖 machine learning

Offline Reinforcement Learning with Generative Trajectory Policies

यह शोधपत्र जेनेरेटिव ट्रैजेक्टरी पॉलिसीज़ (GTPs) को प्रस्तुत करता है, जो एक एकीकृत ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो निरंतर-समय ODE-आधारित ट्रैजेक्टरी समाधान मानचित्रों को सीखकर धीमे डिफ्यूजन मॉडल्स और तेज़ कंसिस्टेंसी मॉडल्स के बीच के अंतर को पाटता है, और चुनौतीपूर्ण AntMaze कार्यों पर परफेक्ट स्कोर सहित D4RL बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen2026-05-29
📊 statistics

Beyond Accuracy: Are Time Series Foundation Models Well-Calibrated?

यह शोध पत्र पांच हालिया टाइम सीरीज़ फाउंडेशन मॉडल्स के कैलिब्रेशन का व्यवस्थित रूप से मूल्यांकन करता है, जिसमें यह पाया गया है कि वे विभिन्न पूर्वानुमान परिदृश्यों में बेसलाइन मॉडल्स की तुलना में लगातार बेहतर कैलिब्रेटेड हैं और व्यवस्थित अति-आत्मविश्वास (सिस्टमैटिक ओवरकॉन्फिडेंस) के प्रति कम संवेदनशील हैं।

Coen Adler, Yuxin Chang, Felix Draxler, Samar Abdi, Padhraic Smyth2026-05-29
🔬 materials science

MiAD: Mirage Atom Diffusion for De Novo Crystal Generation

यह शोध पत्र MiAD को प्रस्तुत करता है, जो एक इक्विवेरिएंट जॉइंट डिफ्यूजन मॉडल है जो जनरेशन के दौरान परमाणुओं की संख्या को गतिशील रूप से बदलने के लिए एक नवीन "मिराज इन्फ्यूजन" तकनीक का उपयोग करता है, जिससे मौजूदा अत्याधुनिक दृष्टिकोणों की तुलना में स्थिर, अद्वितीय और नवीन क्रिस्टलीय सामग्रियों की खोज में महत्वपूर्ण सुधार होता है।

Andrey Okhotin, Maksim Nakhodnov, Nikita Kazeev, Mikhail Lazarev, Andrey E Ustyuzhanin, Dmitry Vetrov2026-05-29
🤖 AI

ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing

ReflexGrad एक द्वैत-प्रक्रिया (dual-process) आर्किटेक्चर है जो LLM एजेंटों को प्रदर्शनों (demonstrations) के बिना एपिसोड-के-भीतर की विफलताओं से उबरने में सक्षम बनाता है, जो तेज़ निरंतर परिशोधन (fast continuous refinement) और धीमी कारण निदान (slow causal diagnosis) के बीच गतिशील रूप से रूटिंग करके विभिन्न मॉडल पैमानों पर ALFWorld कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

Ankush Kadu, Aswanth Krishnan2026-05-29
🤖 AI

Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach

यह शोध पत्र डिफ्यूजन मॉडल फाइन-ट्यूनिंग में डेटासेट वॉटरमार्किंग के लिए एक व्यापक मूल्यांकन ढांचा स्थापित करता है, जो यह प्रदर्शित करता है कि हालांकि वर्तमान विधियां कुछ मजबूती प्रदान करती हैं, फिर भी वे एक नई प्रस्तावित व्यावहारिक निष्कासन तकनीक के प्रति संवेदनशील बनी हुई हैं जो मॉडल के प्रदर्शन से समझौता किए बिना वॉटरमार्क को पूरी तरह से समाप्त कर देती है।

Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia (…)2026-05-29
🔬 mesoscale physics

Topological Order in Neural Wavefunctions

यह शोध पत्र प्रदर्शित करता है कि अटेंशन-आधारित डीप न्यूरल नेटवर्क ऊर्जा न्यूनीकरण के माध्यम से भिन्नात्मक चेर्न इंसुलेटर (fractional Chern insulator) ग्राउंड स्टेट्स को प्रभावी ढंग से खोज सकते हैं और उनकी टोपोलॉजिकल डिजेनेरेसी (topological degeneracy) को निकाल सकते हैं, जो न्यूरल नेटवर्क वेरिएशनल मोंटे कार्लो (neural network variational Monte Carlo) को पूर्व ज्ञान के बिना दृढ़ सहसंबद्ध टोपोलॉजिकल चरणों के अध्ययन के लिए एक शक्तिशाली उपकरण के रूप में स्थापित करता है।

Ahmed Abouelkomsan, Max Geier, Liang Fu2026-05-29
📊 statistics

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

यह शोध पत्र E-valuator को प्रस्तुत करता है, जो एक हल्का और मॉडल-अज्ञेय (model-agnostic) ढांचा है जो अनुक्रमिक परिकल्पना परीक्षण (sequential hypothesis testing) और ई-प्रक्रियाओं (e-processes) का उपयोग करके ब्लैक-बॉक्स सत्यापनकर्ता स्कोर को सांख्यिकीय रूप से वैध निर्णय नियमों में परिवर्तित करता है ताकि एजेंटिक AI प्रक्षेप पथों (agentic AI trajectories) की विश्वसनीय रूप से निगरानी की जा सके, गलत अलार्म दरों को नियंत्रित किया जा सके, और विफल होने वाले अनुक्रमों को समय से पूर्व समाप्त करने में सक्षम बनाया जा सके।

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang2026-05-29
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

यह शोध पत्र 'रूलर्स' (Rulers) का परिचय देता है, जो एक तीन-चरणीय इन्फरेंस-टाइम फ्रेमवर्क है जो मानवीय रूब्रिक्स को लॉक किए गए विनिर्देशों (specifications) में परिवर्तित करता है, संरचित साक्ष्य ग्राउंडिंग (structured evidence grounding) को लागू करता है, और विविध टेक्स्ट मूल्यांकन कार्यों में अधिक विश्वसनीय और मानव-संरेखित (human-aligned) एलएलएम स्कोरिंग प्राप्त करने के लिए सामान्य विफलता मोड पर काबू पाने हेतु पोस्ट-हॉक अंशांकन (post-hoc calibration) लागू करता है।

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong2026-05-29
🤖 AI

Steering Language Models Before They Speak: Logit-Level Interventions

यह शोध पत्र SWAI को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) इन्फरेंस-टाइम विधि है जो कॉर्पस-व्युत्पन्न सांख्यिकीय पूर्वाग्रहों (statistical biases) को सीधे टॉप-K लोगिट उम्मीदवारों (top-K logit candidates) पर लागू करके भाषा मॉडल के आउटपुट को विनम्रता या पठनीयता जैसे विशिष्ट गुणों की ओर निर्देशित करता है, जिससे मॉडल मापदंडों को संशोधित किए बिना या सहायक मॉडलों की आवश्यकता के बिना बेहतर नियंत्रण प्राप्त होता है।

Hyeseon An, Shinwoo Park, Hyundong Jin, Yo-Sub Han2026-05-29
🤖 AI

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

यह शोध पत्र 'चेन-ऑफ-मेटा-थॉट' (CoMT) और 'कॉन्फिडेंस-कैलिब्रेटेड रीइन्फोर्समेंट लर्निंग' (CCRL) नामक एक संज्ञानात्मक रूप से संरेखित पोस्ट-ट्रेनिंग फ्रेमवर्क का प्रस्ताव करता है जो एलएलएम (LLM) तर्क की सामान्यीकरण क्षमता और विश्वसनीयता में सुधार करने के लिए अमूर्त रणनीति अधिग्रहण को विशिष्ट निष्पादन से अलग करता है, जिससे मानक विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Shaojie Wang, Liang Zhang2026-05-29