🤖 machine learning

Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

यह शोध पत्र स्टेट वैल्यू एस्टीमेशन बेंचमार्क (SVEB) को पेश करके और दो नवीन तकनीकों, Numca और Hista, का प्रस्ताव देकर LLM सुदृढीकरण शिक्षण (reinforcement learning) में सटीक स्टेट वैल्यू अनुमान की चुनौती को संबोधित करता है, जो बिना किसी महत्वपूर्ण कम्प्यूटेशनल ओवरहेड के प्रशिक्षण स्थिरता और प्रदर्शन में काफी सुधार करते हैं।

Zizhe Chen, Jiqian Dong, Yizhou Tian, Garry Yang, Yongqiang Chen, Zhitang Chen, James Cheng2026-05-29
🤖 AI

Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations

यह शोध पत्र क्रोइसेंट टास्क (Croissant Tasks) को प्रस्तुत करता है, जो एक डिक्लेरेटिव मेटाडेटा फॉर्मेट है जो मशीन लर्निंग में वैचारिक पुनरुत्पादकता (conceptual reproducibility) को सक्षम बनाता है, जिससे स्वायत्त एजेंटों को भंगुर सोर्स कोड प्रतिकृति पर निर्भर रहने के बजाय उच्च-स्तरीय विशिष्टताओं से स्वतंत्र, कार्यात्मक कार्यान्वयन उत्पन्न करने की अनुमति मिलती है।

Omar Benjelloun, Leonardo Martins Bianco, Isabelle Guyon, Thanh Gia Hieu Khuong, Jonathan Lebensold, Sebastian Lobentanz (…)2026-05-29
🤖 AI

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

यह शोध पत्र SAAS को प्रस्तुत करता है, जो एक स्व-जागरूक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ज्ञान की सीमाओं को गतिशील रूप से मॉडल करके और सटीकता से समझौता किए बिना कम्प्यूटेशनल लागत को कम करने के लिए चरण-वार अनुकूलन लागू करके एजेंटिक खोज प्रणालियों में अत्यधिक खोज (over-search) को कम करता है।

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su2026-05-29
🤖 machine learning

Data filtering methods for training language models

यह शोध पत्र रूसी टेक्स्ट वर्गीकरण डेटासेट में लेबल त्रुटियों का पता लगाने के लिए कॉन्फिडेंट लर्निंग और डेटासेट कार्टोग्राफी का एक तुलनात्मक विश्लेषण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि हालांकि दोनों विधियाँ रैंडम रिमूवल से बेहतर प्रदर्शन करती हैं, उनकी मॉडल प्रदर्शन में सुधार करने की प्रभावशीलता काफी हद तक डेटासेट के आकार और शोर के स्तरों पर निर्भर करती है, जिसमें कॉन्फिडेंट लर्निंग छोटे, शोर वाले डेटासेट पर महत्वपूर्ण लाभ प्रदान करती है।

Egor Shevchenko, Elena Bruches2026-05-29
🤖 AI

PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing

यह शोध पत्र PRAIB को प्रस्तुत करता है, जो एक नवीन बेंचमार्क फ्रेमवर्क और एक बड़े पैमाने का अनुभवजन्य अध्ययन है जो मानव फीडबैक के विरुद्ध 11,000 मशीन-जनित समीक्षाओं का विश्लेषण करता है ताकि महत्वपूर्ण व्यवहारिक विचलन—जैसे कि सकारात्मक पूर्वाग्रह, अति-आत्मविश्वास, और सूक्ष्म कमियों को न देख पाना—को प्रकट किया जा सके, जिससे पीयर रिव्यू प्रक्रिया में LLMs की वर्तमान विश्वसनीयता और सीमाओं को निर्धारित करने के लिए एक नैदानिक उपकरण प्रदान किया जा सके।

Krzysztof Żurawicki, Julia Farganus, Arkadiusz Gaweł, Mateusz Bystroński, Tomasz Jan Kajdanowicz2026-05-29
🤖 AI

Harnessing non-adversarial robustness in large language models

यह शोध पत्र एक सैद्धांतिक और प्रयोगात्मक रूपरेखा प्रस्तावित करता है जो यह प्रदर्शित करता है कि "मजबूती के लिए पूर्वाग्रह हटाना" (debiasing for robustness), जो प्रॉम्प्ट-प्रेरित पूर्वाग्रहों को लक्षित करने वाली एक सरल फाइन-ट्यूनिंग प्रक्रिया है, बिना महंगे पूर्ण-मॉडल पुनरप्रशिक्षण की आवश्यकता के, अर्थपूर्ण रूप से समान लेकिन शाब्दिक रूप से भिन्न प्रॉम्प्ट्स के प्रति बड़े भाषा मॉडलों की मजबूती को कुशलतापूर्वक बढ़ा सकता है।

Qinghua Zhou, Ellina Aleshina, Andrey Lovyagin, Oleg Somov, Mikhail Seleznyov, Alexander Panchenko, Ivan Oseledets, Elen (…)2026-05-29
🤖 AI

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

यह शोध पत्र OmniMatBench प्रस्तुत करता है, जो 19 पदार्थ विज्ञान उपक्षेत्रों में 3,171 विशेषज्ञ-क्यूरेटेड समस्याओं वाला एक मानव-कैलिब्रेटेड मल्टीमॉडल बेंचमार्क है, जो वर्तमान मल्टीमॉडल लैंग्वेज मॉडल्स में महत्वपूर्ण तर्क संबंधी सीमाओं को प्रकट करता है और वैज्ञानिक अनुसंधान में विश्वसनीय एआई सहायकों को विकसित करने के लिए एक आधार स्थापित करता है।

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen (…)2026-05-29
📊 statistics

CB-SLICE: Concept-Based Interpretable Error Slice Discovery

यह शोधपत्र CB-SLICE को पेश करता है, जो एक अवधारणा-आधारित (concept-based) त्रुटि स्लाइस खोज विधि है जो साझा अवधारणा-गलत-अनुमानों (shared concept mispredictions) वाले नमूनों को समूहित करके व्यवस्थित मॉडल विफलताओं की पहचान करने के लिए कॉन्सेप्ट बॉटलनेक मॉडल्स का लाभ उठाती है, जिससे मौजूदा दृष्टिकोणों की तुलना में अधिक निष्ठावान और व्याख्या योग्य स्पष्टीकरण प्राप्त होते हैं।

Yael Konforti, Mateo Espinosa Zarlenga, Elaf Almahmoud, Mateja Jamnik2026-05-29
🤖 machine learning

HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

HARP एक सीखने योग्य, संरचित दो-तरफा ऑर्थोगोनल प्रोसेसर पेश करता है जो विशिष्ट परतों और कैलिब्रेशन डेटा के अनुकूल क्वांटाइजेशन आधार को अनुकूलित करता है, जो फिक्स्ड हैडामार्ड विधियों की तुलना में अत्यधिक कम-बिट (2-4 बिट) LLM क्वांटाइजेशन की सटीकता में महत्वपूर्ण सुधार करता है और साथ ही परिनियोजन दक्षता को बनाए रखता है।

Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov2026-05-29
🤖 machine learning

ESPO: Early-Stopping Proximal Policy Optimization

यह शोध पत्र ESPO (अर्ली-स्टॉपिंग प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन) का प्रस्ताव करता है, जो एक सुदृढीकरण लर्निंग (रीइन्फोर्समेंट लर्निंग) एल्गोरिदम है जो शोर को समाप्त करने और कंप्यूट बचाने के लिए विफल होने वाले रीजनिंग ट्रेजेक्टरीज को गतिशील रूप से समाप्त करता है, जिससे AIME और MATH-500 जैसे बेंचमार्क पर गणितीय तर्क प्रदर्शन में सुधार होता है और टोकन उपयोग में 20% से अधिक की कमी आती है।

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jie (…)2026-05-29