🤖 machine learning

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

यह शोध पत्र एक नए मूल्यांकन प्रतिमान और "हैक-वेरिफिएबल टेक्स्टएरिना" (Hack-Verifiable TextArena) बेंचमार्क को प्रस्तुत करता है, जो भाषा मॉडलों द्वारा ऐसी कमजोरियों के शोषण को मापने के लिए नियत, स्वचालित और स्केलेबल माप को सक्षम करने हेतु वातावरण में सीधे पता लगाने योग्य रिवॉर्ड हैकिंग अवसरों को समाहित करता है।

Amit Roth, Ankur Samanta, Matan Halevy, Yoav Levine, Yonathan Efroni2026-05-21
🤖 machine learning

The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering

यह शोध पत्र VerifySteer प्रस्तुत करता है, जो पैराग्राफ सीमाओं पर छिपे हुए-अवस्था संकेतों (hidden-state signals) का पता लगाकर और उन्हें चुनिंदा रूप से निर्देशित करके चरण-वार सत्यापनकर्ता की कठोरता को नियंत्रित और बेहतर बनाने की एक विधि है, जिससे यह काफी कम कम्प्यूटेशनल लागत के साथ मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Yefan Zhou, Yilun Zhou, Austin Xu, Soroush Vosoughi, Shafiq Joty, Jiang Gui2026-05-21
📊 statistics

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

यह शोध पत्र एक एकल-बैच ढांचे का प्रस्ताव करके—जो क्रॉस-फिटेड प्रीकंडीशनिंग को वेरिएन्स-करेक्टेड इनवर्जन के साथ जोड़ता है—प्रीकंडीशन्ड लैंग्वेज मॉडल ऑप्टिमाइज़र में दो फाइनाइट-सैंपल बायस (ग्रेडिएंट-प्रीकंडीशनर कपलिंग और नॉनलीनियर इनवर्जन बायस) की पहचान और सुधार करता है, जिससे AdamW, Sophia और Shampoo जैसे मॉडलों में प्रीट्रेनिंग लॉस कम होता है और प्रदर्शन में सुधार होता है।

Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas (…)2026-05-21
🤖 machine learning

Interaction Locality in Hierarchical Recursive Reasoning

यह शोध पत्र "इंटरैक्शन लोकैलिटी" (interaction locality) को प्रस्तुत करता है, जो एक टास्क-ज्यामिति-जागरूक ढांचा है जो एक्टिवेशन पैचिंग और फीचर एब्लेशन का उपयोग करके यह प्रदर्शित करता है कि पदानुक्रमित और पुनरावर्ती तर्क मॉडल (HRM और TRM) स्थानीय सूचना लेखन को वैश्विक संरचनाओं में संचित करके जटिल स्थानिक कार्यों को हल करते हैं, जो कि बड़े पैमाने के एम्बोडीड 3D मॉडलों में देखी जाने वाली सीमा-केंद्रित लोकैलिटी के विपरीत एक पैटर्न है।

Yosuke Miyanishi, Tetsuro Morimura2026-05-21
🤖 machine learning

Tunable MAGMAX: Preference-Aware Model Merging for Continual Learning

यह शोध पत्र ट्यूनेबल MAGMAX (Tunable MAGMAX) को प्रस्तुत करता है, जो निरंतर सीखने (continual learning) के लिए एक प्राथमिकता-जागरूक मॉडल विलय ढांचा (preference-aware model merging framework) है जो कार्य-विशिष्ट प्रदर्शन को नियंत्रित करने के लिए स्वचालित रूप से प्राथमिकता वेक्टर (preference vectors) का निर्माण करता है, जिससे विलय किए गए मॉडलों को बिना किसी मैनुअल विनिर्देश के विविध परिनियोजन वातावरणों (deployment environments) के लिए प्रभावी अनुकूलन सक्षम बनाया जा सके।

Kei Hiroshima, Kento Uchida, Shinichi Shirakawa2026-05-21
💻 computer science

USV: Towards Understanding the User-generated Short-form Videos

यह शोध पत्र USV प्रस्तुत करता है, जो 224K उपयोगकर्ता-जनित लघु-रूप वीडियो का एक बड़े पैमाने का डेटासेट है जिसे विषय पहचान और वीडियो-टेक्स्ट रिट्रीवल कार्यों की स्थापना के माध्यम से उच्च-स्तरीय सिमेंटिक वीडियो समझ को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जिसके साथ प्रस्तावित बेसलाइन मॉडल और व्यापक बेंचमार्क भी दिए गए हैं।

Haoyue Cheng, Su Xu, Liwei Jin, Wayne Wu, Chen Qian, Limin Wang2026-05-21
🤖 machine learning

DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

DISC फ्रेमवर्क एक हाइपरनेटवर्क का उपयोग करके निर्देशों से सीधे कार्य-विशिष्ट नीति पैरामीटर उत्पन्न करके भाषा-सशर्त हेरफेर (language-conditioned manipulation) में अवलोकन रिसाव (observation leakage) को समाप्त करता है, जिससे भाषा ग्राउंडिंग और विजुअल स्टेट प्रोसेसिंग को संरचनात्मक रूप से अलग किया जाता है और उलझे हुए बेसलाइन (entangled baselines) तथा बड़े पैमाने के प्रीट्रेन मॉडल्स की तुलना में बेहतर प्रदर्शन और सामान्यीकरण प्राप्त किया जाता है।

Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang2026-05-21
⚡ electrical engineering

Runtime-Certified Bounded-Error Quantized Attention

यह शोध पत्र एक टियर्ड (tiered) KV कैश आर्किटेक्चर प्रस्तुत करता है जो ऑनलाइन एरर बाउंड्स की गणना करके एडेप्टिव प्रिसिजन सिलेक्शन और डिटरमिनिस्टिक FP16 फॉलबैक को ट्रिगर करने के माध्यम से रनटाइम-सर्टिफाइड बाउंडेड-एरर क्वांटाइज्ड अटेंशन को सक्षम बनाता है, जिससे लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस के लिए उच्च संपीड़न बनाए रखते हुए सटीक डेंस अटेंशन आउटपुट में रिकवरी की गारंटी मिलती है।

Dean Calver2026-05-21✓ Author reviewed
🤖 machine learning

CAdam: Context-Adaptive Moment Estimation for 3D Gaussian Densification in Generative Distillation

यह शोध पत्र CAdam को प्रस्तुत करता है, जो एक संदर्भ-अनुकूली मोमेंट एस्टीमेशन फ्रेमवर्क (context-adaptive moment estimation framework) है जो ज्यामितीय संकेतों को स्टोकेस्टिक शोर से सांख्यिकीय रूप से अलग करके जनरेटिव 3D गॉसियन स्प्लेटिंग में "डेंसिफिकेशन डिलेमा" (Densification Dilemma) को हल करता है, जिससे दृश्य गुणवत्ता बनाए रखते हुए अनावश्यक प्रिमिटिव्स को 85%–97% तक कम किया जा सकता है।

SeungJeh Chung, Geonho Park, Misong Kim, HyeongYeop Kang2026-05-21
🤖 machine learning

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench एक नवीन ढांचा है जो एक संरचित वर्गीकरण और बाधा-संचालित संश्लेषण का उपयोग करके योजना निर्माण डेटा के सृजन को स्थिर संग्रहों से एक नियंत्रणीय, स्केलेबल उत्पादन प्रक्रिया में बदल देता है, जिससे वर्तमान LLM की सीमाओं के कठोर मूल्यांकन और सामान्यीकरण योग्य योजना क्षमताओं को बढ़ाने के लिए प्रभावी सुदृढीकरण शिक्षण (reinforcement learning) प्रशिक्षण दोनों को सक्षम बनाया जा सके।

Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou2026-05-21