🤖 machine learning

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

यह शोध पत्र एक नए मूल्यांकन प्रतिमान और "हैक-वेरिफिएबल टेक्स्टएरिना" (Hack-Verifiable TextArena) बेंचमार्क को प्रस्तुत करता है, जो भाषा मॉडलों द्वारा ऐसी कमजोरियों के शोषण को मापने के लिए नियत, स्वचालित और स्केलेबल माप को सक्षम करने हेतु वातावरण में सीधे पता लगाने योग्य रिवॉर्ड हैकिंग अवसरों को समाहित करता है।

Amit Roth, Ankur Samanta, Matan Halevy, Yoav Levine, Yonathan Efroni2026-05-21
🤖 machine learning

The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering

यह शोध पत्र VerifySteer प्रस्तुत करता है, जो पैराग्राफ सीमाओं पर छिपे हुए-अवस्था संकेतों (hidden-state signals) का पता लगाकर और उन्हें चुनिंदा रूप से निर्देशित करके चरण-वार सत्यापनकर्ता की कठोरता को नियंत्रित और बेहतर बनाने की एक विधि है, जिससे यह काफी कम कम्प्यूटेशनल लागत के साथ मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Yefan Zhou, Yilun Zhou, Austin Xu, Soroush Vosoughi, Shafiq Joty, Jiang Gui2026-05-21
📊 statistics

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

यह शोध पत्र एक एकल-बैच ढांचे का प्रस्ताव करके—जो क्रॉस-फिटेड प्रीकंडीशनिंग को वेरिएन्स-करेक्टेड इनवर्जन के साथ जोड़ता है—प्रीकंडीशन्ड लैंग्वेज मॉडल ऑप्टिमाइज़र में दो फाइनाइट-सैंपल बायस (ग्रेडिएंट-प्रीकंडीशनर कपलिंग और नॉनलीनियर इनवर्जन बायस) की पहचान और सुधार करता है, जिससे AdamW, Sophia और Shampoo जैसे मॉडलों में प्रीट्रेनिंग लॉस कम होता है और प्रदर्शन में सुधार होता है।

Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas (…)2026-05-21
🤖 machine learning

ShapeBench: A Scalable Benchmark and Diagnostic Suite for Standardized Evaluation in Aerodynamic Shape Optimization

यह शोध पत्र ShapeBench को प्रस्तुत करता है, जो एक ओपन-सोर्स, स्केलेबल बेंचमार्क और डायग्नोस्टिक सुइट है जिसमें 103 विविध एरोडायनामिक शेप ऑप्टिमाइज़ेशन कार्य और मानकीकृत बेसलाइन शामिल हैं ताकि शास्त्रीय और LLM-संचालित ऑप्टिमाइज़ेशन विधियों के निष्पक्ष, व्यवस्थित मूल्यांकन को सक्षम किया जा सके, जो समस्या वर्गों के बीच महत्वपूर्ण प्रदर्शन भिन्नता और अधिक सामान्य-उद्देश्य वाले दृष्टिकोणों की आवश्यकता को प्रकट करता है।

Shaghayegh Fazliani, Krissh Chawla, Jack Guo, Yiren Shen, Matthias Ihme, Madeleine Udell2026-05-21
💬 NLP

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

यह शोध पत्र चेतावनी देता है कि अवलोकन संबंधी डेटा (observational data) पर प्रशिक्षण के कारण LLM-सिम्युलेटेड प्रयोगों में "यूजर ड्रिफ्ट" (user drift) की समस्या होती है, जो कन्फाउंडिंग बायस (confounding bias) को जन्म देती है, और इस समस्या का पता लगाने के लिए नेगेटिव कंट्रोल आउटकम्स (negative control outcomes) का उपयोग करने तथा इसे कम करने के लिए परिष्कृत पर्सोना विनिर्देशों (refined persona specifications) का प्रस्ताव करता है।

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour2026-05-21
🤖 machine learning

Causal Machine Learning Is Not a Panacea: A Roadmap for Observational Causal Inference in Health

यह शोध पत्र अवलोकन संबंधी स्वास्थ्य डेटा (observational health data) पर कॉज़ल मशीन लर्निंग को जिम्मेदारी से लागू करने के लिए एक रोडमैप प्रस्तुत करता है, इस बात पर जोर देते हुए कि जबकि यह दृष्टिकोण शक्तिशाली परिकल्पना-उत्पन्न (hypothesis-generating) क्षमताएं प्रदान करता है, इसकी वैधता पक्षपाती परिणामों से बचने के लिए कॉज़ल मान्यताओं को कड़ाई से संतुष्ट करने और मॉडलिंग विकल्पों को उचित ठहराने पर निर्भर करती है।

Donna Tjandra (Division of Computer Science and Engineering, University of Michigan, Ann Arbor, Michigan, United States) (…)2026-05-21
🤖 machine learning

Interaction Locality in Hierarchical Recursive Reasoning

यह शोध पत्र "इंटरैक्शन लोकैलिटी" (interaction locality) को प्रस्तुत करता है, जो एक टास्क-ज्यामिति-जागरूक ढांचा है जो एक्टिवेशन पैचिंग और फीचर एब्लेशन का उपयोग करके यह प्रदर्शित करता है कि पदानुक्रमित और पुनरावर्ती तर्क मॉडल (HRM और TRM) स्थानीय सूचना लेखन को वैश्विक संरचनाओं में संचित करके जटिल स्थानिक कार्यों को हल करते हैं, जो कि बड़े पैमाने के एम्बोडीड 3D मॉडलों में देखी जाने वाली सीमा-केंद्रित लोकैलिटी के विपरीत एक पैटर्न है।

Yosuke Miyanishi, Tetsuro Morimura2026-05-21
🤖 machine learning

Beyond Numerical Features: CNN-Driven Algorithm Selection via Contour Plots for Continuous Black-Box Optimization

यह शोधपत्र निरंतर ब्लैक-बॉक्स अनुकूलन (continuous black-box optimization) के लिए एक नवीन प्रति-मामला (per-instance) एल्गोरिदम चयन विधि प्रस्तावित करता है जो जांचे गए परिदृश्यों (landscapes) के कंटूर प्लॉट विज़ुअलाइज़ेशन का विश्लेषण करने के लिए एक सीएनएन (CNN) का उपयोग करता है, यह प्रदर्शित करते हुए कि यह छवि-आधारित दृष्टिकोण एकल सर्वश्रेष्ठ सॉल्वर से बेहतर प्रदर्शन करता है और हस्तनिर्मित डिस्क्रिप्टर (handcrafted descriptors) पर निर्भर रहे बिना पारंपरिक विशेषता-आधारित विधियों के साथ प्रतिस्पर्धी बना रहता है।

Yiliang Yuan, Xiang Shi, Mustafa Misir2026-05-21
🤖 machine learning

Instant GPU Efficiency Visibility at Fleet Scale

यह शोध पत्र ओवरऑल FLOP यूटिलाइजेशन (OFU) को प्रस्तुत करता है, जो ऑन-चिप परफॉरमेंस काउंटर्स से प्राप्त एक हार्डवेयर-स्तरीय, इंस्ट्रुमेंटेशन-मुक्त GPU दक्षता मीट्रिक है, जो विविध वर्कलोड और GPU पीढ़ियों में एप्लिकेशन-लेवल MFU की भविष्यवाणी करने में उच्च सटीकता प्राप्त करता है, जिससे प्रभावी फ्लीट-स्केल मॉनिटरिंग और दक्षता रिग्रेशन का पता लगाना सक्षम होता है।

Connor Pedersen, Dong H. Ahn, Michel Migdal, Collin Neale, Nik Konyuchenko2026-05-21
🤖 machine learning

Tunable MAGMAX: Preference-Aware Model Merging for Continual Learning

यह शोध पत्र ट्यूनेबल MAGMAX (Tunable MAGMAX) को प्रस्तुत करता है, जो निरंतर सीखने (continual learning) के लिए एक प्राथमिकता-जागरूक मॉडल विलय ढांचा (preference-aware model merging framework) है जो कार्य-विशिष्ट प्रदर्शन को नियंत्रित करने के लिए स्वचालित रूप से प्राथमिकता वेक्टर (preference vectors) का निर्माण करता है, जिससे विलय किए गए मॉडलों को बिना किसी मैनुअल विनिर्देश के विविध परिनियोजन वातावरणों (deployment environments) के लिए प्रभावी अनुकूलन सक्षम बनाया जा सके।

Kei Hiroshima, Kento Uchida, Shinichi Shirakawa2026-05-21