💬 NLP

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-bench जैसे मौजूदा बेंचमार्क में गंभीर डेटा संदूषण (data contamination) और अपर्याप्त टेस्ट केसों को संबोधित करने के लिए, यह शोध पत्र SWE-MERA पेश करता है, जो एक गतिशील और निरंतर अपडेट होने वाला बेंचमार्क है जो वास्तविक दुनिया के GitHub इश्यूज़ को क्यूरेट करने के लिए एक स्वचालित पाइपलाइन का लाभ उठाता है, जिससे सॉफ्टवेयर इंजीनियरिंग कार्यों पर लार्ज लैंग्वेज मॉडल्स के लिए एक कठोर और विश्वसनीय मूल्यांकन ढांचा प्रदान किया जा सके।

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Feno (…)2026-07-14
🤖 AI

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

यह शोध पत्र CUDA-L1 प्रस्तुत करता है, जो एक कंट्रास्टिव रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो शुरू में कम प्रदर्शन करने वाले LLM को एक अत्यधिक प्रभावी स्वचालित CUDA ऑप्टिमाइज़र में बदल देता है, जिससे बिना किसी मानवीय विशेषज्ञता की आवश्यकता के विविध बेंचमार्क और GPU आर्किटेक्चर में महत्वपूर्ण गति (speedups) प्राप्त होती है।

Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum2026-07-14
🤖 AI

OptiGradTrust: Byzantine-Robust Federated Learning with Multi-Feature Gradient Analysis and Reinforcement Learning-Based Trust Weighting

ऑप्टिग्रेडट्रस्ट (OptiGradTrust) एक नवीन बायज़ेंटाइन-रोबस्ट (Byzantine-robust) फेडरेटेड लर्निंग फ्रेमवर्क है जो विविध हमले के परिदृश्यों के तहत विषम चिकित्सा डेटा वातावरण में बेहतर सटीकता और अभिसरण प्राप्त करने के लिए सुदृढीकरण शिक्षण-आधारित ट्रस्ट वेटिंग (reinforcement learning-based trust weighting) और एक हाइब्रिड FedBN-Prox तंत्र के साथ छह-आयामी ग्रेडिएंट फिंगरप्रिंट को एकीकृत करता है।

Mohammad Karami, Fatemeh Ghassemi, Hamed Kebriaei, Hamid Azadegan2026-07-14
💬 NLP

CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search

यह शोध पत्र CRINN प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जो सटीकता बनाए रखते हुए निष्पादन गति (execution speed) के लिए अनुकूलित करके उच्च-प्रदर्शन वाले अनुमानित निकटतम पड़ोसी खोज (approximate nearest neighbor search) एल्गोरिदम को स्वचालित रूप से उत्पन्न करने के लिए कंट्रास्टिव रीइन्फोर्समेंट लर्निंग का लाभ उठाता है, जो कई बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करता है और जटिल एल्गोरिद्मिक अनुकूलन के लिए LLMs की क्षमता को प्रदर्शित करता है।

Xiaoya Li, Albert Wang, Guoyin Wang, Chris Shum, Jiwei Li2026-07-14
🧬 biology

People use fast and flat simulation to reason about new games

बड़े पैमाने पर व्यवहार संबंधी अध्ययनों और एक कम्प्यूटेशनल "इंट्यूटिव गेमर" (सहज गेमर) मॉडल के माध्यम से, यह शोध पत्र प्रदर्शित करता है कि मनुष्य तेज़, सीमित-गहराई वाले संभाव्य सिमुलेशन का उपयोग करके नए खेलों के बारे में व्यवस्थित और अनुकूल रूप से तर्क करते हैं, जो अधिक लचीली, मानव-समान एआई प्रणालियों को विकसित करने के लिए अंतर्दृष्टि प्रदान करता है।

Katherine M. Collins, Cedegao E. Zhang, Lionel Wong, Mauricio Barba da Costa, Graham Todd, Adrian Weller, Samuel J. Chey (…)2026-07-14
⚡ electrical engineering

Adaptive Digital Twin of Sheet Metal Forming via Proper Orthogonal Decomposition-Based Koopman Operator with Model Predictive Control

यह शोध पत्र रोबोटिक शीट मेटल फॉर्मिंग के लिए एक अनुकूली डिजिटल ट्विन फ्रेमवर्क प्रस्तुत करता है जो जटिल, गैर-रेखीय विरूपण प्रक्रियाओं के वास्तविक समय, डेटा-संचालित मॉडल प्रेडिक्टिव कंट्रोल को सक्षम करने के लिए प्रॉपर ऑर्थोगोनल डिकंपोजिशन, कूपमैन ऑपरेटर और ऑनलाइन रिकर्सिव लीस्ट स्क्वायर्स को एकीकृत करता है।

Yi-Ping Chen, Derick Suarez, Ying-Kuan Tsai, Vispi Karkaria, Guanzhong Hu, Zihan Chen, Ping Guo, Jian Cao, Wei Chen2026-07-14
🤖 AI

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

यह शोध पत्र मिनी एम्यूजमेंट पार्क्स (MAPs) को प्रस्तुत करता है, जो एक नवीन एम्यूजमेंट-पार्क सिम्युलेटर है जिसे जटिल, वास्तविक दुनिया के व्यावसायिक निर्णय लेने वाले कार्यों पर AI एजेंटों को समग्र रूप से बेंचमार्क करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक LLMs लॉन्ग-होरिज़न ऑप्टिमाइज़ेशन, सैंपल-एफिशिएंट लर्निंग, स्थानिक तर्क और वर्ल्ड मॉडलिंग में मानव बेसलाइन की तुलना में काफी कम प्रदर्शन करते हैं।

Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang (…)2026-07-14
🤖 machine learning

Enhancing Adversarial Transferability through Block Stretch and Shrink

यह शोध पत्र FRO का प्रस्ताव करता है, जो एक फ्रंटएंड रिस्पॉन्स-ओरिएंटेड इनपुट ट्रांसफॉर्मेशन विधि है जो एक इम्पलिसिट एन्सेम्बल परिप्रेक्ष्य के माध्यम से मॉडल फ्रंटएंड रिस्पॉन्स को समृद्ध करने के लिए ब्लॉक-वाइज स्ट्रेच-एंड-श्रिंक और पर्सपेक्टिव डीफॉर्मेशन ऑपरेटर्स का उपयोग करके एडवर्सरियल ट्रांसफरैबिलिटी को बढ़ाता है।

Quan Liu, Feng Ye, Chenhao Lu, Shuming Zhen, Guanliang Huang, Lunzhe Chen, Xudong Ke2026-07-14
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

यह शोध पत्र CUDA-L2 को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो हाफ-प्रिसिजन जनरल मैट्रिक्स मल्टीप्लाई (HGEMM) कर्नेल्स को स्वचालित रूप से अनुकूलित करने के लिए लार्ज लैंग्वेज मॉडल्स और रीइन्फोर्समेंट लर्निंग का लाभ उठाता है, जिससे torch.matmul, cuBLAS और cuBLASLt जैसे स्थापित बेसलाइन्स की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है, क्योंकि यह उन पैमानों पर कॉन्फ़िगरेशन स्पेस का व्यवस्थित रूप से अन्वेषण करता है जो मानव इंजीनियरों के लिए अव्यवहारिक हैं।

Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum2026-07-14
⚛️ quantum physics

Graph-Based Bayesian Optimization for Quantum Circuit Architecture Search with Uncertainty Calibrated Surrogates

यह शोध पत्र साइबर सुरक्षा वर्गीकरण कार्यों के लिए कुशल और सुदृढ़ वेरिएशनल क्वांटम सर्किट को स्वचालित रूप से खोजने हेतु अनिश्चितता अंशांकन (अनसर्टेन्टी कैलिब्रेशन) के लिए मोंटे कार्लो ड्रॉपआउट के साथ एक GNN सरोगेट का उपयोग करने वाले एक ग्राफ-आधारित बेयसियन ऑप्टिमाइज़ेशन फ्रेमवर्क प्रस्तुत करता है।

Prashant Kumar Choudhary, Nouhaila Innan, Muhammad Shafique, Rajeev Singh2026-07-14