🤖 AI

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

यह शोध पत्र एक क्यूरेटेड बहुभाषी बेंचमार्क प्रस्तुत करता है और एक ऐसा अध्ययन प्रदर्शित करता है जो यह दर्शाता है कि प्रॉम्प्ट में उपयोग की जाने वाली भाषा एलएलएम (LLMs) द्वारा जनरेट किए गए कोड की कार्यात्मक शुद्धता, संरचनात्मक गुणवत्ता और शाब्दिक विशेषताओं को महत्वपूर्ण रूप से प्रभावित करती है, जिससे यह पता चलता है कि अंग्रेजी प्रॉम्प्ट लगातार सर्वोत्तम परिणाम नहीं देते हैं और इसका प्रभाव विभिन्न मॉडलों और प्रोग्रामिंग भाषाओं में भिन्न होता है।

Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di (…)2026-07-17
🤖 machine learning

Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning

यह शोध पत्र पारंपरिक प्रॉक्सी कार्यों के बजाय पछतावा न्यूनीकरण (regret minimization) पर आधारित एपिस्टेमिक अनिश्चितता का मूल्यांकन करने के लिए एक निर्णय-सैद्धांतिक ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि मानक सहसंबंध मेट्रिक्स परिचालन उपयोगिता की भविष्यवाणी करने में विफल रहते हैं और निर्णय-सैद्धांतिक एवं प्रॉक्सी-कार्य रैंकिंग के बीच महत्वपूर्ण विसंगतियों को प्रकट करता है।

Jakub Paplhám, Willem Waegeman, Eyke Hüllermeier, Vojtěch Franc2026-07-17
🤖 AI

Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience

यह शोध पत्र CoreForge पर रिपोर्ट करता है, जो एक ऐसा प्रयोग है जो यह प्रदर्शित करता है कि बड़े भाषा मॉडल (large language models) एक पुनरावृत्ति कार्यप्रवाह (iterative workflow) के माध्यम से सीधे शोध पत्रों से एक कार्यात्मक अनवेटेड मैक्ससैट (unweighted MaxSAT) सॉल्वर बनाने में सफलतापूर्वक सहायता कर सकते हैं, हालांकि परिणामी प्रणाली को अभी भी मानव मार्गदर्शन और सत्यापन की आवश्यकता होती है और प्रदर्शन के मामले में हाथ से निर्मित (hand-engineered) सॉल्वरों से पीछे है।

Ruben Martins2026-07-17
🤖 AI

Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery

यह शोध पत्र एक क्लोज्ड-लूप फ्रेमवर्क प्रस्तावित करता है जो जॉइंट प्रोबेबिलिटी ट्रीज़ को कॉज़ल सर्किट्स के साथ जोड़ता है ताकि विफल रोबोटिक क्रियाओं का कुशल, व्याख्या योग्य और रिट्रेनिंग-मुक्त कॉज़ल डायग्नोसिस सक्षम किया जा सके, जिससे लक्षित पैरामीटर सुधार संभव हो पाते हैं जो उच्च-गुणवत्ता और डिग्रेडेड डिस्ट्रीब्यूशन दोनों परिदृश्यों में विफल प्रयासों को काफी कम कर देते हैं।

Naren Vasantakumaar, Tom Schierenbeck, Michael Beetz2026-07-17
🤖 AI

RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

RW-Voice-EQ बेंच एक बहुआयामी वास्तविक दुनिया का बेंचमार्क प्रस्तुत करता है जो TTS, STS, SU और ASR कार्यों के माध्यम से वॉयस एआई प्रणालियों का मूल्यांकन करता है ताकि यह प्रदर्शित किया जा सके कि प्रदर्शन अत्यधिक आयाम-विशिष्ट है और इसके लिए एकल समग्र स्कोर या टेक्स्ट-आधारित मेट्रिक्स पर निर्भर रहने के बजाय ध्वनिक, अभिव्यंजक, संवादात्मक और मजबूती संबंधी क्षमताओं का आकलन करने की आवश्यकता है।

David Ayllon, Alice Baird, Jeffrey Brooks, Franc Camps-Febrer, Jakub Piotr Cłapa, Theo Lebryk, Jens Madsen, Olya Ossipov (…)2026-07-17
💬 NLP

Does generative AI supersede supervised XMLC? A Benchmark Study on Automated Subject Indexing with German Scientific Literature

जर्मन वैज्ञानिक साहित्य के लिए स्वचालित विषय अनुक्रमण (सब्जेक्ट इंडेक्सिंग) पर इस बेंचमार्क अध्ययन में यह पाया गया है कि जहाँ पर्यवेक्षित ट्रांसफॉर्मर-आधारित XMLC विधियाँ समग्र बाइनरी प्रासंगिकता में उत्कृष्ट हैं, वहीं LLM-आधारित जनरेटिव दृष्टिकोण ग्रेडेड प्रासंगिकता और विषय शब्दावली की 'लॉन्ग टेल' को संभालने में उनसे बेहतर प्रदर्शन करते हैं, जो उन्हें भविष्य के उपयोग के लिए एक आशाजनक विकल्प के रूप में स्थापित करते हैं।

Maximilian Kähler, Katja Konermann, Lisa Kluge, Markus Schumacher2026-07-17
🤖 machine learning

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

यह शोध पत्र यह प्रदर्शित करता है कि संकीर्ण, तथ्यात्मक रूप से सुदृढ़ डेटासेट पर लार्ज लैंग्वेज मॉडल्स को फाइनट्यून करने से व्यापक "वैचारिक सामान्यीकरण" (ideological generalization) उत्पन्न हो सकता है, जिससे सामान्य क्षमताओं और सटीकता को बनाए रखते हुए असंबंधित क्षेत्रों (जैसे आपराधिक न्याय या स्वास्थ्य संबंधी विश्वासों) में महत्वपूर्ण और प्रवर्धित बदलाव आते हैं।

Robert Graham, Edward Stevinson, Yariv Barsheshat2026-07-17
🤖 machine learning

Random Logit Scaling: Defending Deep Neural Networks Against Black-Box Score-Based Adversarial Example Attacks

यह शोध पत्र रैंडम लॉजिट स्केलिंग (RLS) को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले पोस्ट-प्रोसेसिंग डिफेंस है जो मॉडल की सटीकता को बनाए रखते हुए हमलावरों को भ्रमित करने के लिए लॉजिट्स को यादृच्छिक रूप से स्केल करके ब्लैक-बॉक्स स्कोर-आधारित एडवरसैरियल हमलों का प्रभावी ढंग से मुकाबला करता है, और साथ ही एडेप्टिव हमलों के प्रति स्टेट-ऑफ-द-आर्ट AAA डिफेंस की भेद्यता को उजागर करता है।

Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh2026-07-17
🤖 AI

Benchmarking Face Recognition without Real Faces

यह शोध पत्र प्रदर्शित करता है कि सुव्यवस्थित सिंथेटिक डेटासेट, विशेष रूप से MorphFace और Vec2Face, चेहरे की पहचान करने वाले मॉडलों के मूल्यांकन के लिए वास्तविक-चेहरे के बेंचमार्क को प्रभावी ढंग से प्रतिस्थापित कर सकते हैं, जिससे प्रशिक्षण और मूल्यांकन दोनों के लिए एक पूर्णतः गोपनीयता-संरक्षित पाइपलाइन सक्षम होती है।

Paweł Borsukiewicz, Daniele Lunghi, Wendkûuni C. Ouédraogo, Jacques Klein, Tegawendé F. Bissyandé2026-07-17
🌀 nonlinear sciences

A Minimal Interpretable Architecture for Zero-Shot Reconstruction of Dynamical Systems

यह शोध पत्र DynaBase प्रस्तुत करता है, जो जटिल फाउंडेशन मॉडल्स से व्युत्पन्न एक न्यूनतम दो-पैरामीटर व्याख्या योग्य आर्किटेक्चर है, जो लेटेंट स्टेट्स और इन-कॉन्टेक्स्ट नेबर्स के एक सरल लीनियर ब्लेंड के माध्यम से प्रतिस्पर्धी ज़ीरो-शॉट डायनेमिकल सिस्टम रिकंस्ट्रक्शन प्राप्त करता है, जबकि विश्लेणात्मक समाधान प्रदान करता है और साहित्य में विविध निष्कर्षों को एकीकृत करता है।

Christoph Jürgen Hemmer, Florian Plaswig, Daniel Durstewitz2026-07-17