🔬 physics

AI CFD Scientist: Toward Open-Ended Computational Fluid Dynamics Discovery with Physics-Aware AI Agents

यह शोध पत्र AI CFD Scientist को प्रस्तुत करता है, जो एक ओपन-सोर्स फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स का लाभ उठाकर OpenFOAM पर कम्प्यूटेशनल फ्लूइड डायनेमिक्स सिमुलेशन को स्वायत्त रूप से निष्पादित, मान्य और परिष्कृत करता है, और सफलतापूर्वक एक स्पालार्ट-एलमाराम्स (Spalart-Allmaras) सुधार की खोज करता है जो त्रुटि को 7.89% तक कम करता है और उन साइलेंट विफलताओं का पता लगाता है जिन्हें पारंपरिक सॉल्वर चेक मिस कर देते हैं।

Nithin Somasekharan, Rabi Pathak, Manushri Dhanakoti, Tingwen Zhang, Ling Yue, Andy Zhu, Shaowu Pan2026-05-08
💬 NLP

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO एक नवीन ढांचा है जो स्थानीय एजेंट उद्देश्यों को वैश्विक प्रणाली लक्ष्यों के साथ संरेखित करने के लिए एक संयुक्त मूल्यांकन तंत्र और विकासवादी बीम सर्च का उपयोग करके LLM-आधारित मल्टी-एजेंट सिस्टम के लिए प्रॉम्प्ट्स को स्वचालित रूप से अनुकूलित करता है, जिससे यह विविध सहयोगात्मक कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang2026-05-08
💬 NLP

Recursive Agent Optimization

यह शोध पत्र रिकर्सिव एजेंट ऑप्टिमाइज़ेशन (RAO) को पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एजेंटों को उप-कार्यों को स्वयं को पुनरावर्ती रूप से सौंपने के लिए प्रशिक्षित करता है, जिससे प्रशिक्षण दक्षता में सुधार होता है, संदर्भ सीमाओं से परे मापनीयता (scalability) सक्षम होती है, और विभाजित करो और जीतो (divide-and-conquer) की रणनीतियों के माध्यम से जटिल समस्याओं में सामान्यीकरण को बढ़ाता है।

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig2026-05-08
🤖 machine learning

Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models

यह शोध पत्र अवधारणा-आधारित एबडक्टिव (abductive) और कंट्रास्टिव (contrastive) स्पष्टीकरण उत्पन्न करने के लिए एक नवीन ढांचे का प्रस्ताव करता है जो व्यक्तिगत भविष्यवाणियों और विजन मॉडलों के सामान्य व्यवहारों को समझाने के लिए उच्च-स्तरीय, कारण संबंधी प्रासंगिक अवधारणाओं के न्यूनतम सेटों की पहचान करता है, जो प्रभावी रूप से मानव-समझने योग्य अवधारणा स्पष्टीकरणों और औपचारिक कारण तर्क के बीच के अंतर को पाटता है।

Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu, Ravi Mangal2026-05-08
🤖 machine learning

Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

यह शोधपत्र MMDG-Bench प्रस्तुत करता है, जो विविध कार्यों और सेटिंग्स में मूल्यांकन को मानकीकृत करने वाला एक व्यापक बेंचमार्क है ताकि यह प्रकट किया जा सके कि वर्तमान मल्टीमॉडल डोमेन जनरलाइजेशन (Multimodal Domain Generalization) विधियाँ बेसलाइन्स की तुलना में केवल मामूली सुधार प्रदान करती हैं, उनमें निरंतर श्रेष्ठता का अभाव है, और वे इनपुट करप्शन (input corruptions) तथा लुप्त मोडैलिटीज (missing modalities) जैसी वास्तविक दुनिया की चुनौतियों के साथ महत्वपूर्ण रूप से संघर्ष करती हैं।

Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink2026-05-08
🤖 machine learning

Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval

यह शोध पत्र SIRA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) रिट्रीवल एजेंट है जो LLM संज्ञानात्मक क्षमता और कॉर्पस सांख्यिकी का लाभ उठाकर बहु-चरणीय अन्वेषणात्मक खोज को एक एकल, अत्यधिक प्रभावी लेक्सिकल रिट्रीवल एक्शन में संकुचित करता है, जो विविध बेंचमार्क में डेंस रिट्रीवर्स और अत्याधुनिक बहु-चरणीय एजेंटिक बेसलाइन दोनों से काफी बेहतर प्रदर्शन करता है।

Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava2026-05-08
💬 NLP

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

यह शोध पत्र ग्राउंड-ट्रुथ बेंचमार्क की अनुपस्थिति में नियंत्रित कंट्रास्ट और स्थिरता मेट्रिक्स पर आधारित एक इंस्ट्रुमेंटल-वैलिडिटी चेन स्थापित करके तुलनात्मक एलएलएम (LLM) सुरक्षा स्कोर को मान्य करने के लिए एक ढांचे का परिचय देता है, जो 'सिंपल ऑडिट' (SimpleAudit) टूल के माध्यम से यह प्रदर्शित करता है कि सुरक्षा रैंकिंग संदर्भ-निर्भर होती है और उन्हें एक एकल संकुचित स्कोर के बजाय उनकी विशिष्ट ऑडिट स्थितियों के साथ रिपोर्ट किया जाना चाहिए।

Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stord (…)2026-05-08
🔢 mathematics

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

यह लेख "ऑप्टिमाइज़र-मॉडल कंसिस्टेंसी" (Optimizer-Model Consistency) की अवधारणा को प्रस्तुत करता है और यह प्रदर्शित करता है कि प्री-ट्रेनिंग और फुल फाइन-ट्यूनिंग दोनों के लिए एक ही ऑप्टिमाइज़र का उपयोग करने से अन्य ऑप्टिमाइज़र्स या LoRA की तुलना में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) कम होती है और लर्निंग-फॉरगेटिंग ट्रेड-ऑफ में सुधार होता है, साथ ही यह भी दिखाता है कि Muon जैसे कुछ ऑप्टिमाइज़र्स रटंत विद्या (rote memorization) की प्रवृत्ति के कारण रीजनिंग कार्यों पर खराब प्रदर्शन कर सकते हैं।

Yuxing Liu, Jianyu Wang, Tong Zhang2026-05-08
💬 NLP

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

यह शोध पत्र VHG को प्रस्तुत करता है, जो एक सत्यापनकर्ता-समर्थित ढांचा है जो वैध, चुनौतीपूर्ण और नवीन गणितीय समस्याओं को उत्पन्न करने के लिए सेटर (setter), सॉल्वर (solver) और एक स्वतंत्र सत्यापनकर्ता (independent verifier) को शामिल करने वाले तीन-पक्षीय सेल्फ-प्ले तंत्र का उपयोग करता है, जो उन मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है जो अमान्यता या रिवॉर्ड हैकिंग (reward hacking) से ग्रस्त हैं।

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao2026-05-08
🤖 AI

Quantifying Harm

यह शोध पत्र अनिश्चितता के तहत व्यक्तिगत और सामाजिक हानि को मापने के लिए एक मात्रात्मक ढांचे को विकसित करके हानि की एक पिछली गुणात्मक परिभाषा का विस्तार करता है, यह प्रदर्शित करते हुए कि सरल एकत्रीकरण विधियाँ प्रतिसहज परिणाम दे सकती हैं और निर्णय-सैद्धांतिक विकल्पों का प्रस्ताव करता है, विशेष रूप से प्रिसिजन मेडिसिन (precision medicine) के संदर्भ में।

Sander Beckers, Hana Chockler, Joseph Y. Halpern2026-05-07