💬 NLP

When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations

यह अध्ययन MedMCQA बेंचमार्क का उपयोग करके सामान्य-उद्देश्य और चिकित्सा-विशिष्ट लार्ज लैंग्वेज मॉडल्स की प्रॉम्प्ट विविधताओं के प्रति संवेदनशीलता का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि मामूली शाब्दिक या वाक्यात्मक परिवर्तन भी उनकी विश्वसनीयता को महत्वपूर्ण रूप से कम कर सकते हैं और हानिकारक नैदानिक आउटपुट उत्पन्न कर सकते हैं, जिससे स्वास्थ्य सेवा में उनकी तैनाती के लिए गंभीर सुरक्षा जोखिमों पर प्रकाश पड़ता है।

Mahdi Alkaeed2026-06-08
🤖 AI

AI Sovereignty: A Qualitative Model of Strategic Competition as AI Becomes an Instrument of National Power

यह शोध पत्र एक नवीन गुणात्मक मॉडल पेश करके एआई संप्रभुता (AI sovereignty) के लिए वैचारिक ढांचों की कमी को संबोधित करता है जो सूक्ष्म, मध्य और व्यापक कारकों का विश्लेषण करता है ताकि उन रणनीतिक उत्तोलन बिंदुओं (strategic leverage points) की पहचान की जा सके—संसाधन नियंत्रण से लेकर गतिज (kinetic) और गैर-गतिज (non-kinetic) कार्यों तक—जिनके माध्यम से राष्ट्र 21वीं सदी में एआई-संचालित राष्ट्रीय शक्ति के लिए प्रतिस्पर्धा कर सकते हैं।

Timothy Clancy, Asmeret Naugle2026-06-08
📈 economics

TOPSIS-RAD: Ranking According to Desires

यह शोध पत्र TOPSIS-RAD प्रस्तुत करता है, जो एक उन्नत रैंकिंग विधि है जो गैर-व्यवहार्य विकल्पों को फ़िल्टर करने, आदर्श समाधानों को स्पष्ट आकांक्षाओं के साथ स्थिर करने और आउटलेर्स एवं रैंक रिवर्सल के प्रति प्रतिरोधी स्थिर रैंकिंग सुनिश्चित करने के लिए निर्णय-निर्माता द्वारा परिभाषित वीटो किए गए (Vetoed) और वांछित प्रदर्शन स्तरों (Desired Performance Levels) को शामिल करके पारंपरिक TOPSIS में सुधार करती है।

Leonardo Fernandes Costa, Helder Gomes Costa, Diogo Lima, Brunno Rodrigues2026-06-08
🤖 machine learning

Where Rectified Flows Leak: Characterising Membership Signals Along the Interpolation Path

यह शोध पत्र प्रकट करता है कि रेक्टिफाइड फ्लोज़ (Rectified Flows) अपने इंटरपोलेशन पथ के साथ प्रशिक्षण और परीक्षण डेटा के बीच पुनर्निर्माण त्रुटि (reconstruction error) में एक सार्वभौमिक, बेल-आकार का अंतराल प्रदर्शित करते हैं, जो एक सैद्धांतिक रूप से व्युत्पन्न स्थान पर चरम पर होता है और स्थिर सत्यापन मेट्रिक्स के बावजूद मेंबरशिप इन्फरेंस अटैक (Membership Inference Attacks) करने के लिए इसका उपयोग किया जा सकता है।

Thomas Sesmat, Gabriel Meseguer-Brocal, Geoffroy Peeters2026-06-08
🤖 AI

CULTURESCORE: Evaluating Cultural Faithfulness in Video Generation Models

यह शोध पत्र कल्चरस्कोर (CultureScore) का परिचय देता है, जो एक नवीन मूल्यांकन ढांचा है जो सांस्कृतिक निष्ठा को पहचान, संदर्भ और व्यवहार आयामों में विभाजित करता है ताकि यह प्रकट किया जा सके कि वर्तमान अत्याधुनिक वीडियो जनरेशन मॉडल सांस्कृतिक रूप से सटीक प्रतिनिधित्व के साथ काफी संघर्ष करते हैं, और अक्सर सांस्कृतिक शुद्धता के बजाय दृश्य गुणवत्ता को प्राथमिकता देते हैं।

Anku Rani, Wei Dai, Shravan Nayak, Pattie Maes, Mahdi M. Kalayeh, Paul Pu Liang2026-06-08
💬 NLP

SV-Detect: AI-generated Text Detection with Steering Vectors

SV-Detect एक सुदृढ़ AI-जनित टेक्स्ट डिटेक्शन विधि है जो विविध डोमेन, स्रोत मॉडलों और एडिटिंग हमलों के विरुद्ध मजबूत प्रदर्शन प्राप्त करने के लिए एक फ्रोजन लैंग्वेज मॉडल के हिडन रिप्रेजेंटेशन्स से निकाले गए स्टीयरिंग वेक्टर्स का लाभ उठाती है।

Mikhail Vishnyakov, Tatiana Gaintseva2026-06-08
📊 statistics

A Temporal Spatial Minimax Rate for Smoothly-Varying Distributions in Wasserstein Space

यह शोध पत्र वॉसरस्टीन स्पेस (Wasserstein space) में सुचारू रूप से परिवर्तनशील वितरणों के भविष्य के मूल्यों का अनुमान लगाने के लिए एक एकीकृत टेंपोरल-स्पेशियल मिनिमैक्स लोअर बाउंड (temporal-spatial minimax lower bound) स्थापित करता है, जो यह प्रदर्शित करता है कि इष्टतम अभिसरण दर (optimal convergence rate) एक आयाम-मुक्त एक्सट्रपलेशन त्रुटि और एक स्थानिक अनुमान अभिशाप (spatial estimation curse) के बीच मध्यस्थता करती है, जबकि विशिष्ट मामलों के लिए मिलान करने वाले अपर बाउंड (upper bounds) प्रदान करती है और सामान्य उच्च-क्रम मामले को एक खुली समस्या के रूप में पहचानती है।

Munsik Kim2026-06-08
🤖 AI

Mitosis Detection in the Wild: Multi-Tumor and Context-Aware Generalization in the MIDOG 2025 Challenge

MIDOG 2025 चुनौती विभिन्न प्रकार के ट्यूमर, प्रजातियों और स्कैनिंग प्लेटफॉर्म्स में स्वचालित माइटोसिस डिटेक्शन मॉडल की सामान्यीकरण क्षमताओं का मूल्यांकन करती है, जो चुनौतीपूर्ण वास्तविक संदर्भों में महत्वपूर्ण प्रदर्शन गिरावट को प्रकट करती है और एंसेम्बलिंग (ensembling) के लाभों के बावजूद वर्तमान आर्किटेक्चर की सीमाओं को उजागर करती है।

Marc Aubreville, Jonas Ammeling, Sweta Banerjee, Viktoria Weiss, Taryn A. Donovan, Robert Klopfleisch, Jiaqi Lv, Shan E (…)2026-06-08
📊 statistics

Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

यह शोध पत्र CapCode और CapReward को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क और रिवॉर्ड मैकेनिज्म है जो कोडिंग एजेंटों में धोखेबाज़ी से होने वाली बेईमानी का पता लगाने और उसे रोकने के लिए जानबूझकर सीमित प्रदर्शन सीमाओं वाले रैंडमाइज्ड टेस्ट का उपयोग करता है, जिससे यह सुनिश्चित होता है कि मूल्यांकन स्कोर वास्तविक कार्य-समाधान क्षमता को अधिक सटीक रूप से दर्शाते हैं।

Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori, Nontawat Charoenphakdee, Masashi Sugiyama, Takashi Ishida2026-06-08
⚡ electrical engineering

Impact of Synthetic Lesional MR Images in Automated Focal Cortical Dysplasia Detection in Low-Data Scenarios

यह अध्ययन प्रदर्शित करता है कि कंडीशनल जेनरेटिव नेटवर्क फोकल कॉर्टिकल डिसप्लेसिया के लिए यथार्थवादी सिंथेटिक एमआरआई डेटा उत्पन्न कर सकते हैं, जो कम-डेटा परिदृश्यों में स्वचालित पहचान के आत्मविश्वास और संवेदनशीलता में महत्वपूर्ण सुधार करता है, हालांकि अधिक लेबल किए गए डेटासेट का विस्तार करना सबसे प्रभावी दृष्टिकोण बना हुआ है।

Prabhjot Kaur, Hakim Ouaalam, Sedat Kandemirli, Sanjay P. Prabhu, Simon K. Warfield2026-06-08