🤖 AI

RDEx-CASK: Cauchy Mutation, Archive, and Stagnation Kick for RDEx-CSOP

यह शोध पत्र RDEx-CASK प्रस्तुत करता है, जो RDEx-CSOP एल्गोरिदम का एक उन्नत संस्करण है जो CEC बाधित अनुकूलन समस्याओं पर व्यवहार्यता-जागरूक गुणवत्ता और समय-से-लक्ष्य प्रदर्शन में सुधार करने के लिए एक ट्रंकेटेड कॉची म्यूटेशन (truncated Cauchy mutation), एक केवल-व्यवहार्य JADE-शैली आर्काइव और एक स्टैग्नेशन-ट्रिगर स्थानीय ओवरराइड तंत्र को एकीकृत करता है।

Dikshant, Dikshit Chauhan, Chen Hao, Anupam Trivedi, Harikumar Kandath, Senthilnath Jayavelu2026-05-12
🤖 AI

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

यह शोधपत्र MedMeta को प्रस्तुत करता है, जो अध्ययन सारांशों से चिकित्सा मेटा-विश्लेषण निष्कर्षों को संश्लेषित करने की LLMs की क्षमता का मूल्यांकन करने वाला एक नया बेंचमार्क है, जो यह प्रकट करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन (retrieval-augmented generation) पैरामीट्रिक-ओनली (parametric-only) दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है और साथ ही नकारात्मक साक्ष्यों (negated evidence) को संभालने में महत्वपूर्ण कमजोरियों और इस कार्य के लिए डोमेन-विशिष्ट फाइन-ट्यूनिंग के सीमित मूल्य को भी उजागर करता है।

Huy Hoang Ha, Benoit Favre, Francois Portet2026-05-12
🤖 AI

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

यह शोध पत्र "एब्सर्ड वर्ल्ड" (Absurd World) का परिचय देता है, जो एक बेंचमार्किंग फ्रेमवर्क है जो वास्तविक दुनिया के परिदृश्यों को व्यवस्थित रूप से तार्किक रूप से सुसंगत लेकिन विचित्र (absurd) संदर्भों में परिवर्तित करता है ताकि यह मूल्यांकन किया जा सके कि क्या लार्ज लैंग्वेज मॉडल्स के पास याद किए गए वास्तविक दुनिया के पैटर्न से स्वतंत्र मजबूत तार्किक तर्क क्षमताएं मौजूद हैं।

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu2026-05-12
🤖 AI

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

यह शोध पत्र DeepTumorVQA को प्रस्तुत करता है, जो एक पदानुक्रमित (hierarchical) 3D CT बेंचमार्क है जो मेडिकल विजन-लैंग्वेज मॉडल्स और टूल-ऑगमेंटेड एजेंट्स का मूल्यांकन करने के लिए ट्यूमर निदान को चार प्रगतिशील चरणों में विभाजित करता है, जिससे यह पता चलता है कि मात्रात्मक मापन (quantitative measurement) एक प्राथमिक बाधा है जिसे टूल एकीकरण और चरण-दर-चरण पर्यवेक्षण के माध्यम से कम किया जा सकता है।

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zon (…)2026-05-12
🤖 AI

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

यह शोधपत्र MonitoringBench को प्रस्तुत करता है, जो एक अर्ध-स्वचालित रेड-टीमिंग बेंचमार्क है जिसमें 2,644 विविध हमले के प्रक्षेपवक्र (attack trajectories) शामिल हैं जो वर्तमान AI एजेंट मॉनिटर्स की महत्वपूर्ण कमजोरियों को उजागर करते हैं, जिससे यह पता चलता है कि मौजूदा मूल्यांकन विधियाँ परिष्कृत प्रलोभन हमलों (persuasion attacks) का पता लगाने में विफल रहकर और संदिग्धता स्कोर को गलत तरीके से कैलिब्रेट करके अक्सर प्रदर्शन का अतिरंजित आकलन करती हैं।

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy2026-05-12
🤖 AI

Unpredictability dissociates from structured control in language agents

यह शोधपत्र यह प्रदर्शित करता है कि भाषा एजेंटों (language agents) में, स्टोकेस्टिक अनिश्चितता (stochastic unpredictability), कारणों, स्मृति और स्व-अवस्था (self-state) को क्रिया चयन के साथ जोड़ने वाले संरचित नियंत्रण तंत्रों का विकल्प नहीं हो सकती, क्योंकि इन संरचित घटकों को लक्षित रूप से हटाने (targeted lesions) से प्रदर्शन में निरंतर गिरावट आती है, जबकि उच्च-स्टोकेस्टिसिटी वाले संस्करण व्यापक बेंचमार्क पर संरचित क्रिया-क्षेत्र युग्मन (structured action-field coupling) को दोहराने में विफल रहते हैं।

Jia Xiao2026-05-12
🤖 AI

Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents

यह शोधपत्र Ambig-DS प्रस्तुत करता है, जो दो नैदानिक सूट्स (diagnostic suites) से युक्त एक बेंचमार्क है जो यह प्रकट करता है कि डेटा-साइंस एजेंट अस्पष्टता का सामना करने पर अनचाहे कार्य फ्रेमिंग (task framings) को स्वीकार करके चुपचाप कैसे विफल हो जाते हैं, और यह रेखांकित करता है कि वर्तमान मूल्यांकनों में पाइपलाइन निष्पादन सुनिश्चित करने के बजाय अपर्याप्त विवरण (underspecification) को पहचानना ही महत्वपूर्ण बाधा है।

Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen, Kaspar Märtens, Robert Kitchen2026-05-12
🤖 AI

Medical Model Synthesis Architectures: A Case Study

यह शोध पत्र MedMSA का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो ज्ञान प्राप्ति के लिए भाषा मॉडलों को औपचारिक संभाव्यता मॉडलिंग (formal probabilistic modeling) के साथ जोड़ता है ताकि पारदर्शी, कैलिब्रेटेड और अनिश्चितता-भारित (uncertainty-weighted) नैदानिक भविष्यवाणियां, जैसे कि विभेदक निदान (differential diagnoses), उत्पन्न की जा सकें, जिससे वर्तमान चिकित्सा एआई प्रणालियों की अपारदर्शिता और तर्क संबंधी सीमाओं को दूर किया जा सके।

Katherine M. Collins, Marlene Berke, Ilia Sucholutsky, Ayman Ali, Adrian Weller, Timothy J. O'Donnell, Tyler Brooke-Wils (…)2026-05-12
🤖 AI

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

यह शोध पत्र एक नॉलेज डिस्टिलेशन फ्रेमवर्क पेश करता है जो VGGT और एक नवीन "हिडन CoT" लेटेंट स्क्रैचपैड तंत्र का उपयोग करके एक बड़े टीचर मॉडल से एक हल्के स्टूडेंट मॉडल में 3D स्थानिक तर्क (spatial reasoning) को स्थानांतरित करता है, जिससे 3D दृश्य समझ के कार्यों पर मजबूत प्रदर्शन बनाए रखते हुए मॉडल के आकार और इन्फरेंस लेटेंसी में महत्वपूर्ण कमी आती है।

Alaa Asfour, Christopher Indris, Leihan Chen, Tejas Vyas, Guanghui Wang2026-05-12
🤖 machine learning

One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning

यह शोध पत्र प्रस्तावित करता है कि नॉन-लीनियर ट्रांसफॉर्मर्स, एक साझा रिप्रोड्यूसिंग कर्नेल हिल्बर्ट स्पेस के भीतर विविध वैल्यू फंक्शन्स को दर्शाने वाले कर्नेल-आधारित टेम्पोरल डिफरेंस लर्नर्स के रूप में कार्य करके, इन-कॉन्टेक्स्ट रीइन्फोर्समेंट लर्निंग में क्रॉस-डोमेन जनरलाइजेशन प्राप्त कर सकते हैं।

Bowen He, Juncheng Dong, Lin Lin, Xiang Cheng2026-05-12