🤖 AI

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

यह शोधपत्र D3-Gym को प्रस्तुत करता है, जो चार विषयों में 565 सत्यापन योग्य, वास्तविक दुनिया के वैज्ञानिक कार्यों वाला पहला स्वचालित रूप से निर्मित डेटासेट है, जो उच्च गुणवत्ता वाले प्रशिक्षण वातावरण और मूल्यांकन संकेत प्रदान करके डेटा-संचालित खोज में ओपन-सोर्स भाषा मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Ch (…)2026-05-01
🤖 AI

Exploring Interaction Paradigms for LLM Agents in Scientific Visualization

यह शोध पत्र वैज्ञानिक विज़ुअलाइज़ेशन में एलएलएम (LLM) एजेंटों के लिए तीन इंटरेक्शन प्रतिमानों का मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ सामान्य-उद्देश्य वाले कोडिंग एजेंट उच्चतम सफलता दर प्राप्त करते हैं, वहीं डोमेन-विशिष्ट एजेंट अधिक दक्षता और स्थिरता प्रदान करते हैं, और कंप्यूटर-उपयोग एजेंट दीर्घकालिक योजना बनाने में संघर्ष करते हैं, जो अंततः यह सुझाव देता है कि भविष्य के प्रणालियों को प्रदर्शन, मजबूती और लचीलेपन के बीच संतुलन बनाने के लिए संरचित उपकरणों, संवादात्मक क्षमताओं और अनुकूलन योग्य स्मृति को एकीकृत करना चाहिए।

Jackson Vonderhorst, Kuangshi Ai, Haichao Miao, Shusen Liu, Chaoli Wang2026-05-01
🤖 machine learning

Learning from Disagreement: Clinician Overrides as Implicit Preference Signals for Clinical AI in Value-Based Care

यह शोध पत्र एक औपचारिक ढांचे का प्रस्ताव करता है जो नैदानिक ओवरराइड (clinician overrides) को एआई अनुशंसाओं के प्रति निहित प्राथमिकता संकेतों के रूप में पुनर्गठित करता है, जिसमें एक दोहरी-शिक्षण वास्तुकला और ओवरराइड वर्गीकरण पेश किया गया है ताकि विविध नैदानिक क्षमताओं के कारण होने वाले दमन पूर्वाग्रह (suppression bias) को कम करते हुए वैल्यू-बेस्ड केयर में रोगी परिणामों के अनुरूप रिवॉर्ड मॉडल को प्रशिक्षित किया जा सके।

Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son2026-05-01
💬 NLP

Reliable Answers for Recurring Questions: Boosting Text-to-SQL Accuracy with Template Constrained Decoding

यह शोध पत्र TeCoD को प्रस्तुत करता है, जो पुनरावृत्ति होने वाले क्वेरी पैटर्न का लाभ उठाकर पुन: प्रयोज्य टेम्पलेट्स का चयन करने और व्याकरण-बाधित डिकोडिंग के माध्यम से उन्हें लागू करके Text-to-SQL सटीकता में सुधार करता है और विलंबता (latency) को कम करता है।

Smit Jivani, Sarvam Maheshwari, Sunita Sarawagi2026-05-01
🤖 machine learning

MIFair: A Mutual-Information Framework for Intersectionality and Multiclass Fairness

यह शोध पत्र MIFair को प्रस्तुत करता है, जो एक एकीकृत म्यूचुअल-इन्फॉर्मेशन फ्रेमवर्क है जो एक लचीले मेट्रिक टेम्पलेट और इन-प्रोसेसिंग मिटिगेशन विधि के माध्यम से इंटरसेक्शनलिटी, मल्टीक्लास सेटिंग्स और विविध निष्पक्षता आवश्यकताओं को प्रभावी ढंग से संबोधित करता है, और वास्तविक दुनिया के डेटासेट पर मजबूत बायस रिडक्शन और प्रेडिक्टिव परफॉरमेंस प्रदर्शित करता है।

Jeanne Monnier, Thomas George, Frédéric Guyard, Christèle Tarnec, Marios Kountouris2026-05-01
🤖 AI

Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

यह शोध पत्र कोलाबोरेटिव एजेंट रीजनिंग इंजीनियरिंग (CARE) को प्रस्तुत करता है, जो एक व्यवस्थित, स्टेज-गेटेड कार्यप्रणाली है जो वैज्ञानिक डोमेन में विश्वसनीय एआई एजेंटों की इंजीनियरिंग के लिए अनौपचारिक डोमेन इंटेंट को कठोर, सत्यापन योग्य विशिष्टताओं में बदलने हेतु विषय-विशेषज्ञों (Subject-Matter Experts), डेवलपर्स और एलएलएम हेल्पर एजेंटों के त्रिपक्षीय वर्कफ़्लो का लाभ उठाता है।

Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian2026-05-01
🤖 AI

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

यह शोध पत्र STEF को प्रस्तुत करता है, जो एक स्कीमा-अज्ञेय (schema-agnostic) मूल्यांकन ढांचा है जो डेटाबेस स्कीमा या ग्राउंड-ट्रुथ क्वेरी की आवश्यकता के बिना, प्राकृतिक भाषा इनपुट और जनरेट की गई SQL से व्याख्या योग्य सटीकता स्कोर उत्पन्न करके Text-to-SQL सिस्टम की निरंतर, प्रोडक्शन-नेटिव निगरानी सक्षम बनाता है।

Taslim Jamal Arif, Kuldeep Singh2026-05-01
🤖 AI

To Build or Not to Build? Factors that Lead to Non-Development or Abandonment of AI Systems

यह शोध पत्र एक स्कोपिंग समीक्षा और अनुभवजन्य केस डेटा को संश्लेषित करके एआई (AI) प्रणालियों के गैर-विकास या परित्याग के अल्प-अन्वेषित कारकों की जांच करता है ताकि यह प्रकट किया जा सके कि, नैतिक चिंताओं के परे, संसाधन संबंधी बाधाएं, कानूनी मुद्दे और संगठिक गतिशीलता जैसे विविध व्यावहारिक कारक इन महत्वपूर्ण पूर्व-परिनियोजन निर्णयों को महत्वपूर्ण रूप से प्रभावित करते हैं।

Shreya Chappidi, Jatinder Singh2026-05-01
🤖 AI

RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

यह शोध पत्र RHyVE को प्रस्तुत करता है, जो क्षमता-जागरूक सत्यापन (competence-aware verification) और चरण-जागरूक परिनियोजन (phase-aware deployment) को लागू करके LLM-जनित रिवॉर्ड परिकल्पनाओं की अविश्वसनीयता को संबोधित करता है, यह प्रदर्शित करते हुए कि रिवॉर्ड उपयोगिता पॉलिसी के प्रशिक्षण चरण पर निर्भर करती है और जनरेशन तथा परिनियोजन को युग्मित समस्याओं (coupled problems) के रूप में माना जाना चाहिए।

Feiyu Wu, Xu Zheng, Zhuocheng Wang, Yi ming Dai, Hui Li2026-05-01
💬 NLP

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

यह शोध पत्र यह प्रदर्शित करता है कि जर्मन भाषा मॉडलिंग के लिए, फ़िल्टर किए गए डेटा के एक छोटे, उच्च-गुणवत्ता वाले उपसमुच्चय पर बार-बार प्रशिक्षण लेना, बड़े और विविध कॉर्पोरा पर सिंगल-पास प्रशिक्षण की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे काफी कम टोकन के साथ अत्याधुनिक प्रदर्शन सक्षम होता है।

Ansar Aynetdinov, Patrick Haller, Alan Akbik2026-05-01