💻 computer science

Leveraging LLMs for Multi-File DSL Code Generation: An Industrial Case Study

BMW का यह औद्योगिक केस स्टडी यह प्रदर्शित करता है कि रिपॉजिटरी पदानुक्रमों के एक संरचित, पथ-संरक्षण (path-preserving) JSON प्रतिनिधित्व के साथ कोड-उन्मुख LLMs को फाइन-ट्यून करना, सटीक, बहु-फ़ाइल DSL आर्टिफ़ेक्ट्स उत्पन्न करने के लिए बेसलाइन प्रॉम्प्टिंग और वन-शॉट लर्निंग की तुलना में काफी बेहतर प्रदर्शन करता है जो डाउनस्ट्रीम कोड जनरेशन को संचालित करते हैं।

Sivajeet Chand, Kevin Nguyen, Peter Kuntz, Alexander Pretschner2026-04-28
💻 computer science

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

यह शोध पत्र सूचनात्मक व्यवहार्यता सिद्धांत (Informational Viability Principle) और रिस्कगेट (RiskGate) ढांचे का प्रस्ताव करता है, जो ऑबिन के व्यवहार्यता सिद्धांत (Aubin's viability theory) पर आधारित है, ताकि अनपेक्षित जोखिमों की सीमाओं का अनुमान लगाकर और व्यवहार विचलन (behavior drift) एवं प्रतिकूल अनुकूलन (adversarial adaptation) के बावजूद सुरक्षा सुनिश्चित करने के लिए एकदिष्ट प्रतिबंधों (monotonic restrictions) को लागू करके स्वायत्त एआई एजेंटों के लिए अनुकूली रनटाइम गवर्नेंस को सक्षम बनाया जा सके।

German Marin, Jatin Chaudhary2026-04-28
💻 computer science

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

यह शोध पत्र SciCrafter को प्रस्तुत करता है, जो रेडस्टोन सर्किट कार्यों के माध्यम से डिस्कवरी-टू-एप्लीकेशन लूप (खोज-से-अनुप्रयोग चक्र) पर AI एजेंटों का मूल्यांकन करने वाला एक माइनक्राफ्ट-आधारित बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल मुख्य रूप से ज्ञान अनुप्रयोग की सीमाओं के कारण 26% की सफलता दर पर स्थिर हो गए हैं, और उन्नत प्रणालियों के लिए उभरती हुई बाधा अब ज्ञान के अंतराल को पहचानने और सही समस्याओं को तैयार करने की क्षमता की ओर स्थानांतरित हो रही है।

Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying (…)2026-04-28
💻 computer science

Green Shielding: A User-Centric Approach Towards Trustworthy AI

यह शोध पत्र "ग्रीन शील्डिंग" (Green Shielding) प्रस्तुत करता है, जो CUE मानदंडों और HealthCareMagic-Diagnosis बेंचमार्क का उपयोग करने वाला एक उपयोगकर्ता-केंद्रित ढांचा है, जो यह प्रदर्शित करता है कि कैसे उपयोगकर्ता प्रॉम्प्ट में नियमित, गैर-प्रतिकूल परिवर्तन चिकित्सा निदान में लार्ज लैंग्वेज मॉडल के आउटपुट को व्यवस्थित रूप से बदलते हैं, जिससे विश्वसनीय AI परिनियोजन को निर्देशित करने के लिए आउटपुट की संभाव्यता (plausibility) और सुरक्षा-महत्वपूर्ण कवरेज के बीच महत्वपूर्ण ट्रेड-ऑफों का अनावरण होता है।

Aaron J. Li, Nicolas Sanchez, Hao Huang, Ruijiang Dong, Jaskaran Bains, Katrin Jaradeh, Zhen Xiang, Bo Li, Feng Liu, Aar (…)2026-04-28
💻 computer science

Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis

यह शोध पत्र SpecValidator को प्रस्तुत करता है, जो एक हल्का, फाइन-ट्यून्ड क्लासिफायर है जो LLM-आधारित कोड जनरेशन को बेहतर बनाने के लिए दोषपूर्ण कार्य विवरणों (जैसे शाब्दिक अस्पष्टता, अपर्याप्त विवरण और सिंटैक्स त्रुटियों) का प्रभावी ढंग से पता लगाता है, जो बड़े मॉडलों से बेहतर प्रदर्शन करता है और यह प्रकट करता है कि दोष सहिष्णुता मॉडल क्षमता की तुलना में विवरण की गुणवत्ता और प्रकार पर अधिक निर्भर करती है।

Amal Akli, Mike Papadakis, Maxime Cordy, Yves Le Traon2026-04-28
💻 computer science

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

यह शोध पत्र 823 मुठभेड़ों (encounters) में नैदानिक AI प्रणालियों के मूल्यांकन के लिए एक केस-विशिष्ट, चिकित्सक-लिखित रूब्रिक पद्धति प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जहाँ विशेषज्ञ रूब्रिक्स एक उच्च-गुणवत्ता वाला आधारभूत स्तर स्थापित करते हैं, वहीं LLM-जनित रूब्रिक्स लगभग 1,000 गुना कम लागत पर तुलनीय सहमति प्राप्त कर सकते हैं, जिससे स्केलेबल और आर्थिक रूप से व्यवहार्य पुनरावृत्ति AI परिनियोजन सक्षम होता है।

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabet (…)2026-04-28
🤖 machine learning

On the Power of Foundation Models

यह योगदान श्रेणी सिद्धांत (category theory) का उपयोग करके यह दर्शाता है कि जहाँ प्रॉम्प्ट-आधारित शिक्षण (prompt-based learning) केवल प्रतिनिधित्व योग्य कार्यों तक ही सख्ती से सीमित है, वहीं फाइन-ट्यूनिंग के साथ एक पर्याप्त शक्तिशाली फाउंडेशन मॉडल सैद्धांतिक रूप से अपने प्रीट्रेनिंग कार्य द्वारा परिभाषित श्रेणी के भीतर किसी भी डाउनस्ट्रीम कार्य को हल कर सकता है और संरचनात्मक मानचित्रण (structural mapping) के माध्यम से अनदेखी वस्तुओं तक सामान्यीकरण कर सकता है।

Yang Yuan2026-04-27
🤖 AI

PoLO: Proof-of-Learning and Proof-of-Ownership at Once with Chained Watermarking

PoLO एक नवीन ढांचा है जो चेन्ड वॉटरमार्किंग के माध्यम से सीखने के प्रमाण (proof-of-learning) और स्वामित्व के प्रमाण (proof-of-ownership) को एक साथ प्रदान करता है, जिससे उच्च पहचान सटीकता और डेटा गोपनीयता प्राप्त होती है और साथ ही सत्यापन लागत में उल्लेखनीय कमी आती है और जालसाजी हमलों के विरुद्ध मजबूती बनी रहती है।

Haiyu Deng, Yanna Jiang, Guangsheng Yu, Qin Wang, Xu Wang, Baihe Ma, Wei Ni, Ren Ping Liu2026-04-27
🤖 AI

Vision-Based Risk Aware Emergency Landing for UAVs in Complex Urban Environments

यह शोध पत्र जटिल शहरी वातावरण में यूएवी (UAV) के लिए एक विज़न-आधारित, जोखिम-सचेत आपातकालीन लैंडिंग प्रणाली का प्रस्ताव करता है जो गतिशील बाधाओं और परिवर्तनशील प्रकाश व्यवस्था के बीच सुरक्षित लैंडिंग ज़ोन की पहचान करने के लिए सिमेंटिक सेगमेंटेशन और डायनेमिक रिस्क मैपिंग का उपयोग करता है, तथा वास्तविक दुनिया के परिदृश्यों में 90% से अधिक सफलता दर प्राप्त करता है।

Julio de la Torre-Vanegas, Miguel Soriano-Garcia, Israel Becerra, Diego Mercado-Ravell2026-04-27
🤖 AI

Pre-trained Large Language Models Learn Hidden Markov Models In-context

यह शोध पत्र प्रदर्शित करता है कि पूर्व-प्रशिक्षित बड़े भाषा मॉडल इन-कॉन्टेक्स्ट लर्निंग के माध्यम से हिडन मार्कोव मॉडल्स द्वारा उत्पन्न अनुक्रमों को प्रभावी ढंग से सीख और अनुमानित कर सकते हैं, जो सिंथेटिक डेटा पर लगभग इष्टतम सटीकता और वास्तविक दुनिया के पशु निर्णय लेने वाले कार्यों पर प्रतिस्पर्धी प्रदर्शन प्राप्त करते हुए, जटिल वैज्ञानिक डेटा में छिपी संरचनाओं को उजागर करने के लिए ICL को एक शक्तिशाली उपकरण के रूप में स्थापित करते हैं।

Yijia Dai, Zhaolin Gao, Yahya Sattar, Sarah Dean, Jennifer J. Sun2026-04-27