🤖 machine learning

IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning

यह शोध पत्र IRIS का प्रस्ताव करता है, जो एक एकीकृत सेल्फ-प्ले फाइन-ट्यूनिंग फ्रेमवर्क है जो प्रशिक्षण चरणों के दौरान महत्व भारण (इम्पॉर्टेंस वेटिंग) को गतिशील रूप से अनुकूलित करने के लिए निरंतर समायोज्य रेनी डायवर्जेंस पैरामीटर का लाभ उठाता है, जिससे यह मौजूदा विधियों से बेहतर प्रदर्शन करता है और काफी कम एनोटेटेड नमूनों के साथ उत्कृष्ट परिणाम प्राप्त करता है।

Wenjie Liao, Like Wu, Liangjie Zhao, Shihui Xu, Shigeru Fujimura2026-04-24
💻 computer science

Escaping the Agreement Trap: Defensibility Signals for Evaluating Rule-Governed AI

यह शोध पत्र नियम-शासित एआई (AI) के लिए एक नए मूल्यांकन ढांचे का प्रस्ताव करता है जो दोषपूर्ण सहमति-आधारित मेट्रिक्स को नीति-आधारित शुद्धता मापों, जैसे कि डिफेन्सिबिलिटी इंडेक्स (Defensibility Index) और प्रोबेबिलिस्टिक डिफेन्सिबिलिटी सिग्नल (Probabilistic Defensibility Signal) से बदल देता है, ताकि कंटेंट मॉडरेशन में वैध निर्णयों और वास्तविक त्रुटियों के बीच सटीक रूप से अंतर किया जा सके।

Michael O'Herlihy, Rosa Català2026-04-24
🤖 machine learning

Differentially Private Model Merging

यह शोध पत्र पोस्ट-प्रोसेसिंग तकनीकों, विशेष रूप से रैंडम सिलेक्शन (यादृच्छिक चयन) और लीनियर कॉम्बिनेशन (रैखिक संयोजन), को प्रस्तावित करता है ताकि पूर्व-प्रशिक्षित मॉडलों के एक सेट से बिना किसी अतिरिक्त प्रशिक्षण के मनचाही डिफरेंशियल प्राइवेसी आवश्यकताओं को पूरा करने वाले मॉडल उत्पन्न किए जा सकें, जो सैद्धांतिक रूप से लीनियर कॉम्बिनेशन की श्रेष्ठता को प्रदर्शित करता है और विभिन्न डेटासेट्स पर इस दृष्टिकोण को मान्य करता है।

Qichuan Yin, Manzil Zaheer, Tian Li2026-04-24
💻 computer science

Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

यह शोध पत्र COSPLAY को प्रस्तुत करता है, जो एक सह-विकासवादी (co-evolutionary) ढांचा है जहाँ एक LLM निर्णय एजेंट और एक कौशल प्रबंधन एजेंट मिलकर बिना लेबल वाले रोलआउट्स से संरचित कौशलों की खोज, परिशोधन और पुनर्प्राप्ति करते हैं, जो फ्रंटियर LLM बेसलाइन की तुलना में गेम वातावरण में दीर्घकालिक (long-horizon) प्रदर्शन में महत्वपूर्ण सुधार करता है।

Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha2026-04-24
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

यह शोध पत्र एक नवीन "फंक्शन हाइजैकिंग अटैक" (FHA) प्रस्तुत करता है जो संदर्भ अर्थशास्त्र (context semantics) की परवाह किए बिना एजेंटिक एआई मॉडल्स को हमलावर द्वारा चुने गए फंक्शन्स को निष्पादित करने के लिए मजबूती से हेरफेर करता है, जो विविध मॉडल्स में उच्च सफलता दर प्राप्त करता है और फंक्शन-कॉलिंग सिस्टम में उन्नत सुरक्षा गार्डरेल्स की महत्वपूर्ण आवश्यकता को प्रदर्शित करता है।

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher2026-04-24
💻 computer science

The Last Harness You'll Ever Build

यह शोध पत्र एक दो-स्तरीय ढांचे को प्रस्तुत करता है जो व्यक्तिगत कार्यों के लिए 'हारनेस इवोल्यूशन लूप' के माध्यम से और एक सार्वभौमिक प्रोटोकॉल सीखने वाले 'मेटा-इवोल्यूशन लूप' के माध्यम से AI एजेंट हार्नेस के निर्माण और अनुकूलन को स्वचालित करता है, जो अंततः एजेंटों को नए डोमेन में अनुकूलित करने के लिए मैनुअल हार्नेस इंजीनियरिंग की आवश्यकता को समाप्त कर देता है।

Haebin Seong, Li Yin, Haoran Zhang2026-04-24
💻 computer science

Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics

यह शोध पत्र Open-H-Embittment को प्रस्तुत करता है, जो 49 से अधिक संस्थानों और कई प्लेटफार्मों में फैले चिकित्सा रोबोटिक वीडियो और किनेमैटिक्स का सबसे बड़ा ओपन डेटासेट है, जो GR00T-H और Cosmos-H-Surgical-Simulator जैसे फाउंडेशन मॉडल्स के विकास को सक्षम बनाता है ताकि चिकित्सा रोबोटिक्स में अभूतपूर्व एंड-टू-एंड टास्क पूर्णता और मल्टी-एम्बॉडमेंट सिमुलेशन प्राप्त किया जा सके।

Open-H-Embodiment Consortium (Brian), : (Brian), Nigel Nelson (Brian), Juo-Tung Chen (Brian), Jesse Haworth (Brian), Xi (…)2026-04-24
💻 computer science

Adaptive Test-Time Compute Allocation with Evolving In-Context Demonstrations

यह शोध पत्र एक एडेप्टिव टेस्ट-टाइम कंप्यूट फ्रेमवर्क प्रस्तावित करता है जो गणित, कोडिंग और रीजनिंग बेंचमार्क पर प्रदर्शन में सुधार करने के लिए संसाधनों को गतिशील रूप से आवंटित करता है और सफल क्वेरी प्रतिक्रियाओं से विकसित होते इन-कॉन्टेक्स्ट प्रदर्शनों का लाभ उठाता है, जबकि इन्फरेंस-टाइम कंप्यूट लागतों को काफी कम करता है।

Bowen Zuo, Dongruo Zhou, Yinglun Zhu2026-04-24
💻 computer science

HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering

HypEHR एक कॉम्पैक्ट, हाइपरबोलिक ज्योमेट्री-आधारित मॉडल है जो पदानुक्रमित संरचनाओं (hierarchical structures) का लाभ उठाकर नैदानिक प्रश्नों का कुशलतापूर्वक उत्तर देने के लिए इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड और प्रश्नों को एम्बेड करता है, जिससे काफी कम मापदंडों (parameters) के साथ महंगे LLMs के तुलनीय प्रदर्शन प्राप्त होता है।

Yuyu Liu, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma2026-04-24
🤖 machine learning

A Deep U-Net Framework for Flood Hazard Mapping Using Hydraulic Simulations of the Wupper Catchment

यह शोध पत्र एक अनुकूलित डीप-लर्निंग U-Net सरोगेट मॉडल प्रस्तुत करता है जो जर्मनी के वुपर (Wupper) कैचमेंट के लिए अधिकतम बाढ़ जल स्तर की कुशलतापूर्वक और सटीक रूप से भविष्यवाणी करता है, जो पारंपरिक, संसाधन-गहन हाइड्रोलिक सिमुलेशन के एक गणनात्मक रूप से व्यवहार्य विकल्प के रूप में कार्य करता है।

Christian Lammers, Fernando Arévalo, Leonie Märker-Neuhaus, Daniel Heinenberg, Christian Förster, Karl-Heinz Spies2026-04-24