💬 NLP

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

यह शोध पत्र "govllm" को प्रस्तुत करता है, जो एक ओपन-सोर्स फ्रेमवर्क है जो यूरोपीय संघ के एआई अधिनियम (EU AI Act) के तहत निरंतर एलएलएम (LLM) अनुपालन निगरानी को सक्षम करने के लिए "मैट्रिक्स से शासन" (governance from metrics) को लागू करता है, जिसमें वास्तविक समय के अनुपालन संकेत उत्पन्न करने और मानवीय मध्यस्थता के लिए अनिश्चितता को चिह्नित करने हेतु नियामक न्यायाधीशों के रूप में विशिष्ट लघु भाषा मॉडलों (small language models) के एक पैनल का उपयोग किया जाता है।

Jehanne Dussert2026-05-26
🤖 machine learning

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

यह शोध पत्र BOOST को प्रस्तुत करता है, जो एक बाइलेवल ऑप्टिमाइज़ेशन फ्रेमवर्क है जो वास्तविक वैलिडेशन डेटा पर एक लाइटवेट हेड को ऑप्टिमाइज़ करके, विषम सिंथेटिक मल्टी-टर्न ट्रेजेक्टरीज को पुन: भारित (reweight) करना स्वचालित रूप से सीखता है ताकि LLM फाइन-ट्यूनिंग के लिए, जिससे बाहरी जजों की आवश्यकता के बिना विविधता और गुणवत्ता को संतुलित करते हुए मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जा सके।

Shresth Verma, Mauricio Tec, Cheol Woo Kim, Kai Wang, Milind Tambe2026-05-26
💻 computer science

Motion-Compensated Weight Compression

यह शोध पत्र मोशन-कंपनसेटेड वेट कम्प्रेशन (MCWC) का प्रस्ताव करता है, जो एक वेट-ओनली कोडेक है जो न्यूरल नेटवर्क परिनियोजन के लिए रेट-एक्यूरेसी ट्रेड-ऑफ को महत्वपूर्ण रूप से सुधारने के लिए परम्यूटेशन सिमिट्री अलाइनमेंट और लेयर-सीक्वेंशियल प्रेडिक्शन का लाभ उठाता है।

Ismail Lamaakal2026-05-26
🤖 AI

Proper Scoring Rules for Agentic Uncertainty Quantification

यह शोधपत्र ट्रैजेक्टरी प्रॉपर स्कोर (TPS) प्रस्तुत करता है, जो एक स्ट्रिक्टली प्रॉपर स्कोरिंग रूल है जो भाषा मॉडल एजेंटों के लिए पूर्ण प्रीफिक्स-कंडीशन्ड सक्सेस-प्रोबेबिलिटी ट्रेस को कठोरता से इलिट्स (elicits) करता है, और उन मौजूदा मेट्रिक्स की सीमाओं को संबोधित करता है जो एजेंटिक अनिश्चितता मात्रा निर्धारण (uncertainty quantification) में रैंकिंग प्रदर्शन और संभाव्य सत्यता के बीच अंतर करने में विफल रहते हैं।

Suresh Raghu, Satwik Pandey, Shashwat Pandey2026-05-26
🤖 machine learning

Complement Submodular Information Measures for Balanced and Robust Data Selection

यह शोध पत्र कॉम्प्लीमेंट सबमॉड्यूलर इंफॉर्मेशन (CSI) प्रस्तुत करता है, जो उद्देश्यों का एक नया वर्ग है जो संतुलित, सुदृढ़ डेटा चयन प्राप्त करने के लिए एक चयनित उपसमुच्चय (subset) और उसके पूरक (complement) के बीच संरचनात्मक संबंधों को मापता है, जिसमें लगभग इष्टतम ग्रीडी एप्रोक्सिमेशन गारंटी और बेहतर डाउनस्ट्रीम प्रदर्शन मिलता है।

Rishabh Iyer2026-05-26
🤖 AI

GRAIL: AI translation for scientists application workflow on satellite data

यह शोध पत्र GRAIL को प्रस्तुत करता है, जो एक एजेंटिक AI सिस्टम है जो RDPro लाइब्रेरी को अनुकूलित करके और लक्षित कोड रिपेयर के लिए एक संरचित LangGraph पाइपलाइन का उपयोग करके, स्केलेबल पायथन भू-स्थानिक वर्कफ़्लो को उपग्रह डेटा विश्लेषण के लिए निष्पादन योग्य स्पार्क प्रोग्रामों में स्वचालित रूप से अनुवादित करता है, जिससे डोमेन वैज्ञानिकों को एक नया फ्रेमवर्क सीखे बिना बड़े पैमाने के डेटा को प्रोसेस करने में सक्षम बनाया जा सके।

Zhuocheng Shang, Ahmed Eldawy2026-05-26
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO एक कुशल ऑनलाइन स्किल-डिस्टिलेशन फ्रेमवर्क पेश करता है जो मल्टीमॉडल वेब एजेंटों को एक संरचित स्किल लाइब्रेरी बनाए रखने और प्रोग्रेस रिफ्लेक्शन एवं कैश-अवेयर प्रॉम्प्टिंग जैसी तकनीकों को नियोजित करने के माध्यम से प्रदर्शन में सुधार करने और टोकन खपत को कम करने में सक्षम बनाता है, जिससे मौजूदा तरीकों की तुलना में काफी कम इन्फरेंस लागत के साथ VisualWebArena पर 58.3% सफलता दर प्राप्त होती है।

Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu2026-05-26
🤖 machine learning

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

CONF-KV एक नवीन KV कैश इविक्शन रणनीति है जो मॉडल के प्रति-चरण भविष्यवाणी आत्मविश्वास के आधार पर गतिशील रूप से कैश बजट को समायोजित करती है और लंबी अवधि के LLM इन्फरेंस के लिए उच्च रिट्रीवल सटीकता और कार्य प्रदर्शन बनाए रखते हुए मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने के लिए मिश्रित-परिशुद्धता स्टोरेज का उपयोग करती है।

Yubo Li, Yidi Miao2026-05-26
🤖 AI

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

यह शोध पत्र एक पैरामीटर-कुशल फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो क्लिनिकल विजुअल क्वेश्चन अनस्वर्सिंग के लिए फ्लोरेंस-2 विजन-लैंग्वेज मॉडल और गोपनीयता-संरक्षित सिंथेटिक गैस्ट्रोइंटेस्टाइनल इमेज जनरेशन के लिए LoRA-एन्हांस्ड स्टेबल डिफ्यूजन 2.1 को जोड़ता है, जो मौजूदा मॉडलों की तुलना में बेहतर प्रदर्शन और कम कम्प्यूटेशनल लागत प्रदर्शित करता है।

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman2026-05-26
🤖 AI

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

यह शोध पत्र डिवाइड-एंड-कॉन्कर इन्फरेंस (DCI) प्रस्तुत करता है, जो एक नवीन टेस्ट-टाइम स्केलिंग रणनीति है जो जटिल वर्गीकरण कार्यों को पुनरावर्ती रूप से स्थानीयकृत उप-समस्याओं में विघटित करके बड़े पैमाने पर दृश्य पहचान में प्रदर्शन गिरावट को कम करती है, जिससे सिग्नल-टू-नॉइज़ अनुपात और कम्प्यूटेशनल दक्षता में सुधार होता है ताकि हल्के ओपन-सोर्स मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को बिना किसी अतिरिक्त प्रशिक्षण के फ्रंटियर क्लोज्ड-सोर्स दिग्गजों के समकक्ष बनाया जा सके।

Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao2026-05-26