🤖 AI

A Policy-Driven Runtime Layer for Agentic LLM Serving

यह शोध पत्र एक नए आर्किटेक्चरल "एजेंट रनटाइम लेयर" का प्रस्ताव करता है जो पॉलिसी-संचालित अनुकूलन (policy-driven optimizations) को सक्षम करने के लिए मल्टी-एजेंट फ्रेमवर्क और एलएलएम (LLM) सर्विंग इंजन के बीच के अंतर को पाटता है, और कैशसेज (CacheSage) सिस्टम के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण विविध मल्टी-एजेंट वर्कलोड्स में कैश हिट रेट, टाइम-टू-फर्स्ट-टोकन और थ्रूपुट में महत्वपूर्ण सुधार करता है।

Rui Zhang, Chaeeun Kim, Liting Hu2026-05-28
💬 NLP

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

यह शोध पत्र प्रदर्शित करता है कि प्राचीन ग्रीक ग्रंथों पर OCR करने वाले विजन-लैंग्वेज मॉडल्स (VLMs) अक्सर प्रवाहपूर्ण लेकिन दृश्य रूप से अग्राउंडेड (visually ungrounded) त्रुटियाँ उत्पन्न करने के लिए भाषाई पूर्वग्रहों (language priors) पर निर्भर करते हैं, जो एक ऐसा विफलता मोड है जो डिकोड-टाइम हस्तक्षेपों के साथ भी बना रहता है और पारंपरिक OCR प्रणालियों के शोर पैटर्न से काफी भिन्न है।

Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice2026-05-28
🤖 AI

Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration

यह शोध पत्र प्रदर्शित करता है कि LLM आत्मविश्वास अंशांकन (confidence calibration) माप प्रोटोकॉल—विशेष रूप से कंडिशनिंग कॉन्टेक्स्ट, टोकन-प्रोबेबिलिटी रीडआउट और उत्तर चयन—के प्रति अत्यधिक संवेदनशील है, जो यह प्रकट करता है कि मौखिक रूप से व्यक्त किया गया आत्मविश्वास अक्सर शुद्धता के बजाय उत्तर की संभाव्यता को दर्शाता है और विश्वसनीय मूल्यांकन के लिए मानकीकृत रिपोर्टिंग चेकलिस्ट अपनाने का आग्रह करता है।

Hankyeol Kim, Pilsung Kang2026-05-28
🤖 AI

SkillGrad: Optimizing Agent Skills Like Gradient Descent

SkillGrad एक नवीन ढांचा है जो एजेंट कौशल को एक ग्रेडिएंट-डिसेन्ट-समान प्रक्रिया में संरचित मापदंडों के रूप में मानकर उन्हें अनुकूलित करता है, जिसमें प्रक्षेपवक्र-स्तरीय हानि साक्ष्य (trajectory-level loss evidence), पाठ-आधारित नैदानिक ग्रेडिएंट और एक मोमेंटम एजेंट का उपयोग करके कौशलों को पुनरावृत्ति से परिष्कृत किया जाता है, जिससे यह बेंचमार्क कार्यों पर मौजूदा प्रशिक्षण-आधारित बेसलाइन से बेहतर प्रदर्शन करता है।

Hanyu Wang, Yifan Lan, Bochuan Cao, Lu Lin, Jinghui Chen2026-05-28
🤖 AI

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM माइनक्राफ्ट में एम्बॉडीड एजेंट्स के लिए एक नवीन ढांचा है जो धीमी विचारशील तर्क और तेज़ रिफ्लेक्सिव निष्पादन की एक दोहरी-प्रणाली वास्तुकला का उपयोग करके स्मृति को इन्फरेंस-टाइम रिट्रीवल से पैरामीटर-रेसिडेंट कौशल में परिवर्तित करता है, जहाँ विफलताएं कंट्रास्टिव लर्निंग के लिए महत्वपूर्ण प्रशिक्षण संकेतों के रूप में कार्य करती हैं और एक स्व-ट्रिगर तंत्र स्वायत्त रूप से यह निर्णय लेता है कि कैटास्ट्रोफिक फॉरगेटिंग के बिना निरंतर शिक्षण सक्षम करने के लिए अनुभवों को कब आंतरिक रूप से आत्मसात किया जाए।

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su2026-05-28
🤖 AI

Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

यह शोधपत्र SegWorld प्रस्तुत करता है, जो एक ऐसा सेगमेंटेशन मॉडल है जो विशिष्ट कमांड प्राप्त करने से पहले एफॉर्डेंस (affordances) और भौतिक इंटरेक्शन साइटों का अनुमान लगाकर, उच्च-स्तरीय इंटेंट-आधारित निर्देशों और सटीक मास्क प्रेडिक्शन के बीच के अंतर को पाटने के लिए प्रोएक्टिव विजुअल चेन-ऑफ-थॉट रीजनिंग का लाभ उठाता है।

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su2026-05-28
🤖 machine learning

Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

यह शोध पत्र SC-SDPO को प्रस्तुत करता है, जो सेल्फ-डिस्टिलेशन पॉलिसी ऑप्टिमाइज़ेशन का एक नवीन संस्करण है जो प्रशिक्षण प्रश्नों को उनके अनुमानित पास-रेट वेरिएंस के वर्गमूल द्वारा गतिशील रूप से भारित करता है ताकि अंतर्निहित रूप से एक कठिनाई-जागरूक पाठ्यक्रम बनाया जा सके, जिससे तर्क और टूल-उपयोग बेंचमार्क पर स्थिर प्रशिक्षण गतिकी बनाए रखते हुए निरंतर प्रदर्शन लाभ प्राप्त किया जा सके।

Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar2026-05-28
🤖 AI

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

यह शोध पत्र एक मल्टी-एजेंट सिमुलेशन प्लेटफॉर्म प्रस्तुत करता है जो यह प्रदर्शित करता है कि निरंतर सामाजिक परिवेश में मौजूद LLM एजेंट सामाजिक दबाव और संक्रामकता के कारण गोपनीयता उल्लंघन के प्रति काफी अधिक संवेदनशील होते हैं, जो यह प्रकट करता है कि स्थिर सिंगल-टर्न सुरक्षा बेंचमार्क वास्तविक दुनिया के एजेंटिक परिनियोजन में संवेदनशील सूचना रिसाव के जोखिमों का व्यवस्थित रूप से कम आकलन करते हैं।

Aman Priyanshu, Supriti Vijay, Esha Pahwa2026-05-28
💬 NLP

UniMaia: Steering Chess Policies with Language for Human-like Play

यह शोध पत्र UniMaia को प्रस्तुत करता है, जो एक पैरामीटर-कुशल (parameter-efficient) फ्रेमवर्क है जो एंड-टू-एंड मल्टीमॉडल प्रशिक्षण की आवश्यकता के बिना, डोमेन-विशिष्ट प्रदर्शन को संरक्षित करते हुए, गेमप्ले शैली और सामर्थ्य पर मानव-समान नियंत्रणीयता प्राप्त करने के लिए भाषा प्रॉम्प्ट्स का उपयोग करके एक फ्रोजन (frozen) Lc0 चेस पॉलिसी नेटवर्क को निर्देशित करता है।

Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)2026-05-28
🤖 AI

Auditable Decision Models with Learned Abstention and Real-Time Steering

यह शोध पत्र इवैल्यूएटरडीपीटी (EvaluatorDPT) को प्रस्तुत करता है, जो एक सीमित निर्णय-नियंत्रण मॉडल है जो भविष्यवाणियों को थोपने के बजाय अपरिहार्य रूप से रुकना (abstain) सीखता है, जिससे स्पष्ट अनिश्चितता रूटिंग और एक बड़े परीक्षण सेट पर मजबूत अनुभवजन्य प्रदर्शन के साथ ऑडिट करने योग्य, नीति-शासित एआई निर्णय सक्षम होते हैं।

Sankaranarayanan Palamadai Chandrasekaran2026-05-28