🤖 machine learning

Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic

यह शोध पत्र एक सिंगल-टाइमस्केल फेडरेटेड एक्टर-क्रिटिक फ्रेमवर्क प्रस्तावित करता है जो एक सामान्य रैखिक उपसमष्टि (लीनियर सबस्पेस) साझा करते हुए स्थानीय नीति घटकों को बनाए रखकर सहयोगात्मक शिक्षण और वैयक्तिकरण के बीच संतुलन बनाता है, जिससे एजेंटों की संख्या पर लीनियर स्पीडअप के साथ परिमित-समय अभिसरण (फाइनाइट-टाइम कन्वर्जेंस) प्राप्त होता है और विषम कार्यों पर उत्कृष्ट प्रदर्शन प्रदर्शित होता है।

Leo Muxing Wang, Pengkun Yang, Lili Su2026-05-15
💻 computer science

Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL

यह शोध पत्र CQ-SID और EG-GRPO को प्रस्तुत करता है, जो ई-कॉमर्स के लिए एक व्यावहारिक जनरेटिव रिट्रीवल फ्रेमवर्क है जो पदानुक्रमित सिमेंटिक क्लस्टर आईडी (hierarchical semantic cluster IDs) और विशेषज्ञ-निर्देशित सुदृढीकरण लर्निंग (expert-guided reinforcement learning) का लाभ उठाकर वास्तविक उत्पादन प्रणालियों में रिकॉल दक्षता, रैंकिंग संरेखण और GMV जैसे प्रमुख व्यावसायिक मेट्रिक्स में महत्वपूर्ण सुधार प्राप्त करता है।

Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai2026-05-15
🤖 machine learning

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

यह शोध पत्र एक सुदृढीकरण अधिगम (Reinforcement Learning) ढांचे का प्रस्ताव करता है जो अनुभव के पुनरावृत्ति आसवन (iterative distillation) के माध्यम से एक हल्के प्रॉमप्टर मॉडल को अनुकूलित करता है ताकि फ्रोजन ब्लैक-बॉक्स एलएलएम (LLMs) की बहु-चरणीय तर्क और टूल-उपयोग क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे अत्याधुनिक विकासवादी बेसलाइनों की तुलना में बेहतर प्रदर्शन और नमूना दक्षता प्राप्त होती है।

Krishna Sayana, Ketan Todi, Ambarish Jash2026-05-15
💻 computer science

Stateful Reasoning via Insight Replay

यह शोध पत्र **InsightReplay** प्रस्तुत करता है, जो एक स्टेटफुल रीजनिंग (stateful reasoning) विधि है जो लॉन्ग चेन-ऑफ-थॉट (long Chain-of-Thought) ट्रेसेस में अटेंशन डिके (attention decay) को रोकने के लिए जनरेशन फ्रंटियर के पास महत्वपूर्ण मध्यवर्ती अंतर्दृष्टि (intermediate insights) को समय-समय पर निकालता है और उसे पुनः प्रस्तुत (replay) करता है, जिससे विविध मॉडल स्केल्स और रीजनिंग बेंचमार्क में निरंतर सटीकता सुधार प्राप्त होता है।

Bin Lei, Caiwen Ding, Jiachen Yang, Ang Li, Xin Eric Wang2026-05-15
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop एक ट्रेनिंग-फ्री, लेयर-वाइज टोकन प्रूनिंग फ्रेमवर्क है जो ओम्नी-मोडल LLMs के लिए है, जो टेक्स्ट क्वेरीज़ और एक टेम्पोरल डाइवर्सिटी स्कोर का उपयोग करके डिकोडर लेयर्स के भीतर अनावश्यक ऑडियोविजुअल टोकन को प्रगतिशील रूप से हटाता है, जिससे प्रदर्शन में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करते हुए लेटेंसी और मेमोरी उपयोग में महत्वपूर्ण कमी आती है।

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon2026-05-15
💻 computer science

From Table to Cell: Attention for Better Reasoning with TABALIGN

यह शोधपत्र TABALIGN प्रस्तुत करता है, जो एक नवीन तर्क ढांचा (reasoning framework) है जो मल्टी-स्टेप टेबल रीजनिंग में ऑटोरेग्रेसिव मॉडल्स की सीमाओं को दूर करने के लिए एक मास्क्ड डिफ्यूजन लैंग्वेज मॉडल प्लानर और एक सेल-ग्राउंडिंग अटेंशन वेरीफायर का लाभ उठाता है, जिससे आठ बेंचमार्क में महत्वपूर्ण सटीकता और दक्षता लाभ प्राप्त होता है।

Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Gu (…)2026-05-15
💻 computer science

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning

LEMON एक नवीन LLM-आधारित ऑर्केस्ट्रेटर है जो भूमिकाओं, कर्तव्यों, क्षमताओं और निर्भरताओं को एकीकृत करके निष्पादन योग्य मल्टी-एजेंट विनिर्देशों को उत्पन्न करने के लिए काउंटरफैक्चुअल सुदृढीकरण लर्निंग (counterfactual reinforcement learning) का उपयोग करता है, जिससे विविध रीजनिंग और कोडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xudong Chen, Yixin Liu, Hua Wei, Kaize Ding2026-05-15
💻 computer science

Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

यह शोध पत्र "हेड फोर्सिंग" (Head Forcing) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो कार्यात्मक रूप से विषम अटेंशन हेड्स को विशिष्ट KV कैश रणनीतियाँ सौंपकर, दीर्घ ऑटोरेग्रेसिव वीडियो जनरेशन में त्रुटि संचय और संदर्भ हानि को कम करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के मिनट-स्तर का संश्लेषण और मल्टी-प्रॉम्ट इंटरेक्शन सक्षम होता है।

Jiahao Tian, Yiwei Wang, Gang Yu, Chi Zhang2026-05-15
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

यह शोध पत्र Deepchecks को प्रस्तुत करता है, जो एक व्यापक फ्रेमवर्क है जिसे रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के मूल्यांकन की जटिल चुनौतियों को संबोधित करने के लिए डिज़ाइन किया गया है, जो विश्वसनीयता, प्रासंगिकता और एप्लिकेशन-विशिष्ट आवश्यकताओं के साथ संरेखण सुनिश्चित करने के लिए बहुआयामी मूल्यांकन, मूल कारण विश्लेषण और प्रोडक्शन मॉनिटरिंग प्रदान करता है।

Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron (…)2026-05-15
💻 computer science

PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media

यह शोध पत्र PROVE फ्रेमवर्क प्रस्तुत करता है, जिसमें धारणा-संरेखित (perception-aligned) RC-S और RC-T मेट्रिक्स और PROVE-Bench डेटासेट शामिल हैं, ताकि दृश्य मीडिया में ऑब्जेक्ट रिमूवल (वस्तु हटाने) की सुसंगतता के अधिक सटीक मूल्यांकन के माध्यम से मौजूदा मूल्यांकन विधियों की सीमाओं को दूर किया जा सके जो मानव निर्णय के साथ बेहतर ढंग से संरेखित हो।

Fuhao Li, Shaofeng You, Jiagao Hu, Yu Liu, Yuxuan Chen, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan2026-05-15