🤖 machine learning

SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models

यह शोध पत्र SPA-Cache को प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन कैशिंग फ्रेमवर्क है, जो कुशल अपडेट पहचान के लिए एक लो-डायमेंशनल सिंगुलर प्रॉक्सी और नॉन-कॉज़ल सीमाओं को दूर करने के लिए एक एडेप्टिव बजट एलोकेशन स्ट्रैटेजी का उपयोग करता है, जिससे वैनिला डिकोडिंग की तुलना में 8x तक थ्रूपुट सुधार और मौजूदा बेसलाइन्स की तुलना में 2-4x की गति वृद्धि प्राप्त होती है।

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Yongcheng Jing, Dacheng Tao2026-05-26
🧬 biology

Fine-Tuning Language Models to Know What They Know

यह शोध पत्र वास्तविक क्षमता को अलग करने के लिए dtype2d'_{\rm type2} मीट्रिक का उपयोग करते हुए और मेटाकॉग्निटिव अलाइनमेंट के लिए इवोल्यूशन स्ट्रैटेजी फॉर मेटाकॉग्निटिव अलाइनमेंट (ESMA) का प्रस्ताव देते हुए, बड़े भाषा मॉडल (Large Language Model) की मेटाकॉग्निशन को मापने और बढ़ाने के लिए एक ढांचे को प्रस्तुत करता है, जो विविध स्थितियों में मजबूत सामान्यीकरण प्राप्त करता है और यह प्रकट करता है कि सुधार मापदंडों के एक विरल सेट (sparse set of parameters) से उत्पन्न होते हैं।

Sangjun Park, Elliot Meyerson, Xin Qiu, Risto Miikkulainen2026-05-26
💬 NLP

Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems

यह शोध पत्र **एजेंट प्रिमिटिव्स (Agent Primitives)** को प्रस्तुत करता है, जो मल्टी-एजेंट सिस्टम को पुन: प्रयोज्य लेटेंट बिल्डिंग ब्लॉक्स (समीक्षा, वोटिंग/चयन, और योजना/निष्पादन) में विभाजित करता है जो की-वैल्यू कैश (key-value caches) के माध्यम से संचार करते हैं ताकि कार्य-विशिष्ट आर्किटेक्चर को स्वचालित रूप से संयोजित किया जा सके, जो पारंपरिक टेक्स्ट-आधारित मल्टी-एजेंट सिस्टम की तुलना में सटीकता, दक्षता और स्थिरता में महत्वपूर्ण सुधार करता है।

Haibo Jin, Peng Kuang, Ye Yu, Xiaopeng Yuan, Haohan Wang2026-05-26
🤖 machine learning

Counterfactual Explanations for Hypergraph Neural Networks

यह शोध पत्र CF-HyperGNNExplainer प्रस्तुत करता है, जो हाइपरग्राफ न्यूरल नेटवर्क के लिए एक काउंटरफैक्टुअल स्पष्टीकरण विधि है जो मॉडल भविष्यवाणियों को बदलने और उच्च-क्रम की अंतःक्रियाओं में व्याख्यात्मक अंतर्दृष्टि प्रदान करने के लिए नोड-हाइपरएज घटनाओं को हटाने या हाइपरएज को हटाने जैसे न्यूनतम संरचनात्मक परिवर्तनों की पहचान करता है।

Fabiano Veglianti, Lorenzo Antonelli, Gabriele Tolomei2026-05-26
🤖 machine learning

F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

यह शोधपत्र F-GRPO का प्रस्ताव करता है, जो एक कठिनाई-जागरूक (difficulty-aware) सुदृढीकरण शिक्षण विधि है जो उच्च-सफलता वाले अपडेट को कम भार देकर मानक समूह-आधारित एल्गोरिदम की सामान्य समाधानों पर ओवरफिट होने और दुर्लभ सही प्रक्षेप पथों (trajectories) की उपेक्षा करने की प्रवृत्ति को कम करती है, जिससे बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के विभिन्न बेसलाइनों में गणितीय तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gav (…)2026-05-26
🤖 machine learning

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

यह शोध पत्र "कॉन्टेक्स्टुअल रोलआउट बैंडिट्स" (Contextual Rollout Bandits) का प्रस्ताव करता है, जो एक एकीकृत न्यूरल शेड्यूलिंग फ्रेमवर्क है जो रोलआउट्स को कॉन्टेक्स्टुअल बैंडिट आर्म्स के रूप में मानता है ताकि उच्च-मूल्य वाले ऐतिहासिक डेटा को अनुकूल रूप से चुनने और पुन: उपयोग करने के लिए, बड़े भाषा मॉडलों के लिए सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (Reinforcement Learning with Verifiable Rewards - RLVR) में सैंपल दक्षता और प्रदर्शन में सुधार किया जा सके।

Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang2026-05-26
🤖 AI

FLINGO -- Instilling ASP Expressiveness into Linear Integer Constraints

यह शोध पत्र FLINGO को प्रस्तुत करता है, जो एक भाषा और उपकरण है जो डिफ़ॉल्ट मान (default values), अनिर्धारित गुणों (undefined attributes), गैर-नियतात्मक असाइनमेंट (non-deterministic assignments) और एकत्रीकरण (aggregations) जैसी प्रमुख ASP विशेषताओं को लीनियर इंटीजर कंस्ट्रेंट्स (linear integer constraints) में एकीकृत करके कंस्ट्रेंट आंसर सेट प्रोग्रामिंग (CASP) को उन्नत करता है, साथ ही इसमें मानक CASP सॉल्वर के लिए एक ट्रांसलेशन मैकेनिज्म भी शामिल है।

Jorge Fandinno, Pedro Cabalar, Philipp Wanko, Torsten Schaub2026-05-26
📈 economics

Two-Sided Time-Independent Regret for Matching Markets with Limited Interviews

यह शोध पत्र एक रणनीतिक स्थगन तंत्र (strategic deferral mechanism) प्रस्तुत करता है और सीमित साक्षात्कारों वाले द्वि-पक्षीय मिलान बाजारों के लिए एल्गोरिदम डिजाइन करता है, जो यह प्रदर्शित करता है कि प्रति दौर साक्षात्कारों की एक स्थिर संख्या एजेंटों और फर्मों दोनों के लिए समय-स्वतंत्र पछतावे (time-independent regret) को सक्षम बनाती है, जिससे पारंपरिक मॉडलों के O(logT)O(\log T) बाउंड्स की तुलना में इसमें महत्वपूर्ण सुधार होता है।

Amirmahdi Mirfakhar, Xuchuang Wang, Mengfan Xu, Hedyeh Beyhaghi, Mohammad Hajiesmaili2026-05-26
🤖 AI

UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates

UniRank एक VLM-आधारित फ्रेमवर्क है जो बिना मोडैलिटी रूपांतरण के हाइब्रिड टेक्स्ट-इमेज उम्मीदवारों को मूल रूप से स्कोर करता है और डोमेन-विशिष्ट मल्टीमॉडल रीरैंकिंग कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए इंस्ट्रक्शन ट्यूनिंग और हार्ड-नेगेटिव-ड्रिवन RLHF वाले दो-चरणीय डोमेन अनुकूलन पाइपलाइन का उपयोग करता है।

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Shikui Tu, Lei Xu2026-05-26
🤖 AI

Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs

यह शोधपत्र एक कमिट-ओपन प्रोटोकॉल प्रस्तावित करता है जो होस्टेड एलएलएम (LLM) में साइलेंट मॉडल प्रतिस्थापन (silent model substitution) का प्रभावी ढंग से पता लगाने के लिए स्पार्स ऑटोएनकोडर (SAE) फीचर ट्रेसेस के मर्कल-ट्री कमिटमेंट्स का उपयोग करता है, जो विविध एडेप्टिव हमलों को खारिज करते हुए न्यूनतम कम्प्यूटेशनल ओवरहेड बनाए रखते हुए मौजूदा प्रोब-आफ्टर-रिटर्न योजनाओं से बेहतर प्रदर्शन करता है।

Ziyang Liu2026-05-26