💬 NLP

Future-KL Regularized GRPO: Process-Level Credit Assignment from ff-Divergence Regularization

यह शोध पत्र फ्यूचर-केएल रेगुलराइज्ड पॉलिसी ऑप्टिमाइज़ेशन (FRPO) को प्रस्तुत करता है, जो एक क्रिटिक-फ्री विधि है जो ff-डाइवर्जेंस से व्युत्पन्न एक कॉज़ल फ्यूचर-रेगुलराइजेशन रिटर्न-टू-गो को शामिल करके GRPO के टोकन-लेवल KL रेगुलराइजेशन को ठीक करती है, जिससे उच्च एंट्रॉपी और कम पॉलिसी ड्रिफ्ट बनाए रखते हुए गणितीय तर्क प्रदर्शन में सुधार होता है।

Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang2026-05-26
💬 NLP

PathWise: Planning through World Model for Automated Heuristic Design via Self-Evolving LLMs

पाथवाइज़ (PathWise) एक नवीन मल्टी-एजेंट फ्रेमवर्क है जो कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन के लिए स्वचालित ह्यूरिस्टिक डिज़ाइन को एक एंटेलमेंट ग्राफ़ (entailment graph) पर स्टेट-अवेयर अनुक्रमिक निर्णय लेने वाले कार्य के रूप में स्वरूपित करके उन्नत करता है, जिससे यहतात्मक ट्रायल-एंड-एरर (trial-and-error) को तेज़ अभिसरण और बेहतर सामान्यीकरण प्राप्त करने के लिए रणनीतिक योजना और स्व-विकसित तर्क से बदल देता है।

Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri2026-05-26
💬 NLP

From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas

यह शोध पत्र GlobalHealthAtlas प्रस्तुत करता है, जो 15 डोमेन और 17 भाषाओं में बड़े भाषा मॉडल (large language models) में विशिष्ट सार्वजनिक स्वास्थ्य तर्क (specialized public health reasoning) के निर्माण, सत्यापन और मूल्यांकन के लिए एक बड़े पैमाने का बहुभाषी डेटासेट और साथ में एक पाइपलाइन है।

Zhaokun Yan, Shan Xu, Wuzheng Dong, Zhaohan Liu, Lijie Feng, Chengxiao Dai, Chen Tianqi, Binfan Liu, Yunpu Ma, Wenting W (…)2026-05-26
💬 NLP

MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents

MemSkill LLM एजेंटों के लिए एक स्व-विकसित (self-evolving) फ्रेमवर्क पेश करता है जो स्थिर, हस्त-निर्मित मेमोरी ऑपरेशन्स को सीखने योग्य और अनुकूलन योग्य कौशलों से बदल देता है, जिसमें कंट्रोलर्स, एक्जीक्यूटर्स और डिजाइनर्स का एक क्लोज्ड-लूप सिस्टम उपयोग किया जाता है ताकि मेमोरी प्रबंधन रणनीतियों को गतिशील रूप से परिष्कृत किया जा सके और विविध बेंचमार्क में कार्य प्रदर्शन में सुधार किया जा सके।

Haozhen Zhang, Quanyu Long, Jianzhu Bao, Tao Feng, Weizhi Zhang, Haodong Yue, Wenya Wang2026-05-26
🧬 biology

Fine-Tuning Language Models to Know What They Know

यह शोध पत्र वास्तविक क्षमता को अलग करने के लिए dtype2d'_{\rm type2} मीट्रिक का उपयोग करते हुए और मेटाकॉग्निटिव अलाइनमेंट के लिए इवोल्यूशन स्ट्रैटेजी फॉर मेटाकॉग्निटिव अलाइनमेंट (ESMA) का प्रस्ताव देते हुए, बड़े भाषा मॉडल (Large Language Model) की मेटाकॉग्निशन को मापने और बढ़ाने के लिए एक ढांचे को प्रस्तुत करता है, जो विविध स्थितियों में मजबूत सामान्यीकरण प्राप्त करता है और यह प्रकट करता है कि सुधार मापदंडों के एक विरल सेट (sparse set of parameters) से उत्पन्न होते हैं।

Sangjun Park, Elliot Meyerson, Xin Qiu, Risto Miikkulainen2026-05-26
💬 NLP

Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems

यह शोध पत्र **एजेंट प्रिमिटिव्स (Agent Primitives)** को प्रस्तुत करता है, जो मल्टी-एजेंट सिस्टम को पुन: प्रयोज्य लेटेंट बिल्डिंग ब्लॉक्स (समीक्षा, वोटिंग/चयन, और योजना/निष्पादन) में विभाजित करता है जो की-वैल्यू कैश (key-value caches) के माध्यम से संचार करते हैं ताकि कार्य-विशिष्ट आर्किटेक्चर को स्वचालित रूप से संयोजित किया जा सके, जो पारंपरिक टेक्स्ट-आधारित मल्टी-एजेंट सिस्टम की तुलना में सटीकता, दक्षता और स्थिरता में महत्वपूर्ण सुधार करता है।

Haibo Jin, Peng Kuang, Ye Yu, Xiaopeng Yuan, Haohan Wang2026-05-26
💬 NLP

Axis-Aligned Semantics for ODRL: Resolving Dimensional Ambiguity in Policy Constraints

यह शोध पत्र एक अक्ष अपघटन (axis decomposition) विधि पेश करके ODRL स्थानिक बाधाओं में आयामी अस्पष्टता को हल करता है जो बहु-अक्ष ऑपरेंड्स को अक्ष-विशिष्ट स्केलर अंतरालों में परिवर्तित करता है, जिससे बॉक्स तुलना के माध्यम से सुदृढ़ और पूर्ण संघर्ष का पता लगाना सक्षम होता है और इसे एक नई प्रोफ़ाइल तथा व्यापक औपचारिक सत्यापन के माध्यम से मान्य किया गया है।

Daham Mustafa, Diego Collarana, Sabrina Kirrane, Christoph Lange, Christoph Quix, Rafiqul Haque, Yixin Peng, Stefan Deck (…)2026-05-26
🤖 AI

In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models

यह शोध पत्र इस बात की जांच करता है कि क्या बड़े विजन-लैंग्वेज मॉडल (VLMs), मानव-संचालित पिकब्रीडर (Picbreeder) प्रयोगों में देखे गए मुक्त-अंत वाले, रचनात्मक अन्वेषण की नकल कर सकते हैं, और यह पाता है कि हालांकि VLMs विशिष्ट आउटपुट उत्पन्न करते हैं, लेकिन जनरेटिव क्षमता के अंतर को बेहतर ढंग से समझने और संभावित रूप से उसे पाटने के लिए एक्सप्लोरेटरी नॉइज़ (exploratory noise), व्यवहार संबंधी विविधता और मेमोरी जैसे तंत्रों को शामिल करना आवश्यक है।

Sam Earle, Kay Arulkumaran, Andrew Dai, Akarsh Kumar, Julian Togelius, Sebastian Risi2026-05-26
💬 NLP

Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?

यह शोध पत्र प्रकट करता है कि मौजूदा LoRA फ्यूजन विधियाँ पैरामीटर संघर्षों के कारण क्लाउड-एज सहयोग में क्रॉस-डोमेन कार्यों का समर्थन करने में विफल रहती हैं, जिसके कारण लेखक एक प्रून-ट्रेन-रिकवर फ्रेमवर्क और एक संघर्ष-समाधान मॉड्यूल (LoRA-CR) प्रस्तावित करते हैं जो उनके नए पेश किए गए MMLU-CD बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yatong Wang, Fali Wang, Naibin Gu, Zheng Lin, Zhengxiao Liu, Dingyu Yao, Zhiwei Zhang, Jianxin Shi, Weiping Wang2026-05-26
🤖 AI

Context: Proactive Goal-Directed Intelligence via Composable Sandboxed Programs, Declarative Wiring, and Structured Interaction

यह शोधपत्र 'कॉन्टेक्स्ट' (Context) को प्रस्तुत करता है, जो मगरशक आर्किटेक्चर (Magarshak Architecture) के भीतर एक सक्रिय इंटेलिजेंस लेयर है जो कैश दक्षता के लिए राइट-टाइम कॉन्टेक्स्ट असेंबली, नियत निष्पादन के लिए कंपोजेबल सैंडबॉक्स्ड प्रोग्राम्स और स्वायत्त इंटरैक्शन के लिए स्टेट मशीनों का लाभ उठाकर रिएक्टिव चैटबॉट्स को लक्ष्य-निर्देशित एजेंट्स से प्रतिस्थापित करता है, जो लागत में कमी, शुद्धता और प्रदर्शन श्रेष्ठता के औपचारिक प्रमाणों द्वारा समर्थित है।

Gregory Magarshak2026-05-26