🤖 AI

ScholarPeer: A Context-Aware Multi-Agent Framework for Automated Peer Review

ScholarPeer एक संदर्भ-जागरूक मल्टी-एजेंट फ्रेमवर्क है जो एक वरिष्ठ शोधकर्ता के वर्कफ़्लो का अनुकरण करके पीयर रिव्यू प्रक्रिया को सुदृढ़ करता है ताकि प्री-सबमिशन मेंटरशिप और पोस्ट-सबमिशन सत्यापन प्रदान किया जा सके, जो ICLR सबमिशन के एक बड़े पैमाने के डेटासेट पर तकनीकी सुदृढ़ता के ऑडिटिंग और छूटे हुए तुलनाओं की पहचान करने में उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

Palash Goyal, Mihir Parmar, Yiwen Song, Hamid Palangi, Tomas Pfister, Jinsung Yoon2026-05-12
🤖 machine learning

Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers

यह शोध पत्र प्रकट करता है कि ट्रांसफॉर्मर्स में ग्रेडिएंट-आधारित एट्रिब्यूशन (attribution) व्यवस्थित रूप से कारण संबंधी महत्व को गलत पहचानता है, क्योंकि यह अनावश्यक प्रारंभिक-परत घटकों ("ग्रेडिएंट ब्लोट्स") को अत्यधिक महत्व देता है और महत्वपूर्ण अंतिम-परत घटकों ("हिडन हीरोज") को कम आंकता है, जिससे त्रुटिपूर्ण यांत्रिक व्याख्याओं से बचने के लिए कारण सत्यापन (causal validation) आवश्यक हो जाता है।

Donald Ye2026-05-12
🤖 AI

Functional Subspace, where language models can use vector algebra to solve problems

यह शोध पत्र परिकल्पना करता है और प्रमाण प्रदान करता है कि बड़े भाषा मॉडल (large language models) अपने सक्रियण स्थान (activation space) के भीतर कार्यात्मक उप-स्थानों (functional subspaces) का उपयोग करते हैं, जहाँ इन-कॉन्टेक्स्ट लर्निंग (in-context learning) कार्यों को साक्ष्य संचित करने वाले सरल वेक्टर बीजगणितीय ऑपरेशनों के माध्यम से हल किया जाता है।

Jung H. Lee, Sujith Vijayan2026-05-12
🤖 AI

MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics

यह शोधपत्र MathlibLemma को प्रस्तुत करता है, जो एक स्वचालित LLM-आधारित पाइपलाइन है जो Lean Mathlib लाइब्रेरी का विस्तार करने के लिए लुप्त "लोकप्रिय" (folklore) लेम्मा की खोज और औपचारिकीकरण करती है, साथ ही AI-सहायता प्राप्त औपचारिक गणित को आगे बढ़ाने के लिए 4,000 से अधिक सत्यापित गणितीय कथनों का एक व्यापक बेंचमार्क स्थापित करती है।

Xinyu Liu, Zixuan Xie, Amir Moeini, Claire Chen, Shuze Daniel Liu, Yu Meng, Aidong Zhang, Shangtong Zhang2026-05-12
🤖 AI

TodyComm: Task-Oriented Dynamic Communication for Multi-Round LLM-based Multi-Agent System

यह शोध पत्र TodyComm को प्रस्तुत करता है, जो एक कार्य-उन्मुख गतिशील संचार एल्गोरिदम है जो पॉलिसी ग्रेडिएंट के माध्यम से व्यवहार-संचालित टोपोलॉजी को अनुकूल रूप से उत्पन्न करके बहु-चरणीय LLM-आधारित बहु-एजेंट सहयोग को अनुकूलित करता है, जिससे यह टोकन दक्षता और स्केलेबिलिटी बनाए रखते हुए गतिशील प्रतिकूल और बैंडविड्थ-सीमित वातावरणों में निश्चित-संरचना विधियों से बेहतर प्रदर्शन करता है।

Wenzhe Fan, Tommaso Tognoli, Henry Peng Zou, Chunyu Miao, Yibo Wang, Xinhua Zhang2026-05-12
🤖 machine learning

Efficient Estimation of Kernel Surrogate Models for Task Attribution

यह शोध पत्र स्केलेबल टास्क एट्रिब्यूशन के लिए गैररेखीय टास्क इंटरैक्शन को सटीक रूप से पकड़ने हेतु एक कुशल ग्रेडिएंट-आधारित अनुमान प्रक्रिया के साथ कर्नेल सरोगेट मॉडल पेश करता है, जो ग्राउंड ट्रुथ के साथ सहसंबंध और डाउनस्ट्रीम डेटा चयन प्रदर्शन के मामले में लीनियर सरोगेट्स और इन्फ्लुएंस फंक्शन्स से काफी बेहतर प्रदर्शन करता है।

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang2026-05-12
🤖 AI

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

यह शोध पत्र Agent-Omit को पेश करता है, जो एक एकीकृत प्रशिक्षण ढांचा (unified training framework) है जो कोल्ड-स्टार्ट फाइन-ट्यूनिंग और ओमिट-अवेयर रीइन्फोर्समेंट लर्निंग के माध्यम से LLM एजेंटों को अनावश्यक विचारों और अवलोकनों को अनुकूल रूप से छोड़ने में सक्षम बनाकर उनकी दक्षता को बढ़ाता है, जिससे कई बेंचमार्क में बेहतर प्रभावशीलता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu2026-05-12
🤖 AI

SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization

यह शोध पत्र SE-Bench प्रस्तुत करता है, जो एक नैदानिक वातावरण (diagnostic environment) है जो पूर्व ज्ञान और तर्क जटिलता से ज्ञान के आंतरिककरण (knowledge internalization) को अलग करके स्वयं-विकास (self-evolution) का कड़ाई से बेंचमार्किंग करने के लिए NumPy लाइब्रेरी को अस्पष्ट (obfuscate) करता है, जिससे यह पता चलता है कि नए ज्ञान को मॉडल के भार (weights) में समाहित करने के लिए ओपन-बुक ट्रेनिंग या मानक RL की तुलना में क्लोज्ड-बुक ट्रेनिंग और सेल्फ-प्ले अधिक प्रभावी हैं।

Jiarui Yuan, Tailin Jin, Weize Chen, Zeyuan Liu2026-05-12
🤖 AI

When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) द्वारा व्यक्त की गई संभाव्यता मान्यताओं (probability beliefs) और उनके निर्णयों के बीच निरंतरता को सत्यापित करने के लिए एक निर्णय-सैद्धांतिक ढांचे (decision-theoretic framework) का प्रस्ताव करता है, जो यह प्रकट करता है कि जहाँ सबसे शक्तिशाली मॉडल भी अपनी घोषित मान्यताओं और कार्यों के बीच मामूली विसंगतियों को प्रदर्शित करते हैं, वहीं ये मान्यताएँ उन सूचनाओं का पूर्ण सारांश नहीं हैं जो उनके विकल्पों को संचालित करती हैं।

Khurram Yamin, Jingjing Tang, Santiago Cortes-Gomez, Amit Sharma, Eric Horvitz, Bryan Wilder2026-05-12
🤖 AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

Hyper एक प्रशिक्षण-मुक्त (training-free), ऑनलाइन नियंत्रण नीति है जो मिश्रण-विशेषज्ञों (mixture-of-experts) वाले मॉडलों के लिए विस्तार, टोकन-स्तरीय परिशोधन और विश्वास-आधारित एकत्रीकरण के माध्यम से परिकल्पना पूल (hypothesis pool) का प्रबंधन करके परीक्षण-समय तर्क (test-time reasoning) के दौरान अन्वेषण (exploration) और शोषण (exploitation) को गतिशील रूप से संतुलित करती है, जिससे टोकन उपयोग को कम करते हुए सटीकता में उल्लेखनीय सुधार होता है।

Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li2026-05-12