💬 NLP

GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations

यह शोध पत्र GSM-SEM को प्रस्तुत करता है, जो एक स्टोकेस्टिक ढांचा (stochastic framework) है जो LLM मूल्यांकन में मेमोराइजेशन बायस (memorization bias) को कम करने के लिए अर्थपूर्ण रूप से विविध और तथ्यात्मक रूप से परिवर्तित बेंचमार्क वेरिएंट उत्पन्न करता है, जो इन गतिशील रूप से पुनर्जीवित डेटासेट पर परीक्षण किए जाने पर अत्याधुनिक मॉडलों के प्रदर्शन में महत्वपूर्ण गिरावट को प्रकट करता है।

Jyotika Singh, Fang Tu, Aziza Mirzadova, Amit Agarwal, Hitesh Laxmichand Patel, Sandip Ghoshal, Miguel Ballesteros, Yass (…)2026-05-11
🤖 machine learning

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

डॉ. पोस्ट-ट्रेनिंग (Dr. Post-Training) एक नवीन रूपरेखा प्रस्तुत करता है जो प्रचुर सामान्य प्रशिक्षण डेटा को स्कर्स (scarce) लक्ष्य डेटा पर ओवरफिटिंग को रोकने के लिए एक डेटा-प्रेरित रेगुलराइज़र (data-induced regularizer) के रूप में पुनर्गठित करता है, जिससे अपडेट दिशाओं को एक व्यवहार्य सेट (feasible set) पर प्रोजेक्ट किया जाता है, और इस प्रकार न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ SFT, RLHF और RLVR कार्यों में मौजूदा डेटा चयन विधियों से बेहतर प्रदर्शन करता है।

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma2026-05-11
🤖 AI

2.5-D Decomposition for LLM-Based Spatial Construction

यह शोध पत्र 2.5-D अपघटन (decomposition) का उपयोग करने वाले एक न्यूरो-सिम्बोलिक पाइपलाइन को प्रस्तुत करता है जो मॉडल को 2D योजना बनाने तक सीमित रखकर और एक नियतात्मक निष्पादक (deterministic executor) को ऊर्ध्वाधर प्लेसमेंट संभालने देकर LLM-आधारित स्थानिक निर्माण सटीकता में महत्वपूर्ण सुधार करता है, जिससे बेंचमार्क पर सीलिंग-स्तर का प्रदर्शन प्राप्त होता है और एज हार्डवेयर एवं विविध सहयोगात्मक कार्यों में सफल स्थानांतरण प्रदर्शित होता है।

Paul Whitten, Li-Jen Chen, Sharath Baddam2026-05-11
🤖 AI

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

यह शोध पत्र टीमबेंच (TeamBench) का परिचय देता है, जो एजेंट समन्वय का कठोरता से मूल्यांकन करने के लिए ऑपरेटिंग सिस्टम द्वारा लागू भूमिका पृथक्करण (role separation) का उपयोग करता है, जिससे यह प्रकट होता है कि जबकि केवल प्रॉम्प्ट-आधारित और सैंडबॉक्स-लक्षित टीमें समान पास दर प्राप्त करती हैं, लागू पृथक्करण भूमिका के अतिरेक (role overreach) और अप्रभावी सत्यापन जैसी महत्वपूर्ण खामियों को उजागर करता है जिन्हें मानक मेट्रिक्स अक्सर अनदेखा कर देते हैं।

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin (…)2026-05-11
🤖 AI

Learning Visual Feature-Based World Models via Residual Latent Action

यह शोध पत्र RLA वर्ल्ड मॉडल को प्रस्तुत करता है, जो कुशल, उच्च-निष्ठा वाले विज़ुअल फीचर प्रेडिक्शन प्राप्त करने और बिना ऑनलाइन इंटरेक्शन या हस्तनिर्मित रिवार्ड्स के ऑफलाइन वीडियो से उन्नत रोबोट लर्निंग को सक्षम करने के लिए DINO रेसिडुअल्स से सीखे गए और फ्लो मैचिंग के माध्यम से प्रेडिक्ट किए गए एक नवीन रेसिडुअल लेटेंट एक्शन रिप्रेजेंटेशन का लाभ उठाता है।

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias2026-05-11
💬 NLP

The Translation Tax Is Not a Scalar: A Counterfactual Audit of English-Source Cue Inheritance in Chinese Multilingual Benchmarks

यह शोध पत्र यह प्रदर्शित करके अंग्रेजी-से-चीनी बेंचमार्क में एक समान "अनुवाद कर" (Translation Tax) की धारणा को चुनौती देता है कि स्कोर मुद्रास्फीति एक स्केलर प्रभाव नहीं है बल्कि विशिष्ट वैधता जोखिमों और मॉडल-परिवार अंतःक्रियाओं द्वारा संचालित एक जटिल, मद-निर्भर घटना है, और अंततः इन सूक्ष्म मुद्दों को संबोधित करने के लिए एक नया स्वाभाविककरण प्रोटोकॉल और रिपोर्टिंग चेकलिस्ट प्रस्तावित करता है।

Zezheng Lin, Fengming Liu, Handi Li2026-05-11
💬 NLP

Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation

यह शोध पत्र MoLF को प्रस्तुत करता है, जो एक एकीकृत फाइन-ट्यूनिंग फ्रेमवर्क है जो स्थिर दृष्टिकोणों की संरचनात्मक सीमाओं को दूर करने के लिए ऑप्टिमाइज़र स्तर पर फुल फाइन-ट्यूनिंग और लो-रैंक अडैप्टेशन के बीच ग्रेडिएंट अपडेट को गतिशील रूप से रूट करता है, जिससे विविध कार्यों और मॉडल आकारों में बेहतर या तुलनीय प्रदर्शन प्राप्त होता है और साथ ही एक मेमोरी-कुशल संस्करण भी प्रदान किया जाता है।

Haozhan Tang, Xiuqi Zhu, Xinyin Zhang, Boxun Li, Virginia Smith, Kevin Kuo2026-05-11
🤖 AI

Switchcraft: AI Model Router for Agentic Tool Calling

यह शोधपत्र Switchcraft को प्रस्तुत करता है, जो विशेष रूप से एजेंटिक टूल कॉलिंग (agentic tool calling) के लिए अनुकूलित पहला मॉडल राउटर है, जो कार्य की शुद्धता सुनिश्चित करने वाले सबसे कम लागत वाले मॉडल का गतिशील रूप से चयन करके 84% अनुमान लागत (inference costs) को कम करते हुए 82.9% सटीकता प्राप्त करता है।

Sharad Agarwal, Pooria Namyar, Alec Wolman, Rahul Ambavat, Ankur Gupta, Qizheng Zhang2026-05-11
🤖 AI

An Embarrassingly Simple Graph Heuristic Reveals Shortcut-Solvable Benchmarks for Sequential Recommendation

यह शोध पत्र प्रकट करता है कि व्यापक रूप से उपयोग किए जाने वाले अनुक्रमिक अनुशंसा बेंचमार्क अक्सर एक सरल, प्रशिक्षण-मुक्त ग्राफ ह्यूरिस्टिक द्वारा "शॉर्टकट-सुलझाने योग्य" होते हैं, जो यह सुझाव देता है कि इन डेटासेट पर मजबूत प्रदर्शन आधुनिक जनरेटिव रिकमेंडर्स द्वारा दावा की गई उन्नत मॉडलिंग क्षमताओं के बजाय विशिष्ट डेटासेट गुणों को दर्शाता है।

Haoyu Han, Li Ma, Hanbing Wang, Bingheng Li, Daochen Zha, Chun How Tan, Huiji Gao, Xin Liu, Stephanie Moyerman, Sanjeev (…)2026-05-11
🤖 AI

RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation

यह शोध पत्र RRCM का प्रस्ताव करता है, जो एक रैंकिंग-संचालित ढांचा है जो LLM-आधारित अनुशंसाकर्ताओं (recommenders) को प्राकृतिक भाषा इंटरफेस के माध्यम से सहयोगी और मेटाडेटा स्मृतियों को गतिशील रूप से पुनर्प्राप्त करने और उन पर तर्क करने में सक्षम बनाता है, जिससे संदर्भ-दक्षता बाधाओं को दूर करने और अनुशंसा गुणवत्ता में सुधार करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के माध्यम से सीधे पुनर्प्राप्ति निर्णयों को अनुकूलित किया जाता है।

Shijun Li, Wooseong Yang, Yu Wang, Tianxin Wei, Joydeep Ghosh2026-05-11