💬 NLP

The Frequency Confound in Language-Model Surprisal and Metaphor Novelty

यह शोध पत्र यह प्रदर्शित करता है कि लेक्सिकल फ्रीक्वेंसी (lexical frequency), लैंग्वेज-मॉडल सरप्राइज़ल (language-model surprisal) के बजाय रूपक नवीनता (metaphor novelty) का प्राथमिक भविष्यवक्ता है, जो यह सुझाव देता है कि सरप्राइज़ल और रूपक प्रसंस्करण (metaphor processing) के बीच पूर्व में रिपोर्ट किए गए सहसंबंध फ्रीक्वेंसी प्रभावों द्वारा भ्रमित (confounded) हो सकते हैं।

Omar Momen, Sina Zarrieß2026-05-08
💬 NLP

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

यह शोध पत्र STALE को प्रस्तुत करता है, जो एक बेंचमार्क और मूल्यांकन ढांचा है जिसे उन "अंतर्निहित संघर्षों" (implicit conflicts) का पता लगाने और उन्हें हल करने की लार्ज लैंग्वेज मॉडल एजेंटों की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है जहाँ नया साक्ष्य बिना किसी स्पष्ट निषेध के पूर्व स्मृतियों को अमान्य कर देता है, जो वर्तमान मॉडलों की स्टेट-अवेयरनेस (state-awareness) में महत्वपूर्ण अंतराल को प्रकट करता है और मजबूत मेमोरी रिवीज़न (memory revision) में सुधार के लिए एक प्रोटोटाइप के रूप में CUPMem का प्रस्ताव करता है।

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun2026-05-08
💬 NLP

Efficient Pre-Training with Token Superposition

यह शोध पत्र टोकन-सुपरपोजिशन ट्रेनिंग (TST) को पेश करता है, जो एक ड्रॉप-इन विधि है जो मॉडल आर्किटेक्चर या पैरेललिज्म को संशोधित किए बिना, कुशल मल्टी-हॉट क्रॉस-एन्ट्रॉपी ट्रेनिंग के लिए शुरू में टोकन को बैग्स में संयोजित करके, प्री-ट्रेनिंग डेटा थ्रूपुट में महत्वपूर्ण सुधार करती है और कुल प्रशिक्षण समय को 2.5 गुना तक कम करती है।

Bowen Peng, Théo Gigant, Jeffrey Quesnelle2026-05-08
💬 NLP

Long Context Pre-Training with Lighthouse Attention

यह शोधपत्र लाइटहाउस अटेंशन (Lighthouse Attention) को प्रस्तुत करता है, जो एक प्रशिक्षण-मात्र (training-only), ग्रेडिएंट-मुक्त पदानुक्रमित चयन एल्गोरिदम है जो अत्यधिक अनुक्रम लंबाई पर कॉज़ल ट्रांसफॉर्मर्स के कुशल उप-द्विघाती (subquadratic) प्री-ट्रेनिंग को सक्षम करने के लिए मानक स्केल्ड डॉट-प्रोडक्ट अटेंशन को रैप करता है, जिसे एक संक्षिप्त रिकवरी चरण के माध्यम से निर्बाध रूप से हटाया जा सकता है ताकि तेज़ प्रशिक्षण और कम अंतिम हानि वाले पूर्ण अटेंशन मॉडल को प्राप्त किया जा सके।

Bowen Peng, Subho Ghosh, Jeffrey Quesnelle2026-05-08
💬 NLP

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

यह शोध पत्र UniSD का प्रस्ताव करता है, जो एक एकीकृत स्व-डिस्टिलेशन (self-distillation) ढांचा है जो बड़े भाषा मॉडलों (large language models) में पर्यवेक्षण विश्वसनीयता (supervision reliability) और प्रशिक्षण स्थिरता (training stability) को संबोधित करने के लिए पूरक तंत्रों को व्यवस्थित रूप से एकीकृत करता है, जिससे अधिक शक्तिशाली बाहरी शिक्षकों (external teachers) पर निर्भर किए बिना विविध बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi Luo, Haoxin Liu, B. Aditya Prakash, Josiah Hester, Jindong Wang (…)2026-05-08
💬 NLP

Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

यह शोध पत्र "एल्गोस्पीक" (Algospeak) बचाव रणनीतियों में पहचान क्षमता (detectability) और बोधगम्यता (comprehensibility) के बीच के संतुलन का विश्लेषण करने के लिए एक औपचारिक रूपरेखा और डेटासेट प्रस्तुत करता है, जो यह मापने के लिए एक "मेजोरिटी अंडरस्टैंडेबल मॉड्यूलेशन" (Majority Understandable Modulation) थ्रेशोल्ड को परिभाषित करता है कि भाषाई परिवर्तन मानव समझ और एआई डिटेक्शन दोनों को कैसे प्रभावित करते हैं।

Jan Fillies, Ronald E. Robertson, Jeffrey Hancock2026-05-08
💬 NLP

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO एक नवीन ढांचा है जो स्थानीय एजेंट उद्देश्यों को वैश्विक प्रणाली लक्ष्यों के साथ संरेखित करने के लिए एक संयुक्त मूल्यांकन तंत्र और विकासवादी बीम सर्च का उपयोग करके LLM-आधारित मल्टी-एजेंट सिस्टम के लिए प्रॉम्प्ट्स को स्वचालित रूप से अनुकूलित करता है, जिससे यह विविध सहयोगात्मक कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang2026-05-08
💬 NLP

Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

यह शोध पत्र एक नवीन मूल्यांकन ढांचे को प्रस्तुत करता है जो लिंक वैधता, प्रासंगिकता और तथ्यात्मक सटीकता के आधार पर LLM-जनित शोध रिपोर्टों का आकलन करने के लिए एक AST पार्सर का उपयोग करता है, जो एक महत्वपूर्ण विच्छेद को प्रकट करता है जहाँ अग्रिम मॉडल (frontier models) उच्च उद्धरण सुलभता और प्रासंगिकता बनाए रखते हुए भी तथ्यात्मक निरंतरता के लिए संघर्ष करते हैं, एक ऐसी समस्या जो रिट्रीवल की गहराई बढ़ने के साथ और भी खराब हो जाती है।

Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld2026-05-08
💬 NLP

Recursive Agent Optimization

यह शोध पत्र रिकर्सिव एजेंट ऑप्टिमाइज़ेशन (RAO) को पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एजेंटों को उप-कार्यों को स्वयं को पुनरावर्ती रूप से सौंपने के लिए प्रशिक्षित करता है, जिससे प्रशिक्षण दक्षता में सुधार होता है, संदर्भ सीमाओं से परे मापनीयता (scalability) सक्षम होती है, और विभाजित करो और जीतो (divide-and-conquer) की रणनीतियों के माध्यम से जटिल समस्याओं में सामान्यीकरण को बढ़ाता है।

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig2026-05-08
💬 NLP

Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients

यह शोध पत्र पॉजिटिव-ओनली पॉलिसी ऑप्टिमाइज़ेशन (POPO) को प्रस्तुत करता है, जो एक नवीन RLVR फ्रेमवर्क है जो GRPO की तुलना में बेहतर गणितीय तर्क प्रदर्शन प्राप्त करने के लिए बाउंडेड इम्पोर्टेंस सैंपलिंग और इम्प्लिसिट नेगेटिव ग्रेडिएंट्स का लाभ उठाकर नेगेटिव रोलआउट्स की आवश्यकता को समाप्त करता है।

Mingwei Xu, Hao Fang2026-05-08