💬 NLP

Human-like fleeting memory improves language learning but impairs reading time prediction in transformer language models

यह अध्ययन प्रदर्शित करता है कि ट्रांसफॉर्मर लैंग्वेज मॉडल्स में मानव-समान क्षणिक स्मृति (fleeting memory) को शामिल करने से उनकी भाषा सीखने की क्षमताओं में वृद्धि होती है, लेकिन अप्रत्याशित रूप से यह मानव पठन समय (reading times) की भविष्यवाणी करने की उनकी क्षमता को बाधित करता है, जो यह सुझाव देता है कि स्मृति सीमाएं भाषाई अधिग्रहण के लिए न्यूरल नेटवर्क के लाभ के लिए उपयोगी हैं बिना अनिवार्य रूप से व्यवहार संबंधी भविष्यवाणी में सुधार किए।

Abishek Thamma, Micha Heilbron2026-05-11
💬 NLP

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

यह शोध पत्र यह प्रदर्शित करते हुए अनुसंधान में मानव प्रतिभागियों के विकल्प के रूप में लार्ज लैंग्वेज मॉडल एजेंटों के उपयोग की वैधता को चुनौती देता है कि, मनुष्यों के समान प्रतिक्रियाएं उत्पन्न करने के बावजूद, उनमें विभिन्न प्रयोगात्मक सेटिंग्स में वह मौलिक व्यवहारिक निरंतरता का अभाव है जो वास्तविक मानव व्यवहार का सटीक प्रतिनिधित्व करने के लिए आवश्यक है।

James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang2026-05-11
💬 NLP

User eXperience Perception Insights Dataset (UXPID): Synthetic User Feedback from Public Industrial Forums

यह शोध पत्र UXPID प्रस्तुत करता है, जो औद्योगिक मंचों (industrial forums) से 7,130 गुमनाम उपयोगकर्ता फीडबैक शाखाओं का एक सिंथेटिक डेटासेट है, जिसे गोपनीयता और लाइसेंसिंग बाधाओं को संबोधित करते हुए UX विश्लेषण, आवश्यकताओं के निष्कर्षण (requirements extraction) और AI-संचालित फीडबैक प्रोसेसिंग में अनुसंधान का समर्थन करने के लिए LLMs द्वारा एनोटेट किया गया है।

Mikhail Kulyabin, Jan Joosten, Choro Ulan uulu, Nuno Miguel Martins Pacheco, Fabian Ries, Filippos Petridis, Jan Bosch (…)2026-05-11
💬 NLP

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

यह शोध पत्र एक एकीकृत, सैद्धांतिक रूप से आधारित ढांचा प्रस्तावित करता है जो विजन-लैंग्वेज मॉडल्स में सिद्धांत-आधारित लेयर स्किपिंग को सक्षम करने के लिए प्रयोगात्मक रूप से सत्यापन योग्य रेडंडेंसी स्थितियों को परिभाषित करता है, जिससे प्रदर्शन से समझौता किए बिना अनुमान दक्षता में सुधार होता है।

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney2026-05-11
💬 NLP

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher एक LLM-आधारित एजेंट फ्रेमवर्क है जो एक कॉम्पैक्ट मेमोरी मैकेनिज्म और एक नवीन मल्टी-कॉन्टेक्स्ट GRPO ट्रेनिंग एल्गोरिदम का उपयोग करता है ताकि मल्टी-टर्न सर्च कार्यों के लिए कुशल, एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) प्राप्त किया जा सके, जो स्थिर कॉन्टेक्स्ट लंबाई बनाए रखते हुए पारंपरिक हिस्ट्री-कॉन्कैटेनेशन बेसलाइन्स से बेहतर प्रदर्शन करता है।

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han2026-05-11
💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

यह शोध पत्र तर्क देता है कि चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) प्रॉम्प्ट-इंजेक्टेड संकेतों (prompt-injected hints) को स्पष्ट रूप से मौखिक रूप से व्यक्त किए बिना भी निष्ठावान (faithful) हो सकती है, जो अपूर्णता को निष्ठाहीनता के साथ मिलाने वाले "बायसिंग फीचर्स" (Biasing Features) मीट्रिक को चुनौती देता है और एक व्यापक व्याख्यात्मक टूलकिट (interpretability toolkit) की वकालत करता जिसमें कॉज़ल मीडिएशन एनालिसिस (causal mediation analysis) शामिल है।

Kerem Zaman, Shashank Srivastava2026-05-11
💬 NLP

Neural Neural Scaling Laws

यह शोधपत्र न्यूरल न्यूरल स्केलिंग लॉज़ (NeuNeu) को प्रस्तुत करता है, जो एक न्यूरल नेटवर्क-आधारित दृष्टिकोण है जो डाउनस्ट्रीम टास्क परफॉरमेंस प्रेडिक्शन को टाइम-सीरीज एक्सट्रपलेशन समस्या के रूप में फ्रेम करके पारंपरिक पैरामीट्रिक मॉडलों से बेहतर प्रदर्शन करता है, जिससे विविध मॉडल परिवारों और कार्यों में काफी कम त्रुटि दर और ज़ीरो-शॉट जनरलाइजेशन हासिल होता है।

Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho2026-05-11
💬 NLP

Can David Beat Goliath? On Multi-Hop Reasoning with Resource-Constrained Agents

यह शोध पत्र David-GRPO को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो उपयोगी प्रशिक्षण पथों की कमी को दूर करने के लिए साक्ष्य-निर्देशित ऑन-पॉलिसी अन्वेषण (evidence-guided on-policy exploration) को ऑफ-पॉलिसी विशेषज्ञ बूटस्ट्रैपिंग (off-policy expert bootstrapping) के साथ जोड़कर संसाधन-बाधित एजेंटों में मल्टी-हॉप तर्क (multi-hop reasoning) को बढ़ाता है और मल्टी-हॉप QA बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त करता है।

Hojae Han, Heeyun Jung, Jongyoon Kim, Seung-won Hwang2026-05-11
💬 NLP

WorldCup Sampling for Multi-bit LLM Watermarking

यह शोध पत्र WorldCup को प्रस्तुत करता है, जो एक मल्टी-बिट वॉटरमार्किंग फ्रेमवर्क है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए है और जो मौजूदा विधियों की तुलना में संदेश क्षमता, मजबूती और टेक्स्ट गुणवत्ता के बीच एक बेहतर संतुलन प्राप्त करने के लिए एक पदानुक्रमित प्रतिस्पर्धा तंत्र (hierarchical competition mechanism) और एंट्रॉपी-जागरूक मॉड्यूलेशन (entropy-aware modulation) का उपयोग करता है।

Yidan Wang, Yubing Ren, Yanan Cao, Li Guo2026-05-11
💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

यह शोध पत्र एक नवीन डायनेमिक क्लिपिंग तंत्र का प्रस्ताव देकर 'वेरिफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) में एंट्रॉपी कोलैप्स को संबोधित करता है, जो पॉलिसी एंट्रॉपी को सटीक रूप से नियंत्रित करने के लिए एक ग्रेडिएंट-प्रिजर्विंग परिप्रेक्ष्य का लाभ उठाता है, जिससे समयपूर्व अति-आत्मविश्वास को रोका जा सके और एलएलएम (LLM) तर्क प्रदर्शन को बढ़ाया जा सके।

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao2026-05-11