💬 NLP

CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation

यह शोध पत्र जटिल कार्य निर्भरताओं और मानव-संरेखित उपयोगकर्ता सिमुलेशन वाले वास्तविक सेवा परिदृश्यों में LLM एजेंटों का मूल्यांकन करने के लिए CRAB-Bench और RUSE को प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल इन चुनौतियों के साथ, विशेष रूप से सूचना प्रकटीकरण जैसे अपूर्ण उपयोगकर्ता व्यवहारों का सामना करते समय, काफी संघर्ष करते हैं।

Danqing Wang, Akshay Sivaraman, Lei Li2026-06-02
💬 NLP

TalkTag: Fine-Grained Morphosyntactic Error Annotation for Transcribed Speech

यह शोध पत्र TalkTag को प्रस्तुत करता है, जो कि सीमित डेटा पर फाइन-ट्यून किया गया एक LLM-आधारित टूल है, जो ट्रांसक्राइब की गई स्पीच में सूक्ष्म रूप-रचनात्मक (morphosyntactic) त्रुटियों के एनोटेशन को स्वचालित करने के लिए बनाया गया है, जो नैदानिक और विकासात्मक भाषा अनुसंधान के लिए श्रम-गहन मैनुअल विधियों के एक स्केलेबल और सटीक विकल्प के रूप में कार्य करता है।

Shamira Venturini (Karlsruhe Institute of Technology, Karlsruhe University of Applied Sciences), Oliver Hennhöfer (Karls (…)2026-06-02
💬 NLP

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

LayerRoute एक हल्का, LoRA-आधारित एडैप्टर है जो एजेंटिक लैंग्वेज मॉडल्स के लिए है जो इन्फरेंस के दौरान ट्रांसफॉर्मर ब्लॉक्स को गतिशील रूप से स्किप करता है, जिससे जटिल रीजनिंग कार्यों पर प्रदर्शन को बनाए रखते हुए टूल कॉल्स के लिए कंप्यूटेशनल लागत को काफी कम कर दिया जाता है।

Prateek Kumar Sikdar2026-06-02
💬 NLP

Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses

यह शोध पत्र गैर-मौखिक प्रतिक्रियाओं से व्यावहारिक अर्थ निकालने की बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की क्षमता का पहला व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि वे मौखिक कार्यों की तुलना में ऐसे कार्यों के साथ काफी संघर्ष करते हैं लेकिन इन-कॉन्टेक्स्ट लर्निंग (इन-कॉन्टेक्स्ट लर्निंग) के माध्यम से बेहतर प्रदर्शन दिखाते हैं।

Sugyeong Eo, Heuiseok Lim2026-06-02
🤖 machine learning

ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?

यह शोधपत्र ContinuousBench को प्रस्तुत करता है, जो एक गतिशील रूप से पुन: उत्पन्न होने वाला बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि क्या विभेदक रूप से निजी (differentially private) सिंथेटिक टेक्स्ट संवेदनशील कॉर्पोरा से वास्तविक ज्ञान को स्थानांतरित कर सकता है, जिससे यह पता चलता है कि जबकि गैर-निजी संश्लेषण सफल होता है, वर्तमान अत्याधुनिक विभेदक रूप से निजी विधियाँ उच्च गोपनीयता बजट पर भी ऐसा करने में विफल रहती हैं।

Peihan Liu, Lucas Rosenblatt, Weiwei Kong, Natalia Ponomareva, Gautam Kamath, Rachel Cummings, Roxana Geambasu, Yu Gan (…)2026-06-02
💬 NLP

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (LLMs) में "स्थानिक शाब्दिक पूर्वाग्रह" (spatial lexical bias) की पहचान और निदान करता है, यह प्रकट करते हुए कि उनकी स्थानिक तर्क संबंधी विफलताएं अक्सर दृश्य धारणा के बजाय भाषा-पक्षीय तंत्रों से उत्पन्न होती हैं, और यह प्रदर्शित करता है कि एक हल्का LLM-केवल फाइन-ट्यूनिंग दृष्टिकोण इस पूर्वाग्रह को प्रभावी ढंग से कम करने और कई डेटासेट्स में मजबूती को महत्वपूर्ण रूप से सुधारने के लिए प्रभावी है।

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi2026-06-02
💬 NLP

Mitigating Bias in Locally Constrained Decoding via Tractable Proposals

यह शोध पत्र टेंसरयुक्त परिमित ऑटोमेटा (tensorized finite automata) और सर्किट गुणन के माध्यम से सुलभ, वैश्विक रूप से बाधित प्रस्तावों का निर्माण करके स्थानीय रूप से बाधित डिकोडिंग में पूर्वाग्रह को कम करने के लिए एक सामान्य दृष्टिकोण प्रस्तावित करता है, जो फंक्शन कॉलिंग और SQL जनरेशन जैसे कार्यों में कम कणों (particles) के साथ लक्ष्य वितरण की ओर तेजी से अभिसरण करने वाले कुशल अनुक्रमिक मोंटे कार्लो (Sequential Monte Carlo) सैंपलिंग को सक्षम बनाता है।

Meihua Dang, Linxin Song, Honghua Zhang, Jieyu Zhao, Guy Van den Broeck, Stefano Ermon2026-06-02
🤖 machine learning

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

HMPO एक लागत प्रभावी, एकल-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विविध कार्यों और मॉडल स्केल्स में नगण्य सटीकता हानि के साथ चेन-ऑफ-थॉट रीजनिंग को 19%–46% तक कुशलतापूर्वक संकुचित करता है, जो मौजूदा विधियों में मैनुअल ट्यूनिंग और बहु-चरणीय प्रशिक्षण की सीमाओं को दूर करता है।

Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Z (…)2026-06-02
💬 NLP

Eyettention II: A Dual-Sequence Architecture for Modeling Fixation Location, Within-Word Landing Position, and Fixation Duration in Reading

आई-ट्रैकिंग डेटा की कमी को दूर करने के लिए, यह शोध पत्र 'एयेटेंशन II' (Eyettention II) पेश करता है, जो एक हल्का, एंड-टू-एंड डीप लर्निंग मॉडल है जो संज्ञानात्मक सिद्धांतों के साथ संरेखित होकर और मानव जैसे दृष्टि व्यवहार (gaze behavior) की भविष्यवाणी करने में अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करते हुए, यथार्थवादी, बहु-गुण वाले रीडिंग स्कैनपाथ उत्पन्न करता है।

Shuwen Deng, Cui Ding, David R. Reich, Paul Prasse, Lena A. Jäger2026-06-02
💬 NLP

Training Prompt Matters: State-Adaptive Optimization for Robust Fine-Tuning

यह शोध पत्र स्टेट-अडैप्टिव प्रॉम्प्ट ऑप्टिमाइज़ेशन (SAPO) को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग रणनीति है जो कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) को कम करने और लर्निंग डायनेमिक्स पर प्रॉम्प्ट फॉर्मूलेशन के महत्वपूर्ण, फिर भी पहले अनदेखे किए गए प्रभाव का लाभ उठाकर सामान्यीकरण को बढ़ाने के लिए प्री-लर्निंग टास्क लॉस के आधार पर प्रशिक्षण प्रॉम्प्ट्स को गतिशील रूप से समायोजित करती है।

Wenhang Shi, Yiren Chen, Shuqing Bian, Zhe Zhao, Jinhao Dong, Pengfei Hu, Wei Lu, Xiaoyong Du2026-06-02