💬 NLP

TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents

TiMem एक नवीन टेम्पोरल-हायरार्किकल मेमोरी फ्रेमवर्क पेश करता है जो लंबी अवधि के संवादात्मक इतिहास को व्यवस्थित रूप से समेकित और संगठित करने के लिए एक टेम्पोरल मेमोरी ट्री का उपयोग करता है, जिससे सिमेंटिक-गाइडेड इंटीग्रेशन और कॉम्प्लेक्सिटी-अवेयर रिट्रीवल के माध्यम से रिकॉल की गई मेमोरी की लंबाई को काफी कम करते हुए मेमोरी बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

Kai Li, Xuanqing Yu, Ziyi Ni, Yi Zeng, Yao Xu, Zheqing Zhang, Xin Li, Jitao Sang, Xiaogang Duan, Xuelei Wang, Chengbao L (…)2026-05-01
💻 computer science

DeepTutor: Towards Agentic Personalized Tutoring

यह शोध पत्र DeepTutor को प्रस्तुत करता है, जो एक ओपन-सोर्स, एजेंट-नेटिव फ्रेमवर्क है जो अनुकूलित, व्यक्तिगत शिक्षण अनुभव प्रदान करने के लिए एक हाइब्रिड पर्सनलाइजेशन इंजन और एक क्लोज्ड ट्यूटरिंग लूप का उपयोग करता है, जिसे नए छात्र-केंद्रित TutorBench बेंचमार्क द्वारा प्रमाणित किया गया है।

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang2026-05-01
💬 NLP

BatteryPass-12K: The First Dataset for the Novel Digital Battery Passport Conformance Task

यह शोध पत्र BatteryPass-12K प्रस्तुत करता है, जो डिजिटल बैटरी पासपोर्ट अनुपालन वर्गीकरण के लिए पहला सार्वजनिक सिंथेटिक बेंचमार्क है, और 22 भाषा मॉडलों का मूल्यांकन करते हुए यह प्रकट करता है कि जबकि थिंकिंग मॉडल्स (thinking models) और फ्यू-शॉट लर्निंग (few-shot learning) सर्वोत्तम परिणाम देते हैं, केवल पैरामीटर स्केलिंग बेहतर प्रदर्शन की गारंटी नहीं देती है और मॉडल प्रॉम्प्ट-इंजेक्शन हमलों के प्रति संवेदनशील बने रहते हैं।

Tosin Adewumi, Martin Karlsson, Lama Alkhaled, Marcus Liwicki2026-05-01
💬 NLP

Hypencoder Revisited: Reproducibility and Analysis of Non-Linear Scoring for First-Stage Retrieval

यह शोध पत्र हाइपएनकोडर (Hypencoder) फ्रेमवर्क का एक पुनरुत्पादकता अध्ययन और विस्तारित विश्लेषण प्रस्तुत करता है, जो अधिकांश बेंचमार्क पर मानक बायो-एनकोडर्स (bi-encoders) की तुलना में इसके बेहतर प्रदर्शन की पुष्टि करता है, साथ ही यह भी प्रकट करता है कि इसकी गैर-रेखीय स्कोरिंग (non-linear scoring) कोई सुसंगत प्रतिकूल मजबूती (adversarial robustness) लाभ प्रदान नहीं करती है और मानक बायो-एनकोडर्स क्वेरी विलंबता (query latency) के मामले में तेज़ बने हुए हैं।

Arne Eichholtz, Yongkang Li, Jutte Vijverberg, Tobias Groot, Mohammad Aliannejadi2026-05-01
💬 NLP

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

यह शोध पत्र LenVM को प्रस्तुत करता है, जो एक स्केलेबल, एनोटेशन-मुक्त फ्रेमवर्क है जो शेष जनरेशन लंबाई को टोकन-स्तरीय मान संकेत (value signal) के रूप में मॉडल करता है, जिससे सटीक लंबाई मिलान में महत्वपूर्ण सुधार होता है और ऑटोरेग्रेसिव मॉडलों में प्रदर्शन-दक्षता के बीच निरंतर नियंत्रण सक्षम होता है।

Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Z (…)2026-05-01
💬 NLP

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

यह शोधपत्र कार्य-विशिष्ट भाषा मॉडलों पर व्यवस्थित प्रूनिंग (pruning) प्रयोगों के माध्यम से यह प्रदर्शित करता है कि न्यूरॉन्स प्रदर्शन में गैर-समान रूप से योगदान देते हैं, जिससे यह पता चलता है कि अत्यधिक विशिष्ट न्यूरॉन्स का एक छोटा उपसमुच्चय कार्य की सफलता के लिए महत्वपूर्ण है, जबकि शेष नेटवर्क में रेडंडेंसी (redundancy) मौजूद है जिसे सुरक्षित रूप से प्रून किया जा सकता है और बाद में फाइन-ट्यूनिंग के माध्यम से पुनः प्राप्त किया जा सकता है।

M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan (…)2026-05-01
💬 NLP

Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

यह शोध पत्र छह भाषाओं में क्लॉड (Claude) की क्रॉस-लिंगुअल निरंतरता का आकलन करने के लिए ILR स्किल लेवल विवरणों का उपयोग करते हुए एक नवीन मूल्यांकन ढांचे को प्रस्तुत करता है, जो लंबाई, शैली और सांस्कृतिक अंशांकन में महत्वपूर्ण डोमेन-निर्भर विविधताओं को प्रकट करता है जो न्यायसंगत बहुभाषी एआई परिनियोजन के लिए स्वचालित मेट्रिक्स को विशेषज्ञ गुणात्मक निर्णय के साथ संयोजित करने की आवश्यकता को रेखांकित करते हैं।

Camelia Baluta2026-05-01
💬 NLP

Semantic Structure of Feature Space in Large Language Models

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडलों (large language models) में अर्थपूर्ण विशेषताओं (semantic features) की ज्यामितीय संरचना मानव मनोवैज्ञानिक जुड़ावों के अत्यंत निकट है, जो यह प्रकट करती है कि फीचर वेक्टर्स, उनके अंतर-अक्षीय संबंध और स्टीयरिंग प्रभाव, मानव अर्थपूर्ण रेटिंग और सहसंबंधों के अनुरूप हैं।

Austin C. Kozlowski, Andrei Boutyline2026-05-01
🤖 AI

When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis

यह शोध पत्र राजनीतिक विमर्श विश्लेषण के लिए मल्टी-एजेंट एलएलएम (LLM) पाइपलाइनों में 'रोल फिडेलिटी' (भूमिका निष्ठा) का पहला व्यवस्थित अनुभवजन्य परीक्षण प्रस्तुत करता है, जो यह प्रकट करता है कि मॉडल अक्सर 'एपिस्टेमिक रोल ओवरराइड' (ज्ञान संबंधी भूमिका अधिभावीकरण) जैसी प्रणालियों के कारण निर्धारित प्रतिकूल भूमिकाओं को बनाए रखने में विफल रहते हैं, जिसमें विशिष्ट मॉडल, भाषा और तथ्य-जांच उपकरणों के उपयोग के आधार पर विफलता के तरीकों और निष्ठा में महत्वपूर्ण भिन्नताएं देखी गई हैं।

Juergen Dietrich2026-05-01
💬 NLP

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

यह शोध पत्र ASL मिनिमल ट्रांसलेशन पेयर्स (ASL-MTP) बेंचमार्क प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि साइन लैंग्वेज मॉडल भाषाई घटनाओं को कितनी अच्छी तरह पकड़ते हैं, जो एक केस स्टडी के माध्यम से यह प्रकट करता है कि अत्याधुनिक ट्रांसलेशन मॉडल काफी हद तक मैनुअल संकेतों पर निर्भर करते हैं जबकि अक्सर महत्वपूर्ण नॉन-मैनुअल जानकारी का उपयोग करने में विफल रहते हैं।

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu2026-05-01