💬 NLP

TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents

يقدم Timem إطار عمل ذاكرة هرمي زمني مبتكر يستخدم شجرة ذاكرة زمنية لدمج وتنظيم سجلات المحادثات طويلة المدى بشكل منهجي، محققاً أداءً هو الأفضل في فئته على معايير قياس الذاكرة مع تقليل طول الذاكرة المسترجعة بشكل كبير من خلال التكامل الموجه دلالياً والاسترجاع المدرك للتعقيد.

Kai Li, Xuanqing Yu, Ziyi Ni, Yi Zeng, Yao Xu, Zheqing Zhang, Xin Li, Jitao Sang, Xiaogang Duan, Xuelei Wang, Chengbao L (…)2026-05-01
💻 computer science

DeepTutor: Towards Agentic Personalized Tutoring

تقدم الورقة البحثية DeepTutor، وهو إطار عمل مفتوح المصدر وأصيل للوكلاء (agent-native)، يستخدم محرك تخصيص هجين وحلقة تعليمية مغلقة لتقديم تجارب تعلم تكيفية وشخصية، تم التحقق من صحتها من خلال معيار TutorBench الجديد المتمحور حول الطالب.

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang2026-05-01
💬 NLP

BatteryPass-12K: The First Dataset for the Novel Digital Battery Passport Conformance Task

تقدم هذه الورقة BatteryPass-12K، وهو أول معيار مرجعي اصطناعي عام لتصنيف مطابقة جواز سفر البطارية الرقمي، وتقيم 22 نموذجاً لغوياً لتكشف أنه في حين أن نماذج التفكير والتعلم من أمثلة قليلة تحقق أفضل النتائج، فإن مجرد زيادة عدد المعلمات لا يضمن تحسن الأداء وتظل النماذج عرضة لهجمات حقن الأوامر.

Tosin Adewumi, Martin Karlsson, Lama Alkhaled, Marcus Liwicki2026-05-01
💬 NLP

Hypencoder Revisited: Reproducibility and Analysis of Non-Linear Scoring for First-Stage Retrieval

تقدم هذه الورقة دراسة لإعادة الإنتاج وتحليلاً موسعاً لإطار عمل Hypencoder، مما يؤكد أداءه المتفوق على المشفرات الثنائية القياسية في معظم الاختبارات المرجعية، مع الكشف عن أن نظام التقييم غير الخطي الخاص به لا يوفر ميزة ثابتة في المتانة ضد الهجمات العدائية، وأن المشفرات الثنائية القياسية تظل أسرع من حيث زمن استجابة الاستعلام.

Arne Eichholtz, Yongkang Li, Jutte Vijverberg, Tobias Groot, Mohammad Aliannejadi2026-05-01
💬 NLP

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

تقدم الورقة البحثية LenVM، وهو إطار عمل قابل للتوسع وخالٍ من التوسيم، يقوم بنمذجة طول التوليد المتبقي كإشارة قيمة على مستوى الرمز (token)، مما يحسن بشكل كبير من مطابقة الطول الدقيق ويمكّن من التحكم المستمر في المقايضة بين الأداء والكفاءة في النماذج ذات التوليد الذاتي (autoregressive models).

Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Z (…)2026-05-01
💬 NLP

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

تُثبت هذه الورقة، من خلال تجارب التقليم المنهجية على نماذج لغوية متخصصة في مهام معينة، أن العصبونات تساهم بشكل غير متماثل في الأداء، مما يكشف عن أن مجموعة فرعية صغيرة من العصبونات عالية التخصص تُعد حاسمة لنجاح المهمة، بينما تُظهر بقية الشبكة فائضاً يمكن تقليمه بأمان واستعادته لاحقاً من خلال الضبط الدقيق.

M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan (…)2026-05-01
💬 NLP

Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

تقدم هذه الورقة إطار تقييم مبتكرًا باستخدام أوصاف مستويات المهارة الخاصة بالمعهد اللغوي الأمريكي (ILR) لتقييم اتساق "كلود" عبر اللغات في ست لغات، مما يكشف عن تباينات كبيرة تعتمد على المجال في الطول والأسلوب والمعايرة الثقافية، وهو ما يسلط الضرورة على الجمع بين المقاييس الآلية والتقدير النوعي للخبراء من أجل نشر عادل للذكاء الاصطناዊ متعدد اللغات.

Camelia Baluta2026-05-01
💬 NLP

Semantic Structure of Feature Space in Large Language Models

تُثبت هذه الورقة أن البنية الهندسية للميزات الدلالية في النماذج اللغوية الكبيرة تحاكي بدقة الارتباطات النفسية البشرية، مما يكشف أن متجهات الميزات، وعلاقاتها البينية بين المحاور، وتأثيرات التوجيه، تتوافق مع التقييمات والارتباطات الدلالية البشرية.

Austin C. Kozlowski, Andrei Boutyline2026-05-01
🤖 AI

When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis

تقدم هذه الورقة أول اختبار تجريبي منهجي للوفاء بالدور في سلاسل نماذج اللغات الكبيرة متعددة الوكلاء لتحليل الخطاب السياسي، كاشفةً أن النماذج تخفق بشكل متكرر في الحفاظ على الأدوار المعارضة الموكلة إليها بسبب آليات مثل "تجاوز الدور المعرفي"، مع وجود تباينات كبيرة في أنماط الفشل والوفاء اعتماداً على النموذج المحدد، واللغة، وأدوات التحقق من الحقائق المستخدمة.

Juergen Dietrich2026-05-01
💬 NLP

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

تقدم هذه الورقة معيار أزواج الترجمة الدنيا للغة الإشارة الأمريكية (ASL-MTP) لتقييم مدى قدرة نماذج لغة الإشارة على استيعاب الظواهر اللغوية، كاشفةً من خلال دراسة حالة أن نماذج الترجمة الحديثة تعتمد بشكل كبير على الإشارات اليدوية بينما تفشل غالباً في استخدام المعلومات غير اليدوية الحاسمة.

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu2026-05-01