💬 NLP

Tokenisation over Bounded Alphabets is Hard

تثبت هذه الورقة أن عملية التجزئة (tokenisation) عبر الأبجديات المحدودة، بما في ذلك حالتي الثنائية والأحادية، هي مسألة معقدة من فئة NP-complete وAPX-hard جوهرياً، مما يؤكد أن استعصاءها الحسابي هو عائق متأصل وليس مجرد نتاج لضخامة أبجديات المدخلات، وتوضح ضرورة النهج الاستدلالي في الخوارزميات العملية الحالية.

Violeta Kastreva, Philip Whittington, Dennis Komm, Tiago Pimentel2026-08-11
💬 NLP

Length-MAX Tokenizer for Language Models

تقدم الورقة البحثية "Length-MAX tokenizer"، وهي طريقة مبتكرة تُحسّن اختيار المفردات عبر نهج تقسيم الرسوم البيانية لتقليل متوسط الرموز لكل حرف، مما يحقق انخفاضات كبيرة في خطوات التدريب، وزمن انتقال الاستدلال، واستهلاك الذاكرة، مع تحسين الأداء في المهام اللاحقة مقارنةً بترميز زوج البايت (Byte Pair Encoding) القياسي.

Dong Dong, Weijie Su2026-08-11
💬 NLP

HFS: Holistic Query-Aware Frame Selection for Efficient Video Understanding

تقترح هذه الورقة البحثية إطار عمل HFS، وهو إطار عمل قابل للتدريب من طرف إلى طرف يستفيد من نموذج لغوي صغير لتقييم الإطارات بناءً على الاستعلام، ومع هدف مستوٍ قابل للتفاضل مع تعلم متبادل بين الطالب والمعلم للتغلب على قيود الطرق الحالية القائمة على النقاط والمعايير الثابتة، محققاً أداءً فائقاً في معايير فهم الفيديو.

Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam2026-08-11
💬 NLP

Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks

تقيم هذه الدراسة ثلاثة من نماذج اللغات الكبيرة المتطورة عبر مهام اتخاذ القرار السريري، وتجد أنه في حين أن هندسة الأوامر تحسن الأداء بشكل كبير في مجالات ضعف محددة مثل الاختبار التشخيصي، إلا أنها ليست حلاً عالمياً ويمكن أن تؤدي إلى نتائج عكسية لمهام أخرى، مما يسلط الضوء على الحاجة إلى استراتيجيات دمج مخصصة ومدركة للسياق.

Mengdi Chai, Ali R. Zomorrodi2026-08-11
💬 NLP

Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis

تقدم الورقة البحثية إطار عمل موحد يُدعى EGMF، والذي يستفيد من شبكة متعددة المقاييس بتوجيه من الخبراء ونماذج لغوية كبيرة مع ضبط دقيق كفء في المعلمات لتحقيق أداء رائد في كل من التعرف على العواطف المنفصلة وتحليل المشاعر المستمر عبر لغات ومجموعات بيانات متعددة.

Jiaqi Qiao, Xinran Li, Yifan Lyu, Xiujuan Xu, Liu Yu2026-08-11
💬 NLP

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

تقدم الورقة البحثية SPRInG، وهو إطار عمل شبه معالم (semi-parametric) للتخصيص المستمر للنماذج اللغوية الكبيرة (LLM)، والذي يجمع بين التكيف الانتقائي المدفوع بالانحراف لتحديث المهايئات الخاصة بالمستخدم عند حدوث تفاعلات ذات جدة عالية، وبين التوليد القائم على الاسترجاع والتدخل، مما يعالج بفعالية تطور التفضيلات مع منع النسيان الكارثي.

Seoyeon Kim, Jaehyung Kim2026-08-11
💬 NLP

Thinking Is Not Telling: Information Disclosure in User-Service LLM Agents

تحدد هذه الورقة فشلاً حرجاً في التواصل لدى وكلاء النماذج اللغوية الكبيرة (LLM) الموجهين لخدمة المستخدم، حيث لا يترجم الاستنتاج الداخلي تلقائياً إلى إفصاح عن المعلومات في الوقت المناسب للمستخدم، مما يثبت أن التجسيد الخارجي الصريح للمعرفة ذات الصلة بالقرار أكثر فعالية في نجاح المهام من مجرد زيادة جهود "التفكير" الداخلية.

Jiatong Li, Changdae Oh, Hyeong Kyu Choi, Jindong Wang, Sharon Li2026-08-11
💬 NLP

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

تُثبت هذه الورقة أنه، خلافاً للحدس السائد، فإن الضبط الدقيق الخاضع للإشراف على بيانات تسلسل الأفكار يحقق أداءً استدلالياً فائقاً من خلال التدريب المتكرر على مجموعات بيانات أصغر حتى يتم الوصول إلى مرحلة الحفظ الكامل، بدلاً من التوسع في حجم مجموعة البيانات لدورة تدريبية واحدة.

Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano2026-08-11
💬 NLP

Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation

تقترح الورقة البحثية "خبير القفل المساري" (Path-Lock Expert - PLE)، وهو حل على مستوى البنية التحتية يستبدل طبقات التغذية الأمامية المفردة بخبيرين مقفلين دلالياً لأنماط استدلال متميزة، مما يقضي فعلياً على تسرب الاستدلال ويحسن الدقة في سيناريوهات عدم التفكير مع الحفاظ على أداء قوي في أنماط التفكير.

Shouren Wang, Wang Yang, Chuang Ma, Debargha Ganguly, Vikash Singh, Chaoda Song, Xinpeng Li, Xianxuan Long, Vipin Chaudh (…)2026-08-11
💬 NLP

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

تقدم هذه الورقة UI-MOPD، وهو إطار عمل مبتكر يستفيد من التقطير متعدد المعلمين في السياسة الموحدة (multi-teacher on-policy distillation) ومن مجموعة بيانات Uni-GUI التي تم إنشاؤها حديثاً لتدريب وكيل واجهة مستخدم رسومية موحد وعابر للمنصات، مما يدمج بفعالية الخبرات المتخصصة في أجهزة المكتب والهواتف المحمولة مع التغلب على التحديات المتعلقة بندرة البيانات واختلاف تقاليد التفاعل.

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng (…)2026-08-11