💬 NLP

Benchmarking PyCaret AutoML Against BiLSTM for Fine-Grained Emotion Classification: A Comparative Study on 20-Class Emotion Detection

تقارن هذه الدراسة بين نماذج تعلم الآلة القائمة على PyCaret وبين بنيات التعلم العميق في مجموعة بيانات مشاعر مكونة من 20 فئة، حيث وجدت أنه بينما تظل النماذج التقليدية مثل SVM تنافسية، يحقق نموذج BiLSTM أداءً فائقاً (دقة 89%) من خلال التقاط الإشارات السياقية العاطفية بشكل أفضل.

Arya Muda Siregar, Arielva Simon Siahaan, Haikal Fransisko Simbolon, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manul (…)2026-04-30
💬 NLP

Classification of Public Opinion on the Free Nutritional Meal Program on YouTube Media Using the LSTM Method

تستخدم هذه الدراسة طريقة الذاكرة الطويلة قصيرة المدى (LSTM) لتصنيف المشاعر في 7,733 تعليقاً من يوتيوب بخصوص برنامج الوجبات الغذائية المجانية في إندونيسيا، محققةً دقة إجمالية بلغت 89% مع الكشف عن أن أداء النموذج منحاز بشكل كبير نحو المشاعر السلبية بسبب عدم توازن حاد في فئات البيانات.

Berliana Enda Putri, Lisa Diani Amelia, Muhammad Zaky Zaiddan, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Ma (…)2026-04-30
🤖 machine learning

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

تقدم هذه الورقة Entrocraft، وهي طريقة بسيطة لأخذ العينات بالرفض خالية من التنظيم، تتحكم بدقة في جداول الإنتروبيا لمنع تشبع الأداء في التعلم المعزز للنماذج اللغوية الكبيرة، مما يؤدي إلى تمديد طول فترة التدريب بشكل كبير وتحسين التعميم وتنوع المخرجات.

Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang2026-04-30
💬 NLP

A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models

تقترح هذه الورقة نموذجاً ثنائي المهام يجمع بين الحساب الحسابي وفهم الجمل لإثبات أن تقييد الموارد المعرفية في النماذج اللغوية الكبيرة يحول استراتيجيات المعالجة لديها نحو الاستدلال العقلاني الشبيه بالبشر، وهو ما يتضح من خلال زيادة فجوة الدقة بين الجمل المرجحة والجمل غير المرجحة.

Rei Emura, Saku Sugawara2026-04-30
💬 NLP

When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?

تقدم هذه الورقة KVShot، وهو إطار تشخيصي يوضح كيف يؤدي تمكين نماذج المسودة من إعادة استخدام مخبئات (KV) المستهدفة إلى التخفيف من تدهور الدقة بعيد المدى في فك التشفير التخميني، مع تحديد الاختناقات الهيكلية في مسارات التدريب الحالية التي تستوجب التحول نحو نماذج التدريب القائمة على الكتل.

Tianyu Liu, Yuhao Shen, Xinyi Hu, Baolin Zhang, Hengxin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, MingChen (…)2026-04-30
💬 NLP

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

تقدم هذه الورقة "نامة" (Naamah)، وهي مجموعة بيانات اصطناعية واسعة النطاق لتعرّف الكيانات المسماة باللغة السنسكريتية تضم أكثر من 100,000 جملة تم إنشاؤها عبر دمج استخراج كيانات "دي بييديا" (DBpedia) مع نموذج استدلال هجين بـ 24 مليار معلمة، والذي يُستخدم بعد ذلك لاختبار معايير بنيات المحولات (transformer architectures) متعددة اللغات والخاصة باللغات الهندية.

Akhil Rajeev P, Annarao Kulkarni2026-04-30
💬 NLP

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

تُثبت هذه الورقة أن تأصيل تقييم التخصيص الأسلوبي للنماذج اللغوية الكبيرة في نظرية التحقق من التأليف (وتحديداً باستخدام مقياس LUAR) يكشف عن "فجوة تأليف" كبيرة حيث تفشل الطرق الحالية في محاكاة الأسلوب البشري، وهو فشل جوهري يظل غير مرئي للمقاييس غير المعايرة والعشوائية مثل "النموذج كحكم" أو المقاييس الأسلوبية التي تنتج نتائج غير متسقة وغير معايرة.

Yash Ganpat Sawant2026-04-30
💬 NLP

StarDrinks: An English and Korean Test Set for SLU Evaluation in a Drink Ordering Scenario

تقدم هذه الورقة StarDrinks، وهي مجموعة اختبار ثنائية اللغة (الإنجليزية والكورية) مصممة لتقييم نماذج الكلام وفهم اللغة الطبيعية في سيناريوهات واقعية لطلب المشروبات من خلال رصد التباين المعقد في العالم الحقيقي مثل الكيانات المتنوعة، والتخصيصات، وظواهر الكلام العفوي.

Marcely Zanon Boito, Caroline Brun, Inyoung Kim, Denys Proux, Salah Ait-Mokhtar, Nikolaos Lagos, Jean-Luc Meunier, Ioan (…)2026-04-30
💬 NLP

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

تقترح هذه الورقة "SafeReview"، وهو إطار عمل تنافسي مبتكر يستخدم نموذج مولد ومدافع يتطوران ديناميكيًا للكشف عن المطالبات الخفية العدائية المصممة للتلاعب بأنظمة مراجعة الأقران الأكاديمية القائمة على النماذج اللغوية الكبيرة وتخفيف حدتها بمتانة.

Yuan Xin, Yixuan Weng, Minjun Zhu, Ying Ling, Chengwei Qin, Michael Hahn, Michael Backes, Yue Zhang, Linyi Yang2026-04-30
💬 NLP

OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory

تقترح الورقة البحثية إطار عمل OCR-Memory، وهو إطار عمل مبتكر يتغلب على قيود النص والسياق في وكلاء النماذج اللغوية الكبيرة (LLM) ذوي الأفق الطويل عبر ترميز المسارات التاريخية كصور واسترجاع النصوص حرفياً من خلال آلية بصرية تعتمد على "التحديد والنسخ"، مما يؤدي إلى توسيع سعة الذاكرة الفعالة بشكل كبير مع تقليل الهلوسة إلى أدنى حد.

Jinze Li, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu, Shuo Yang, Junhua Ding, Edith Cheuk-Han Ngai2026-04-30