💬 NLP

Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines

تقدم هذه الورقة طريقة لتكييف نموذج لغوي كبير مكون من 14 مليار معلمة مع مجال الرعاية الصحية البرازيلي عبر توليد بيانات اصطناعية من الإرشادات السريرية الرسمية وتطبيق التدريب المسبق المستمر مع التعلم المعزز، مما أدى إلى إنتاج نموذج يتفوق على الأنظمة المملوكة الأكبر حجماً في معايير مرجعية سريرية برازيلية تم وضعها حديثاً.

Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo, Rodrigo Nogueira2026-05-05
💬 NLP

Quantifying and Predicting Disagreement in Graded Human Ratings

تتقصى هذه الورقة أنماط الاختلاف في التقييمات البشرية المتدرجة للغة غير اللائقة من خلال اقتراح "مؤشر المعارضة" لقياس تباين وجهات النظر، وإثبات أن السمات النصية يمكنها التنبؤ بشكل متوسط بكل من تباين التعليقات وصعوبة الحالات ذات الآراء البشرية المتعارضة.

Leixin Zhang, Çağrı Çöltekin2026-05-05
💬 NLP

Compute Optimal Tokenization

تُظهر هذه الورقة أنه في تكوينات النماذج اللغوية المثلى من حيث الحوسبة، تتناسب أعداد المعلمات طردياً مع حجم البيانات مقاساً بالبايتات بدلاً من الرموز (tokens)، مما يكشف أن معدل ضغط الرموز الأمثل يختلف عن خوارزمية BPE القياسية ويتناقص مع زيادة الحوسبة.

Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Ze (…)2026-05-05
💬 NLP

SRA: Span Representation Alignment for Large Language Model Distillation

تقدم هذه الورقة البحثية SRA، وهو إطار عمل جديد لتقطير المعرفة عبر أجهزة الترميز (cross-tokenizer) يستفيد من منظور الأنظمة الديناميكية متعددة الجسيمات لمحاذاة تمثيلات النطاق القوية والموزونة بالانتباه بدلاً من الرموز الفردية، مما يتفوق بشكل كبير على الأساليب الحالية في سيناريوهات البنى الهيكلية المتباينة الصعبة.

Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van, Nguyen Thi Ngoc Diep, Trung Le2026-05-05
🤖 machine learning

Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation

تحدد هذه الورقة وتخفف من أثر "مصب الانتباه" (attention sink) المنهجي في نماذج الترجمة الآلية العصبية متعددة اللغات، حيث تمتص الرموز غير المحتوية على محتوى كتلة الانتباه المتقاطع بشكل غير متناسب، وذلك عبر تقديم منهجية تصفية تكشف عن أنماط لغوية كانت محجوبة سابقاً وتحسن بشكل كبير من موثوقية تحليلات التفسير القائمة على الانتباه.

Hillary Mutisya, John Mugane2026-05-05
💬 NLP

Beyond Semantic Relevance: Counterfactual Risk Minimization for Robust Retrieval-Augmented Generation

تقدم هذه الورقة إطار عمل CoRM-RAG، الذي يعالج "فجوة الارتباط والمتانة" في التوليد المعزز بالاسترجاع من خلال توظيف تقليل المخاطر عبر التناقض والبروتوكول الاضطرابي المعرفي لتدريب ناقد للأدلة يمنح الأولوية لسلامة القرار على التشابه الدلالي، مما يؤدي إلى التخفيف من الهلوسة الناتجة عن الاستعلامات المنحازة.

Peiyang Liu, Qiang Yan, Ziqiang Cui, Di Liang, Xi Wang, Wei Ye2026-05-05
💬 NLP

Enhancing Game Review Sentiment Classification on Steam Platform with Attention-Based BiLSTM

تُثبت هذه الورقة البحثية أن نموذج الذاكرة الطويلة قصيرة المدى ثنائية الاتجاه (BiLSTM) القائم على آلية الانتباه يتفوق على النماذج المرجعية التقلية لتعلم الآلة في تصنيف مشاعر مراجعات ألعاب منصة "ستيم" (Steam)، محققاً دقة بنسبة 83% ودرجة F1 موزونة بنسبة 85%، مع توفير تصورات مرئية قابلة للتفسير للكلمات الحاملة للمشاعر لمساعدة مطوري الألعاب.

Abit Ahmad Oktarian, Fadhil Fitra Wijaya, Dhafin Razaqa Luthfi, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima M (…)2026-05-05
💬 NLP

Sentiment Analysis of Mobile Legends App Reviews Using Machine Learning and LSTM-Based Deep Learning Models

تُظهر هذه الورقة أن نموذج التعلم العميق القائم على شبكات الذاكرة الطويلة قصيرة المدى (LSTM) يتفوق على أساليب التعلم الآلي التقليدية في تحليل مراجعات تطبيق "Mobile Legends"، محققاً دقة بنسبة 92% من خلال الالتقاط الفعال للفروق الدقيقة المتسلسلة والسياقية للنصوص غير الرسمية للمستخدمين.

Vira Putri Maharani, Kharisa Harvanny, Daris Samudra, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang2026-05-05
💬 NLP

Benchmarking LightGBM and BiLSTM for Sentiment Analysis on Indonesian E-Commerce Reviews

تقارن هذه الدراسة بين نهجي تعلم الآلة والتعلم العميق على مجموعة بيانات لتحليل مشاعر التجارة الإلكترونية الإندونيسية، حيث وجدت أن نموذج BiLSTM يتفوق على LightGBM وخوارزميات تعلم الآلة الأخرى بدقة بلغت 98.87%، رغم أن LightGBM يظل بديلاً عالي الكفاءة.

Lidia Natasyah Marpaung, Vania Claresta, Iqfina Haula Halika, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Man (…)2026-05-05
💬 NLP

Creating and Evaluating Figurative Language Dataset for Sindhi

تقدم هذه الورقة SiNFluD، وهو مجموعة بيانات مرجعية جديدة لتصنيف اللغة المجازية في اللغة السندية تم إنشاؤها من مصادر متنوعة وتم ترميزها من قبل متحدثين أصليين، إلى جانب تقييم لنماذج مدربة مسبقاً مختلفة حيث حقق نموذج XLM-RoBERTa-XL أفضل أداء.

Wazir Ali, Adeeb Noor, Saifullah Tumrani2026-05-05