💬 NLP

Designing FSMs Specifications from Requirements with GPT 4.0

تقترح هذه الورقة وتقيم إطار عمل يعتمد على الخبراء ويستند إلى النماذج اللغوية الكبيرة، والذي يسخر نموذج GPT-4 لتصميم آلات الحالة المحدودة تلقائياً من متطلبات اللغة الطبيعية وإصلاحها من خلال الطفرات وتوليد الاختبارات، بهدف تحسين جودة الهندسة القائمة على النماذج وتقليل مخاطر فشل النظام.

Omer Nguena Timo, Paul-Alexis Rodriguez, Florent Avellaneda2026-04-01
🤖 AI

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

تقدم الورقة البحثية نموذج Xuanwu VL-2B، وهو نموذج تأسيسي متعدد الوسائط من الدرجة الصناعية بـ 2 مليار معلمة، يستفيد من بنية مدمجة تتكون من InternViT-300M وQwen3 1.7B إلى جانب مسار تدريب ثلاثي المراحل لتحقيق أداء فائق في مراقبة المحتوى والسيناريوهات العدائية مع تحقيق التوازن بين الإدراك البصري دقيق التفاصيل، والحفاظ على القدرات العامة، وتكاليف النشر.

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao2026-04-01
💬 NLP

SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation

تقدم هذه الورقة "SyriSign"، وهي أول مدونة متوازية متاحة للجمهور تضم 1,500 عينة فيديو للغة الإشارة العربية السورية، تهدف إلى جسر حواجز التواصل للمجتمع الأصم في سوريا والعمل كمرجع أساسي لأبحاث الترجمة من النص إلى الإشارة.

Mohammad Amer Khalil, Raghad Nahas, Ahmad Nassar, Khloud Al Jallad2026-04-01
💬 NLP

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

تقدم هذه الورقة مجموعة بيانات "ثيومي" (Thiomi Dataset)، وهي متن متعدد الوسائط واسع النطاق يضم أكثر من 601,000 تعليق نصي و385,000 تسجيل صوتي عبر عشر لغات أفريقية، مما يضع معايير مرجعية جديدة رائدة لنماذج الكلام واللغة مع إظهار تحسينات كبيرة في أداء التعرف التلقائي على الكلام.

Hillary Mutisya, John Mugane, Gavin Nyamboga, Brian Chege, Maryruth Gathoni2026-04-01
💬 NLP

Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE

تقدم هذه الورقة البحثية RoDPO، وهو إطار عمل قوي للتحسين المباشر للتفضيلات (Direct Preference Optimization) لأنظمة التوصية المتسلسلة متعددة الوسائط، والذي يعزز أداء التصنيف عبر استبدال السلبيات الصلبة الحتمية بأخذ عينات عشوائية من مجموعة مرشحين ديناميكية للتخفيف من تدرجات السلبيات الزائفة، مع الاستفماحة في الاستفادة من مشفر "خليط الخبراء" المتناثر (sparse Mixture-of-Experts encoder) للتوسع بكفاءة.

Hejin Huang, Jusheng Zhang, Kaitong Cai, Jian Wang, Rong Pan2026-04-01
💬 NLP

Is my model perplexed for the right reason? Contrasting LLMs' Benchmark Behavior with Token-Level Perplexity

تقدم هذه الورقة إطار عمل لتعقيد الرموز (token-level perplexity) لتقييم ما إذا كانت النماذج اللغوية الكبيرة تعتمد على إشارات ذات صلة لغويًا، مما يكشف أنه بينما تؤثر الرموز الهامة على السلوك، فإن النماذج تعتمد في النهاية على استدلالات تتجاوز الآليات اللغوية المتوقعة.

Zoë Prins, Samuele Punzo, Frank Wildenburg, Giovanni Cinà, Sandro Pezzelle2026-04-01
💬 NLP

Authorship Impersonation via LLM Prompting does not Evade Authorship Verification Methods

تُظهر هذه الدراسة أنه على الرغم من سهولة الوصول إلى النماذج اللغوية الكبيرة، إلا أن أنظمة التحقق من التأليف الحالية تظل قوية ضد محاولات انتحال الهوية في مستواها المبتدئ لأن النصوص التي تولدها النماذج اللغوية الكبيرة تفشل في محاكاة الفردية التأليفية المحددة وغالبًا ما تُظهر تنوعًا معجميًا أعلى يساعد في اكتشافها.

Baoyi Zeng, Andrea Nini2026-04-01
💬 NLP

An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms

تقترح هذه الورقة طريقة خفيفة الوزن وذات تمريرة واحدة لتقدير عدم اليقين المعرفي (epistemic) واللانمطي (aleatoric) في النماذج اللغوية الكبيرة من خلال تقريب تباين المعلمات كتباين متماثل المناحي (isotropic) لاستخلاص عدم اليقين من معايير التدرج، مما يثبت أن هذه الإشارة على مستوى المعلمات تتنبأ بفعالية بصحة الإجابة في الاختبارات المرجعية كثيرة الصراعات مثل TruthfulQA، ولكنها تختلف بشكل كبير عن طرق التقييم الذاتي في مهام الاستدعاء الحقائقي.

Nils Grünefeld, Jes Frellsen, Christian Hardmeier2026-04-01
💬 NLP

Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models

تتناول هذه الورقة القيود الحسابية لاستخدام النماذج اللغوية الكبيرة في تقييم الخصوصية من خلال تقطير قدرات نموذج يضم 675 مليار معلمة إلى مصنفات خفيفة الوزن تبلغ 150 مليون معلمة، والتي تحافظ على توافق قوي مع الأحكام البشرية عبر عشرة مجالات متنوعة مع تمكين النشر القابل للتوسع في العالم الحقيقي.

Gabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi2026-04-01