💬 NLP

Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages

تقدم هذه الورقة البحثية MCN، وهو متن لغوي متعدد اللغات للكشف عن الحاجة إلى الاستشهاد عبر 18 لغة، مما يثبت أن النماذج اللغوية الصغيرة المضبوطة بدقة تتفوق على النماذج اللغوية الكبيرة في كل من الإعدادات أحادية اللغة ومتعددة اللغات، مما يفيد بشكل خاص مجتمعات ويكيبيديا ذات الموارد المنخفضة.

Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandečić, Elena Simperl2026-06-01
💬 NLP

On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets

تقدم هذه الورقة دراسة تحليلية تقيم متانة ترتيبات تضمين النصوص متعددة اللغات في معيار MTEB من خلال تقديم مؤشرات لمتانة تكوين مجموعة البيانات ومخطط الترتيب، كاشفةً أنه بينما تؤدي النماذج الضخمة القائمة على النماذج اللغوية الكبيرة (LLM) أداءً جيداً في مهام محددة، فإن مجموعة صغيرة فقط منها تحافظ على تفوق مستمر عبر مختلف اللغات والمهام وتصاميم التقييم.

Ana Gjorgjevikj, Barbara Koroušić Seljak, Tome Eftimov2026-06-01
💬 NLP

D3^3: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

تقترح الورقة البحثية D3D^3، وهو إطار عمل لجدولة البيانات الديناميكية يعمل على نمذجة تفاعلات العينات كرسم بياني للتأثير الاتجاهي لتحسين ترتيب التدريب ورفع كفاءة تعلم النماذج اللغوية الكبيرة عبر مرحلتي ما قبل التدريب وما بعد التدريب.

Yuanjian Xu, Jianing Hao, Guang Zhang, Zhong Li2026-06-01
💬 NLP

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

تتقصى هذه الورقة البحثية ظهور لغات مستحدثة ضمن مجموعات من وكلاء النماذج اللغوية في مجموعة بيانات "مولت-بوك" (Moltbook)، كاشفةً عن تطوير هؤلاء الوكلاء لاستراتيجيات تواصل متطورة —بما في ذلك كفاءة الرموز (token efficiency) والتحايل على الرقابة عبر التخفي (steganographic oversight evasion)— مما يتحدى كفاية أساليب المراقبة الحالية القائمة على السطح.

Stine Lyngsø Beltoft, William Brach, Federico Torrielli, Jacob Nielsen, Annemette Brok Pirchert, Filippo Tonini, Peter S (…)2026-06-01
💬 NLP

Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines

تتحدى هذه الورقة النتائج السابقة التي تشير إلى أن المشفّرات التلقائية المتناثرة (SAEs) تؤدي أداءً ضعيفًا في توجيه النماذج اللغوية الكبيرة، وذلك من خلال إثبات أنه عندما يتم اختيار الميزات وتسميتها عبر مسار تدفق مُشرف، يمكن للمشفّرات التلقائية المتناثرة تحقيق أداء في التوجيه يضاهي تقنية "LoRA" في اختبار "AxBench" مع تحديد الميزات السببية، حتى دون اشتراط درجة عالية من التناثر.

Mikkel Godsk Jørgensen, Lars Kai Hansen2026-06-01
💬 NLP

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

تقدم هذه الورقة البحثية TouchSafeBench، وهو معيار مرجعي قائم على الفيزياء في Habitat 3.0 يقيم قدرة النماذج الرؤية-اللغوية على استنتاج مخاطر الاصطدام من أجل تعاون آمن بين الإنسان والروبوت، كاشفةً أن النماذج الحالية تفتقر إلى المساءلة الفيزيائية الضرية والاستدلال الهندسي الصريح للتمييز بشكل موثوق بين حالات الأمان، والاصطدام، والتلامس الوشيك.

Jun Wang, Xiaohao Xu, Xiaonan Huang2026-06-01
💬 NLP

Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models

تُثبت هذه الورقة أن مسبارًا خطيًا تم تدريبه أحادي اللغة يمكنه تقدير الثقة في النماذج اللغوية الكبيرة بفعالية عبر لغات متنوعة وغير مرئية دون إعادة تدريب، مما يكشف أن النماذج اللغوية الكبيرة متعددة اللغات تشفر سمات ثقة مشتركة وقابلة للنقل تتركز في طبقاتها الوسطى.

Athina Kyriakou, Dennis Ulmer, Ivan Titov2026-06-01
💬 NLP

Mellum2 Technical Report

يُعد Mellum 2 نموذج لغة مفتوح الأوزان، يتكون من 12 مليار معلمة بنظام خليط الخبراء (Mixture-of-Experts) مع 2.5 مليار معلمة نشطة لكل رمز، وهو متخصص في هندسة البرمجيات والمهام الوكيلية، ويحقق أداءً تنافسيًا مع النماذج الأكبر من خلال ابتكارات معمارية مثل التنبؤ متعدد الرموز ومنهج تدريب ثلاثي المراحل يمتد عبر 10.6 تريليون رمز.

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov (…)2026-06-01
💬 NLP

Wind Turbine Maintenance Log Labelling Framework: LLM-Driven Data Correction and Enrichment via Semantic Extraction of Reliability Intelligence

تقدم هذه الورقة إطار عمل جديداً وقابلاً للتوسع يستفيد من النماذج اللغوية الكبيرة لهيكلة وإثراء سجلات صيانة توربينات الرياح غير المنظمة تلقائياً، مما يحول الملاحظات الميدانية النوعية إلى معلومات موثوقية كمية لتعزيز تحليل الفشل والصيانة التنبؤية.

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya2026-06-01
💬 NLP

Divergence Decoding: Inference-Time Unlearning via Auxiliary Models

تقدم هذه الورقة البحثية "فك التشفير بالتباعد" (Divergence Decoding)، وهو أسلوب لـ "إلغاء التعلم" (unlearning) أثناء مرحلة الاستدلال، يستفيد من نماذج مساعدة صغيرة لتوجيه احتمالات (logits) النماذج اللغوية الكبيرة بعيداً عن البيانات الحساسة، مما يخفف بفعالية من مخاطر الخصوصية وحقوق الطبع والنشر مع أدنى قدر من الفقد في الفائدة، مع تقديم حل قابل للتعميم يمكن تطبيقه في مجالي النصوص والصور على حد سواء.

Humzah Merchant, Bradford Levy2026-06-01