💬 NLP

The Geometry of Low-Resource Language Representations

تُبين هذه الورقة أن اللغات ذات الموارد المنخفضة في النماذج اللغوية الكبيرة تعاني من تدهور تمثيلي في الطبقات النهائية بسبب ندرة البيانات، وتُظهر أن تطبيق التنظيم الهندسي أثناء التدريب المسبق المستمر يمكن أن يخفف من هذه المشكلة بفعالية لتحسين الأداء.

Francois Meyer, Jan Buys2026-08-25
💬 NLP

Cross-lingual Biography Enrichment via Claim Extraction and Alignment

تقدم هذه الورقة معيار CLAW-4L وإطار عمل قائماً على الادعاءات لإثراء السير الذاتية للنساء في ويكيبيديا الإنجليزية بحقائق محلية من طبعات غير إنجليزية (الفرنسية، والصينية، والأذربيجانية)، مما يثبت أن المحاذاة عبر اللغات يمكن أن تحسن التغطية رغم التحديات في البيئات ذات الموارد المنخفضة.

Yifei Song, Ziyang Chen, Emil Sayilov, Claire Gardent2026-08-25
💬 NLP

Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data

تقترح هذه الورقة نهجاً لتقطير المعرفة القائم على البيانات (DDKD) مع تعزيز الحفاظ على البنية لتحقيق توليد فعال للنصوص من البيانات عبر مجالات ومهام متعددة دون الحاجة لبيانات تدريب داخل النطاق، مما يثبت أن النماذج المقطرة الصغيرة تتفوق باستمرار على الاستدلال في حالة عدم وجود بيانات (zero-shot) والضبط الدقيق خارج النطاق عبر خمس معايير قياسية.

Yifei Song, Kun Efimov-Zhang, Claire Gardent2026-08-25
💬 NLP

Robustness of IR Models to Collection Growth

تتقصى هذه الورقة مدى متانة نماذج استرجاع المعلومات تجاه نمو المجموعات من خلال تصنيفها إلى نماذج غير معتمدة على تعدد المستندات (MDA) ونماذج معتمدة على تعدد المستندات (MDD)، كاشفةً أنه في حين تعاني جميع النماذج من بعض التدهور في الأداء عند إضافة مستندات غير ذات صلة، فإن نماذج (MDA) تتفوق عمومًا على نماذج (MDD) في مهام الاسترجاع.

Emmanouil Georgios Lionis, Debasis Ganguly, Sean MacAvaney2026-08-25
💬 NLP

How Useful are LLMs for Grammar Engineering? Cantonese ParGram Resources and Controlled Experimental Evaluation with English Baselines

تقدم هذه الورقة موارد جديدة لـ ParGram للغة الكانتونية وتقدم تقييماً منضبطاً يظهر أنه بينما تستطيع النماذج اللغوية الكبيرة المتقدمة توليد مكونات قواعدية معقولة محلياً، إلا أنها تواجه صعوبة في التعامل مع القيود الشكلية المعقدة، مما يشير إلى أن الخبرة اللغوية البشرية تظل ضرورية لهندسة القواعد.

Chit-Fung Lam2026-08-25
💬 NLP

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

تقدم الورقة البحثية TimeCatch، وهو معيار مرجعي يكشف أنه بينما تتفوق نماذج الرؤية واللغة في اكتشاف الشذوذ على مستوى الإطار، فإنها تعاني بشكل كبير من تحديد التناقضات الزمنية الناتجة عن تبديل الإطارات، مما يشير إلى وجود فجوة جوهرية في قدرتها على الاستنتاج بشأن البنية الزمنية مقارنة بالبشر.

Marek Hradil, Danae Sánchez Villegas2026-08-25
🤖 AI

Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty

تتناول هذه الورقة ظاهرة عدم المواءمة الناجم عن الاستدلال (RIM)، حيث يؤدي الضبط الدقيق للنماذج اللغوية الكبيرة على بيانات استدلال آمنة إلى تدهور سلامتها دون قصد، وذلك من خلال تحليل فضاءات التمثيل المقترنة للاستدلال والسلامة لاقتراح والتحقق من صحة عقوبة اتجاه السلامة (SDP)، وهي طريقة أثناء التدريب تعاقب الإزاحة على طول اتجاهات السلامة المتعلمة لاستعادة سلامة النموذج دون المساس بأداء الاستدلال.

Yipeng Zhao, Qishun Yang, Shenzhe Zhu, Shu Yang, Di Wang2026-08-25
📊 statistics

ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings

تقدم الورقة البحثية ConvergeFlow، وهو نموذج لغوي قائم على التدفق يقيد التنبؤات ضمن الغلاف المحدب لتمثيلات الرموز (token embeddings)، ويثبت التقارب نحو الرموز الصالحة، مما يتيح توليد الرموز بشكل مباشر دون الحاجة إلى فك تشفير خاضع لإشراف الإنتروبيا المتقاطعة (cross-entropy-supervised decoder)، محققاً بذلك أداءً منافساً للنماذج المنفصلة والمستمرة الحالية.

Na Li, Yuchen Jiao, Changxiao Cai, Gen Li2026-08-25
🤖 AI

Prime Agent: A Self-Improving RLM Harness

يُعد Prime Agent عبارة عن إطار عمل مفتوح المصدر وذاتي التحسين يستخدم بيئة IPython REPL مستمرة وعملاء فرعيين متكررين لتوحيد التنفيذ وإدارة الموارد، مما يعزز أداء النموذج بشكل كبير في المهام المعقدة طويلة الأمد مثل ARC-AGI-3 والبرمجة المستقلة.

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch, Daniel Auras, Mika Senghaas, Fares Obeid, Kons (…)2026-08-25
💬 NLP

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

يقدم البحث SWE Refactor Bench، وهو معيار مرجعي صارم يضم ٢٠ عملية هجرة لمستودعات برمجية كاملة وبروتوكول تقييم ثلاثي المراحل للكشف عن القيود الحالية لوكلاء البرمجة، الذين حققوا نسبة نجاح تبلغ ٥.٤٪ فقط في إتمام عمليات هجرة المجموعات البرمجية المعقدة وطويلة الأمد بشكل مستقل دون الاعتماد على حيل سلوكية.

Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai (…)2026-08-25