💬 NLP

MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum

تقدم هذه الورقة البحثية MoganBert-TR، وهو نموذج تأسيسي لترميز اللغة التركية بـ 149 مليون معلمة، تم تدريبه من الصفر باستخدام منهج تعليمي مبتكر من CLM إلى MLM وجدولة متخصصة للسياق الطويل، والذي يحقق أداءً هو الأفضل في فئته على معايير معالجة اللغات الطبيعية التركية ويُنتج نموذج تضمين عالي الكفاءة يصل إلى 99.5% من درجة نموذجه المعلم المكون من 7.57 مليار معلمة.

Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay2026-08-27
💬 NLP

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

تقدم هذه الورقة مسار معالجة يحول الأوراق العلمية المهيكلة إلى مسارات توليد متعددة الأدوار من أجل التدريب المسبق المستمر والاختبار المعياري، مما يثبت أن هذا النهج يعزز قدرات الكتابة الأكاديمية بشكل كبير مع الحفاظ على الاستدلال العام والاستيعاب للمستندات الطويلة.

Qiankai Xu, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang2026-08-27
💬 NLP

Skill Issue: Are Skills Language-Invariant in LLMs?

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تُظهر تباينات ملموسة وقابلة للقياس في المهارات عبر اللغات المختلفة، وذلك باستخدام إطار عمل "اللعب الذاتي" متعدد اللغات لإظهار أن النموذج نفسه يمكن أن يُبدي نقاط قوة، وقدرات استدلال، وسلوكيات استراتيجية متفاوتة بشكل ملحوظ اعتماداً فقط على واجهة اللغة المستخدمة.

Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen2026-08-27
🔬 physics

Missing the Butterfly and Predicting the Past: Features or Bugs of Accurate AI Weather Models?

تكشف هذه الورقة أن دقة التنبؤ العالية لنماذج الطقس القائمة على الذكاء الاصطناعي، إلى جانب قدرتها على التنبؤ العكسي الماهر وفشلها في إظهار تأثير الفراشة، تنبع من التجزئة الخشنة الحتمية لبيانات التدريب، والتي تعمل دون قصد على ترشيح نمو الأخطاء السريع وصغير النطاق مع الحفاظ على الأنماط واسعة النط scales.

Pedram Hassanzadeh, Weidong Li, Y. Qiang Sun, Jiangdi Wang, Alexander Wikner, Justin Finkel, Jonathan Q. Weare2026-08-27
💻 computer science

Unlocking Multimodal Protein Language Models at Inference Time

تؤسس هذه الورقة إطار عمل ثلاثي المراحل للبرهنة تجريبياً على أن تحسين استراتيجيات أخذ العينات أثناء الاستدلال لنماذج لغة البروتين متعددة الوسائط — وتحديداً من خلال التوجيه الخالي من التصنيف الخاص بالمهام والبحث الشعاعي الموجه بالمكافأة — يعزز الأداء بشكل كبير عبر مهام متعددة دون الحاجة إلى إعادة تدريب النموذج، بينما يتحدى أيضاً الإجماع السابق حول سلوكيات النماذج الأساسية.

Yi Zhou, Qipeng Wang, Yunqing Liu, Jun Xia, Qing Li, Wenqi Fan2026-08-27
🤖 machine learning

Towards A Unified Information Bottleneck Framework for Time Series Explanations

تقترح هذه الورقة {\modelname}، وهو إطار عمل موحد قائم على مبدأ عنق الزجاجة المعلوماتي (Information Bottleneck) يربط بين التفسيرات العزوية والتفسيرات المضادة للواقع لبيانات السلاسل الزمنية للتغلب على أوجه القصور في الطرق المستقلة الحالية، مثل الافتقار إلى التحقق السببي وعدم الاستقرار، وذلك من خلال تعلم شبكة تحويل معلمية تنتج عزوّات دقيقة وتفسيرات مضادة للواقع مستقرة.

Xu Zheng, Zichuan Liu, Zhuomin Chen, Mayur Akewar, Janki Bhimani, Jason Liu, Mo Sha, Jingchao Ni, Wei Cheng, Dongsheng L (…)2026-08-27
💻 computer science

LivingRAG: Augmenting Graph RAG with Experience

يُعد LivingRAG إطار عمل للبحث المعزز بالتوليد القائم على الرسوم البيانية (Graph RAG) يعمل على تعزيز الإجابة على الأسئلة متعددة الخطوات من خلال تخزين وإعادة استخدام تجارب الاستدلال التي تم التحقق منها — مثل إشارات الرسم البياني المفيدة وأنماط الاستدلال — لتحسين الدقة وتقليل استهلاك الرموز (tokens) عبر الاستعلامات ذات الصلة.

Yuzhuo Cui, Zongye Zhang, Qingjie Liu2026-08-27
🤖 machine learning

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

تقدم هذه الورقة SciMIF، وهو معيار مرجعي جديد يتميز بتصنيف شامل ومسار بيانات عالي الدقة لتقييم النماذج اللغوية الكبيرة متعددة الوسائط في التعليمات العلمية المعقدة، مما يكشف عن تفاوتات كبيرة في الأداء عبر التخصصات ويسلط الضوء على القيود الحالية في الالتزام بالقيود دقيقة التفاصيل رغم زيادة حجم النماذج.

Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai2026-08-27
🤖 machine learning

FRAME: separating sampling variation from representational cause in medical imaging fairness

تقدم هذه الورقة إطار عمل FRAME، وهو إطار عمل مكون من خطوتين يميز بين التباين في أخذ العينات والتحيز التمثيلي الحقيقي في عدالة التصوير الطبي من خلال إنشاء مرجع للنموذج العادل واختبار الفروقات المتبقية، مما يكشف أن جزءاً كبيراً من التفاوتات المبلغ عنها بين المجموعات الفرعية يمكن إرجاعه إلى الضوضاء الإحصائية بدلاً من آليات النموذج.

Mahshad Lotfinia, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh2026-08-27
💻 computer science

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

إنّ ProgRouter هو إطار عمل عبر الإنترنت، موجه بالتقدم، يقوم بتنسيق سير عمل النماذج اللغوية الكبيرة متعددة الوكلاء ديناميكيًا من خلال الاختيار التكيفي للوكلاء في كل خطوة بناءً على تقدم المهمة في الوقت الفعلي ومقاييس كفاءة التكلفة، مما يقلل بشكل كبير من تكاليف التشغيل مع الحفاظ على جودة عالية في حل المهام عبر مختلف مهام الاستدلال المعقدة.

Somgyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang2026-08-27