🤖 machine learning

Efficient Multi-Source Knowledge Transfer by Model Merging

تقترح هذه الورقة إطار عمل للتعلم بنقل المعرفة متعدد المصادر يتسم بالقابلية للتوسع والدقة، حيث يقوم بتفكيك نماذج المصدر إلى مكونات من الرتبة الأولى عبر تحليل القيم المفردة (SVD)، وتجميع المكونات الأكثر بروزاً، وضبط القيم المفردة الرئيسية فقط بدقة ليتكيف بكفاءة مع مهام الهدف مع الحفاظ على المتانة.

Marcin Osial, Bartosz Wójcik, Bartosz Zieliński, Sebastian Cygert2026-04-24
🤖 machine learning

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

تقدم هذه الورقة البحثية خوارزمية CE-GPPO، وهي خوارزمية تعلم تعزيزي جديدة تعمل على تثبيت إنتروبيا السياسة وتحسين أداء الاستنتاج في النماذج اللغوية الكبيرة من خلال إعادة إدخال التدرجات المحدودة من الرموز المقصوصة التي يتم تجاهلها عادةً في خوارزمية PPO القياسية.

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou2026-04-24
🤖 machine learning

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models

تقدم الورقة البحثية ChessArena، وهو إطار عمل تنافسي قائم على الشطرنج لتقييم النماذج اللغوية الكبيرة، كاشفةً أن النماذج الحالية تفتقر إلى قدرات الاستنتاج الاستراتيجي الحقيقية رغم امتلاكها قدرة قوية على التعرف على الأنماط، بينما تُظهر في الوقت ذاتما أن الضبط الدقيق يمكن أن يسد هذه الفجوة في الأداء بشكل كبير.

Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao2026-04-24
🤖 machine learning

Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data

تقدم هذه الورقة أول إطار عمل للتعلم النشط متعدد الوسائط مع بيانات غير متوافقة، حيث تقترح خوارزمية مدركة للوسائط تعمل على اكتساب التوافقات عبر الوسائط بكفاءة لتقليل تكاليف التوسيم بشكل كبير مع الحفاظ على أداء النموذج.

Jiancheng Zhang, Yinglun Zhu2026-04-24
📊 statistics

Learning Linear Regression with Low-Rank Tasks in-Context

تقدم هذه الورقة إطاراً نظرياً لفهم التعلم في السياق في نماذج الانتباه الخطي من خلال توصيف توزيعات التنبؤ وأخطاء التعميم في مهام الانحدار منخفضة الرتبة، مما يكشف كيف تسبب تقلبات البيانات المحدودة تنظيماً ضمنياً وكيف يحكم هيكل المهمة التحولات الطورية الحادة في الأداء.

Kaito Takanami, Takashi Takahashi, Yoshiyuki Kabashima2026-04-24
🤖 machine learning

ATOM: A Pretrained Neural Operator for Multitask Molecular Dynamics

تقدم الورقة البحثية ATOM، وهو عامل تشغيل عصبي من نوع "ترانسفورمر" مدرب مسبقاً يستفيد من تصميم شبه متماثل (quasi-equivariant) وانتباه زمني لتحقيق تعميم صفري (zero-shot generalization) هو الأفضل حالياً في محاكاة الديناميكيات الجزيئية متعددة المهام عبر جزيئات وآفاق زمنية متنوعة، مدعوماً بمجموعة بيانات TG80 التي تم تنسيقها حديثاً.

Luke Thompson, Davy Guan, Dai Shi, Slade Matthews, Junbin Gao, Andi Han2026-04-24
🤖 machine learning

Accelerating Vision Transformers with Adaptive Patch Sizes

تقدم هذه الورقة البحثية "محولات الرقع التكيفية" (Adaptive Patch Transformers - APT)، وهي طريقة تعمل على ضبط أحجام الرقع ديناميكيًا بناءً على محتوى الصورة لتقليل عدد الرموز (tokens) بشكل كبير وتسريع تدريب واستنتاج نماذج "المحولات البصرية" (ViT) بنسبة تصل إلى 50% مع الحفاظ على الأداء عبر مختلف المهام البصرية عالية الدقة.

Rohan Choudhury, JungEun Kim, Jinhyung Park, Eunho Yang, László A. Jeni, Kris M. Kitani2026-04-24
🤖 machine learning

VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

تقدم هذه الورقة البحثية VFM-VAE، وهو نهج مبتكر يستفيد من نماذج الرؤية التأسيسية المجمدة كأجهزة ترميز مباشرة لنماذج الانتشار الكامن دون الحاجة إلى التقطير، محققاً جودة فائقة في توليد الصور وتسريعاً في التدريب بمقدار 10 أضعاف مقارنة بالطرق السابقة.

Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng2026-04-24
🤖 machine learning

Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs

تقدم هذه الورقة البحثية "Not-a-Bandit"، وهي خوارزمية "لا ندم مثبت" (no-regret) لاختيار نماذج المسودة عبر الإنترنت في عملية فك التشفير التخميني، والتي تقيم بكفاءة جميع النماذج المرشحة دون استعلامات إضافية من النموذج المستهدف، مما يتفوق بشكل أسي على النهج القائم على الـ "bandit" والأساليب المرجعية الحديثة مثل EAGLE3 عبر مجالات متنوعة.

Hongyi Liu, Jiaji Huang, Zhen Jia, Youngsuk Park, Yu-Xiang Wang2026-04-24
🤖 machine learning

Addressing divergent representations from causal interventions on neural networks

تُظهر هذه الورقة أن التدخلات السببية الشائعة في الشبكات العصبية غالبًا ما تُنشئ تمثيلات خارج نطاق التوزيع يمكن أن تؤدي إلى تفسيرات مضللة، وتقترح خسارة "الكمون المضاد للواقع" (Counterfactual Latent loss) المعدلة للتخفيف من حدة هذه الانحرافات "الخبيثة" مع الحفاظ على القدرة التفسيرية.

Satchel Grant, Simon Jerome Han, Alexa R. Tartaglini, Christopher Potts2026-04-24