💬 NLP

Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

تقدم هذه الورقة SAERL، وهو إطار عمل لهندسة البيانات يستفيد من المشفّرات التلقائية المتناثرة (Sparse Autoencoders) لاستخراج إشارات النموذج الجوهرية المتعلقة بتنوع البيانات وصعوبتها وجودتها، مما يؤدي إلى تحسين التعلم التعزيزي لما بعد التدريب للنماذج اللغوية الكبيرة (LLM) بدقة وكفاءة أفضل.

Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang2026-05-27
💬 NLP

MobileMoE: Scaling On-Device Mixture of Experts

تقدم الورقة البحثية MobileMoE، وهي عائلة من نماذج لغوية تعتمد على تقنية "خليط الخبراء" (Mixture-of-Experts) ذات معلمات تقل عن المليار، مصممة للعمل على الأجهزة، والتي تعمل على تحسين البنية والتدريب لتحقيق أداء وكفاءة متفوقين مقارنة بالنماذج الكثيفة ونماذج "خليط الخبراء" المرجعية الحالية، مما يتيح استنتاجاً سريعاً على الهواتف الذكية الشائعة.

Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoor (…)2026-05-27
⚡ electrical engineering

Natural Language Query to Configuration for Retrieval Agents

تقدم الورقة البحثية نظام **BRANE**، وهو نظام يعمل على تحسين تكوينات وكيل الاسترجاع ديناميكيًا لكل استعلام باستخدام نموذج لغوي كبير لاستخراج خصائص عبء العمل ومتنبئ خفيف الوزن لاختيار إعداد خط الأنابيب الأكثر فعالية من حيث التكلفة، مما يحقق مقايضات فائقة بين التكلفة والجودة مقارنة بالضبط الثابت والأساليب المرجعية الحالية.

Melissa Z. Pan, Negar Arabzadeh, Mathew Jacob, Fiodar Kazhamiaka, Esha Choukse, Matei Zaharia2026-05-27
🤖 AI

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

تقدم الورقة البحثية MUSE-Autoskill، وهو إطار عمل لوكيل ذاتي التطور يعزز قدرات حل المهام من خلال إدارة المهارات عبر دورة حياة موحدة من الإنشاء، والذاكرة، والإدارة، والتقييم، والتحسين، مع التعامل معها كأصول طويلة الأمد وواعية بالخبرة لتحسين قابلية إعادة الاستخدام، والموثوقية، ونقل المهارات عبر المهام.

Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang2026-05-27
🤖 AI

Algorithmic Monocultures in Hiring

تحلل هذه الورقة مجموعة بيانات جديدة لـ 4 ملايين طلب توظيف تم فحصها بواسطة مورد خوارزمي واحد، وتجد أن مثل هذه الاحتكارات الخوارزمية تخلق نتائج رفض متجانسة تؤثر بشكل غير متناسب وسلبي على المتقدمين من ذوي الأصول الأفريقية والآسيوية، مما يستلزم غالباً اتباع استراتيجيات تقديم واسعة النطاق لضمان المراجعة البشرية.

Rishi Bommasani, Sarah H. Bana, Kathleen A. Creel, Dan Jurafsky, Percy Liang2026-05-27
📈 economics

The Impact of Large Language Models on Open-source Innovation: Evidence from GitHub Copilot

تستفيد هذه الورقة من الإطلاق المتدرج لـ GitHub Copilot عبر لغات البرمجة كـتجربة طبيعية لتوضيح أنه في حين أن النماذج اللغوية الكبيرة تعزز المساهمات مفتوحة المصدر بشكل كبير، إلا أنها تحابي بشكل غير متناسب صيانة الكود التدريجية على حساب الابتكار الجوهري، مما يحول الجهود التعاونية نحو استغلال قواعد الكود الحالية بدلاً من استكشاف وظائف جديدة.

Doron Yeverechyahu, Raveesh Mayya, Gal Oestreicher-Singer2026-05-26
🤖 AI

The Meme Is the Message: Generative Memesis and AI Visuals in the 2024 USA Presidential Elections

من خلال تحليل أكثر من 239,000 صورة من إنستغرام من الانتخابات الأمريكية لعام 2024، تقدم هذه الدراسة مفهوم "الميمات التوليدية" (generative memesis) لتوضيح أنه في حين أن قوالب الميمات تحفز التفاعل أكثر من الذكاء الاصطناعي بمفرده، فإن التآزر بين الصور الاصطناعية التي ينسقها البشر يعزز المشاركة السياسية بشكل كبير، مما يكشف عن استراتيجيات حزبية متميزة في كيفية استخدام الديمقراطيين والجمهوريين للذكاء الاصطناعي لدعم الجماعة الداخلية مقابل مهاجمة الجماعة الخارجية.

Ho-Chun Herbert Chang, Benjamin Shaman, Yung-chun Chen, Mingyue Zha, Sean Noh, Chiyu Wei, Tracy Weener, Maya Magee2026-05-26
🤖 AI

Fusion Embedding for Pose-Guided Person Image Synthesis with Diffusion Model

تقترح هذه الورقة البحثية إطار عمل FPDM، وهو إطار عمل جديد يعتمد على الانتشار لتوليد صور الأشخاص الموجهة بالوضعية، والذي يستخدم وحدة دمج الصورة والوضعية الصريحة والتعلم التبايني لمحاذاة تضمينات وضعية المصدر مع الصور المستهدفة، مما يؤدي إلى تحسين دقة الملمس واتساق التوليد بشكل كبير عبر الوضعيات والمظاهر المتنوعة.

Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim2026-05-26
🧬 biology

FragmentNet: Adaptive Graph Fragmentation for Graph-to-Sequence Molecular Representation Learning

تُقدم الورقة البحثية نموذج FragmentNet، وهو نموذج من الرسم البياني إلى المتسلسلة (graph-to-sequence) يستخدم أداة ترميز تكيفية مبتكرة لتفكيك الجزيئات إلى شظايا صالحة كيميائياً ذات حبيبية قابلة للضبط، مما يثبت أن التدريب المسبق على مستوى هذه الشظايا يحسن بشكل كبير أداء التنبؤ بالخصائص في المهام اللاحقة مقارنة بالنهج التقليدية القائمة على مستوى الذرة أو القواعد الصارمة.

Ankur Samanta, Rohan Gupta, Aditi Misra, Christian McIntosh Clarke, Jayakumar Rajadas2026-05-26
🤖 machine learning

Kolmogorov-Arnold Fourier Networks

تقدم هذه الورقة شبكات كولموغوروف-أرنولد فورير (KAF)، وهي بنية مبتكرة تتغلب على مشكلات انفجار المعلمات ومحدودية الترددات العالية التي تعاني منها شبكات KAN التقليدية عبر استبدال شرائح B-spline المحلية بتمثيل طيفي عالمي وتكيفي باستخدام ميزات فورير العشوائية القابلة للتدريب وآلية تنشيط هجينة، محققةً بذلك أداءً وكفاءةً رائدين في مختلف المهام.

Jusheng Zhang, Yijia Fan, Kaitong Cai, Keze Wang, Wenhao Wang2026-05-26