🤖 AI

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

تدافع هذه الورقة الموقفة عن تطوير "مجسات بيانات" منهجية — وهي تسلسلات اصطناعية مشتقة من عمليات عشوائية محددة — للارتقاء لما وراء الاستدلالات التجريبية كثيفة الحوسبة، ولتحقيق فهم نظري ومبدئي لكيفية تأثير خصائص بيانات معينة بشكل جوهري على أداء النماذج اللغوية الكبيرة، وقدرتها على التعميم، ومتانتها عبر مختلف مراحل سير العمل.

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji2026-05-20
🤖 machine learning

Adaptive Multi-Scale Goodness Aggregation for Forward-Forward Learning

تقدم هذه الورقة البحثية خوارزمية تجميع الجودة متعددة المقاييس التكيفية (AMSGA)، وهي امتداد مبتكر لخوارزمية "الأمام-للأمام" (Forward-Forward) تعمل على تعزيز الاستقرار والمتانة والتعميم من خلال تجميع التمثيلات متعددة المقاييس واستراتيجيات التدريب التكيفية، محققةً مكاسب أداء كبيرة في مجموعتي بيانات MNIST وFashion-MNIST مع الحفاظ على المعقولية البيولوجية وكفاءة الذاكرة.

Salar Beigzad, Vansh Verma2026-05-20
💻 computer science

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

تقدم هذه الورقة RecoAtlas، وهو معيار ومجموعة أدوات لتقييم وكلاء التسوق القائمين على النماذج اللغوية الكبيرة باستخدام مقاييس المنفعة المرتكزة على السلوك إلى جانب التماسك الدلالي، مما يثبت أن التفسيرات المنطقية لا تضمن مجموعات توصية فعالة وأن الأداء يتوسع مع قدرة النموذج والمواءمة مع الأدوات.

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann2026-05-20
🤖 machine learning

Block-Based Double Decoders

تقدم الورقة البحثية "المفككات المزدوجة القائمة على الكتل" (Block-Based Double Decoders)، وهي بنية ترانسفورمر مبتكرة تجمع بين كفاءة التدريب لنماذج "المفكك فقط" (decoder-only) وكفاءة الاستدلال لنماذج "المشفر-المفكك" (encoder-decoders) عبر استخدام أقنعة انتباه قائمة على الكتل ذات سببية مزدوجة لتحقيق أداء توسع فائق مع تقليل تكاليف الذاكرة والحوسبة بشكل كبير.

Asher Labovich, Benjamin Bradley, Vanessa Alexander, Chaitanya Harsha2026-05-20
🤖 machine learning

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

تحدد هذه الورقة وتتحقق من بنية تركيبية للمبادئ الأدبية الأولية —بما في ذلك بوابات التسمية، والسمات الذاتية، والمعدلات الأسلوبية— ضمن النماذج اللغوية الكبيرة المضبوطة بالتعليمات (Llama 3.1 وGemma 2) باستخدام المشفّرات التلقائية المتناثرة، مما يثبت أن توجيه السمات المستهدف يمكنه توليد مخرجات عاطفية وأسلوبية محددة بشكل موثوق عبر بنيات نماذج مختلفة بتكلفة حوسبية ضئيلة.

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira2026-05-20
🤖 machine learning

Metric-Gradient Projection for Stable Multi-Agent Policy Learning

تقدم هذه الورقة البحثية طريقة HPML (التعلم متعدد الوكلاء المعتمد على إسقاط هودج)، وهي طريقة تعمل على تثبيت التعلم التعزيزي متعدد الوكلاء ذي المجموع العام عبر إسقاط حقل تحديث السياسة المشتركة على مكون تدرج متري عبر تفكيك هودج، مما يقلل من الديناميكيات الدورية ويحسن التقارب من خلال جهد ليابونوف.

Zuyuan Zhang, Sizhe Tang, Mahdi Imani, Tian Lan2026-05-20
🤖 machine learning

D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting

تقدم الورقة البحثية D-PACE، وهي دالة فقدان "الاعتراض المتقاطع" الديناميكية المدركة للموضع التي تضبط أوزان التدريب تكيفياً بناءً على طول المسودة المتوقع قبولها لتحسين كفاءة وسرعة فك التشفير التكهني المتوازي دون تغيير بنية النموذج أو إجراءات الاستدلال.

Tianyu Wu, Yu Yao, Zhenting Qi, Han Zheng, Zhuohan Wang, Haoran Ma, Lawrence Liao, Himabindu Lakkaraju, Ju Li, Yilun Du2026-05-20
🤖 machine learning

Composition of Memory Experts for Diffusion World Models

تقدم هذه الورقة نموذج عالم قائم على الانتشار يتغلب على مقايضة الذاكرة والدقة في البنيات الحالية من خلال دمج خبراء ذاكرة متخصصة قصيرة المدى، وحلقية، ومكانية عبر صيغة تباينية لـ "حاصل ضرب الخبراء"، محققاً بذلك تنبؤاً مستقبلياً عالي الدقة وقابلاً للتوسع دون تكاليف حوسبة تربيعية.

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro2026-05-20
🤖 AI

Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production

تقدم هذه الورقة بنية خدمات مصغرة وتجربة تشغيلية لنشر مسارات الذكاء الاصطناعي للمستندات على نطاق واسع، مع تسليط الضوء على قرارات التصميم مثل فصل مهام وحدة معالجة الرسومات (GPU) عن مهام وحدة المعالجة المركزية (CPU)، وكشف أن زمن انتقال التعرف الضوئي على الحروف (OCR) وسعة وحدة معالجة الرسومات المشتركة، وليس تعقيد النموذج أو عدد العمال، هما العائقان الأساسيان في بيئة الإنتاج.

Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman (…)2026-05-20
🤖 machine learning

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

تقترح هذه الورقة البحثية "Hybrid-LoRA"، وهو إطار عمل لما بعد التدريب يجمع استراتيجياً بين الضبط الدقيق الكامل لمجموعة فرعية صغيرة وعالية الحساسية من الوحدات وبين التكيف منخفض الرتبة (Low-Rank Adaptation) لبقية الوحدات، محققاً أداءً يضاهي الضبط الدقيق الكامل مع تقليل التكاليف الحسابية بشكل كبير والتفوق على النماذج المرجعية الحالية الموفرة للمعلمات في مهام الاستدلال المعقدة.

Chengqian Zhang, Wei Zhu, Kyumin Lee2026-05-20