🤖 machine learning

Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment

تقدم هذه الورقة REPR-ALIGN، وهي طريقة تسرع تدريب نماذج اللغات الانتشارية من خلال محاذاة حالاتها الخفية مع حالات نموذج تلقائي الترتيب مجمد، مما يحافظ على التمثيلات الدلالية المتعلمة ويسمح بالتكيف الفعال دون تغييرات هيكلية أو معاملات إضافية.

Fred Zhangzhi Peng, Alexis Fox, Anru R. Zhang, Alexander Tong2026-05-11
🤖 AI

Mitigating Cognitive Bias in RLHF by Altering Rationality

تقترح هذه الورقة طريقة للتخفيف من التحيز المعرفي في التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) عن طريق ضبط معيار العقلانية ديناميكيًا أثناء تعلم المكافأة، باستخدام نموذج لغوي كبير كحكم لتحديد المقارنات البشرية المتحيزة وتقليل وزنها، مما يؤدي إلى تدريب نماذج أكثر متانة حتى على مجموعات البيانات غير المثالية.

Tiffany Horter, Andrew Markham, Niki Trigoni, Serena Booth2026-05-11
💬 NLP

MELD: Multi-Task Equilibrated Learning Detector for AI-Generated Text

تقدم الورقة البحثية MELD، وهو كاشف متعدد المهام للنصوص المولدة بواسطة الذكاء الاصطناعي يعزز المتانة ضد الهجمات، وتحولات النطاق، والمولدات غير المرئية من خلال توظيف الإشراف المساعد، وتقطير المعرفة، وتصنيف السلبيات الصعبة، محققاً أداءً هو الأفضل في مجاله على المقاييس المرجعية مع الحفاظ على كفاءة الكاشف الثنائي القياسي.

Chenjun Li, Cheng Wan, Johannes C. Paetzold2026-05-11
🤖 machine learning

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

تقدم هذه الورقة DIAL، وهو إطار تعلم تكيفي مستند إلى الاتجاه يتغلب على عدم استقرار إشارات البوابة ذات الاتجاه الثابت في وكلاء النماذج اللغوية الكبيرة (LLM agents) من خلال تعلم اتجاهات المنفعة الخاصة بالبيئة عبر الاستكشاف المضاد للواقع، محققاً بذلك توازناً متفوقاً بين النجاح والتكلفة عبر إعدادات متنوعة.

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang2026-05-11
🤖 AI

In-Context Credit Assignment via the Core

تقترح هذه الورقة آلية متوافقة مع الحوافز لتعيين الائتمان في السياق بناءً على حل "اللب الأدنى" من نظرية الألعاب التعاونية، مقدمةً خوارزميات فعالة تقرب التوزيع العادل للقيمة بين منشئي المحتوى باستخدام عدد أقل بكثير من استدعاءات النماذج اللغوية الكبيرة مقارنة بالطرق الحالية.

Keegan Harris, Siddharth Prasad, Asher Trockman2026-05-11
🤖 AI

A2^2RD: Agentic Autoregressive Diffusion for Long Video Consistency

تقدم الورقة البحثية A2^2RD، وهو إطار عمل انتشار ذاتي التراجع وكيل (agentic autoregressive diffusion framework) يضمن اتساق الفيديو الطويل من خلال دورة مغلقة من الاسترجاع-التوليد-التحسين-التحديث وذاكرة متعددة الوسائط، متفوقاً على أحدث الأساليب بنسبة تصل إلى 30% في الاتساق و20% في التماسك السردي.

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le2026-05-11
🤖 AI

XiYOLO: Energy-Aware Object Detection via Iterative Architecture Search and Scaling

يقدم XiYOLO إطار عمل للكشف عن الأشياء يراعي استهلاك الطاقة، يجمع بين البحث التكراري عن البنية العصبية ومقدر طاقة ثنائي المراحل والتحجيم المركب لتوليد عائلة من النماذج التي تحقق توازنات فائقة بين الدقة واستهلاك الطاقة على الأجهزة الطرفية غير المتجانسة مقارنة بنماذج YOLO المرجعية.

Tony Tran, Richie R. Suganda, Bin Hu2026-05-11
🤖 AI

Bridging the Last Mile of Circuit Design: PostEDA-Bench, a Hierarchical Benchmark for PPA Convergence and DRC Fixing

تقدم هذه الورقة PostEDA-Bench، وهو معيار مرجعي هرمي يضم 145 مهمة قابلة للتحقق آلياً لتقييم وكلاء النماذج اللغوية الكبيرة في مهام إصلاح أخطاء تصميم الدوائر المتكاملة (DRC) وتقارب معايير الأداء والقدرة والاستهلاك (PPA)، مما يكشف أنه بينما يؤدي الوكلاء بشكل معقول في المهام الاصطناعية أو أحادية الهدف، فإنهم يعانون بشكل كبير في التفكير المعقد والمفاضلات متعددة الأهداف.

Pengju Liu, Nuo Xu, Jinwei Tang, Yu Cao, Caiwen Ding2026-05-11
🤖 machine learning

Adaptive Memory Decay for Log-Linear Attention

تقترح هذه الورقة البحثية "الاضمحلال الذاكراتي التكيفي" (Adaptive Memory Decay)، وهي طريقة تستبدل معامل الاضمحلال الثابت في آلية الانتباه اللوغاريتمي الخطي بآلية قابلة للتعلم وتعتمد على المدخلات عبر شبكة عصبية بسيطة متعددة الطبقات (MLP)، مما يعزز أداء الذاكرة طويلة المدى والمرونة مع الحفاظ على التعقيد الحسابي اللوغاريتمي الخطي للنموذج.

Yaxita Amin, Helen Zichen Li, Mengfan Zhang, Samet Ayhan2026-05-11
🤖 AI

Multi-Objective Constraint Inference using Inverse reinforcement learning

تقدم هذه الورقة البحثية إطار عمل استنتاج القيود متعدد الأهداف (MOCI)، وهو إطار عمل مبتكر يستخرج بفعالية القيود المشتركة والتفضيلات الفردية من عروض الخبراء المتباينة ذات الأهداف المتعارضة، متفوقاً على النماذج المرجعية الحالية في دقة التنبؤ مع الحفاظ على الكفاءة الحسابية.

Syed Ihtesham Hussain Shah, Floris den Hengst, Aneta Lisowska, Annette ten Teije2026-05-11