🤖 machine learning

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

تقدم الورقة البحثية إطار عمل SLIM، وهو إطار عمل جاهز للتشغيل (plug-and-play) يعزز تحرير الجزيئات الموجه بالخصائص في النماذج اللغوية الكبيرة عبر تفكيك الحالات الخفية إلى سمات متفرقة وقابلة للتفسير بواسطة مُشفّر تلقائي متفرع (Sparse Autoencoder)، مما يتيح توجيهاً دقيقاً يحسن معدلات نجاح التحرير بشكل كبير دون تعديل معاملات النموذج.

Mingxu Zhang, Yuhan Li, Lujundong Li, Dazhong Shen, Hui Xiong, Ying Sun2026-05-12
🤖 AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

تقدم هذه الورقة البحثية MMVIAD، وهي أول مجموعة بيانات ومعيار مرجعي للفيديو المستمر متعدد المشاهد لكشف الشذوذ الصناعي، وتقترح VISTA، وهو نموذج تم تدريبه عبر مسار تدريب لاحق مبتكر من مرحلتين يتفوق بشكل كبير على النماذج اللغوية الكبيرة متعددة الوسائط للفيديو الحالية والأسس المرجعية بمستوى البشر عبر أربع مهام تفتيش صناعية رئيسية.

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu2026-05-12
🧬 biology

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

يقدم Clin-JEPA إطار عمل تدريب مشترك مستقر مكون من خمس مراحل ينجح في تطويع بنية التنبؤ بالتمثيل المشترك (JEPA) لتتناسب مع بيانات السجلات الصحية الإلكترونية، وذلك عبر التدريب المشترك لمُشفّر ومتنبئ، مما يمكّن نموذجاً أساسياً واحداً من تحقيق تنبؤ فائق لمسارات الفضاء الكامن وتنبؤ متعدد المهام بالمخاطر دون الحاجة إلى ضبط دقيق لكل مهمة على حدة.

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Al (…)2026-05-12
🤖 AI

Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

تقدم الورقة البحثية DISCA، وهي طريقة تعتمد على الاستدلال في وقت التشغيل، وهي طريقة "الصندوق الأسود" التي لا تتطلب تدريباً، وتعمل على مواءمة النماذج اللغوية الكبيرة مع التفضيلات الثقافية المتنوعة من خلال الاستفادة من الخلافات في الشخصيات القائمة على مسح القيم العالمي لتصحيح مخرجات النموذج دون الحاجة إلى ضبط دقيق.

Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen, Chi-Nguyen Tran, Phu-Hoa Pham, Nguyen Lam Phu Quy, The Anh Han, Long Tra (…)2026-05-12
🤖 AI

BEACON: A Multimodal Dataset for Learning Behavioral Fingerprints from Gameplay Data

تقدم هذه الورقة البحثية BEACON، وهي مجموعة بيانات متعددة الوسائط واسعة النطاق تضم بيانات لعب متزامنة لـ 28 لاعباً من لعبة Valorant، صُممت لتعزيز أبحاث المصادقة المستمرة وبصمة السلوك عبر التقاط إشارات حركية وإدراكية عالية الدقة تحت ضغط تنافسي واقعي.

Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal, Guramrit Singh, Gurjot Singh, Maninder Singh2026-05-12
🤖 AI

Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory

تقترح هذه الورقة DeMem، وهو إطار عمل للذاكرة متمحور حول القرار يعمل على تحسين أداء الوكيل في المدى الطويل تحت ميزانيات محدودة من خلال إعطاء الأولوية للحفاظ على التمايزات الحاسمة لاتخاذ القرار على حساب الدقة الوصفية، محققاً بذلك ضمانات تقترب من الحد الأدنى من الندم (near-minimax regret) ومكاسب ثابتة في الاختبارات المعيارية الاصطناعية والحوارية.

Mingxi Zou, Zhihan Guo, Langzhang Liang, Zhuo Wang, Qifan Wang, Qingsong Wen, Irwin King, Lizhen Qu, Zenglin Xu2026-05-12
🧬 biology

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

تقدم هذه الورقة البحثية AssayBench، وهو معيار مرجعي جديد يضم 1,920 من فحوصات كريسبر (CRISPR) المصممة لتقييم قدرة النماذج اللغوية الكبيرة والوكلاء على التنبؤ بالنتائج المظهرية الخلوية، مما يكشف أن النماذج اللغوية الكبيرة العامة ذات القدرة على التعلم الصفري تتفوق حالياً على النماذج البيولوجية المتخصصة، مع تسليط الضوء على وجود مجال كبير للتحسين نحو تحقيق نماذج خلية افتراضية قوية.

Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajira (…)2026-05-12
🤖 machine learning

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

تقدم هذه الورقة إطاراً تشخيصياً لكل رمز (per-token) لا يتطلب تدريباً، يكشف أن التقطير القائم على السياسة (on-policy distillation) يكون أكثر فائدة في تصحيح خطوات الاستدلال غير الصحيحة بدلاً من تعزيز الخطوات الصحيحة، مع إثبات أن تكوين التقطير الأمثل يختلف بشكل كبير بناءً على قدرة النموذج الطالب والمهمة المحددة.

Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik (…)2026-05-12
🤖 machine learning

DataMaster: Towards Autonomous Data Engineering for Machine Learning

تقدم الورقة البحثية DataMaster، وهو إطار عمل لوكيل مستقل يعزز أداء تعلم الآلة من خلال تحسين مهام هندسة البيانات — مثل الاكتشاف، والاختيار، والتحويل — عبر بحث ذي بنية شجرية مع أحواض بيانات مشتركة وذاكرة تراكمية، محققاً تحسينات ملحوظة في اختبارات MLE-Bench Lite وPostTrainBench دون تعديل خوارزميات التعلم الأساسية.

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xiny (…)2026-05-12
🤖 AI

Confidence-Guided Diffusion Augmentation for Enhanced Bangla Compound Character Recognition

تقترح هذه الورقة إطار عمل لتعزيز الانتشار الموجه بالثقة يقوم بتخليق حروف مركبة مكتوبة بخط اليد للغة البنغالية عالية الجودة باستخدام نماذج انتشار مشروطة بالفئة مع تحسينات "الضغط والإثارة" وآلية تصفية، محققةً دقة جديدة هي الأفضل في فئتها بنسبة 89.2% على مجموعة بيانات AIBangla.

Md. Sultan Al Rayhan, Maheen Islam2026-05-12