🤖 machine learning

New York Smells: A Large Multimodal Dataset for Olfaction

تقدم الورقة البحثية "روائح نيويورك" (New York Smells)، وهي مجموعة بيانات متعددة الوسائط واسعة النطاق تحتوي على 7,000 زوج من الصور والروائح من بيئات واقعية متنوعة، والتي تُظهر أن البيانات المرئية تسهل تعلم التمثيل الشمي عبر الوسائط وتتفوق على الميزات التقليدية المصممة يدويًا في مهام مثل الاسترجاع والتصنيف.

Ege Ozguroglu, Junbang Liang, Ruoshi Liu, Mia Chiquier, Michael DeTienne, Wesley Wei Qian, Alexandra Horowitz, Andrew Ow (…)2026-08-04
🤖 AI

Knowledge Graph Augmented Large Language Models for Disease Prediction

تقترح هذه الورقة إطار عمل لتسلسل الأفكار موجهاً بالرسم البياني للمعرفة، يقوم بضبط نماذج لغوية كبيرة خفيفة الوزن على السجلات الصحية الإلكترونية لتحقيق تنبؤ قوي بالأمراض مفضل سريرياً وأداء نقل صفري القدرة مع مبررات واضحة ومتسقة زمنياً.

Ruiyu Wang, Tuan Vinh, Ran Xu, Yuyin Zhou, Jiaying Lu, Francisco Pasquel, Mohammed K Ali, Carl Yang2026-08-04
💰 quantitative finance

Bounded Normative Equivalence in Human-AI Cooperation: Group Behaviour, Not Partner Labels, Predicts Cooperation under Anonymous Aggregate Feedback

في الإعدادات الجماعية المجهولة ذات التغذية الراجعة التجميعية، لا يغير الملصق الذي يشير إلى ذكاء اصطناعي السلوك التعاوني أو استمرارية المعايير بشكل كبير مقارنة بالملصق البشري، حيث يظل تاريخ المساهمة الجماعية والأفعال الماضية الفردية هي المحركات الأساسية للتعاون، مما يدل على "تكافؤ معياري محدود" حيث تتقلص دلالات الهوية بفعل البنية المعلوماتية.

Nico Mutzner, Taha Yasseri, Heiko Rauhut2026-08-04
🤖 AI

Geometric Analysis of Token Selection in Multi-Head Attention

تقدم هذه الورقة إطاراً هندسياً لتحليل الانتباه متعدد الرؤوس في النماذج اللغوية الكبيرة من خلال تعريف مقاييس الدقة والاستدعاء ودرجة F لتكميم قابلية فصل الرموز، واستخلاص حدود غير تقاربية تتنبأ بالأداء الأمثل في أنظمة N الصغيرة، والتحقق تجريبياً من هذه النتائج عبر نماذج متعددة للكشف عن أنماط تميز الرؤوس المتميزة وتوجيه عملية التناثر الواعي بالهندسة.

Timur Mudarisov, Mikhal Burtsev, Tatiana Petrova, Radu State2026-08-04
🤖 AI

RAP: KV-Cache Compression via RoPE-Aligned Pruning

تقدم هذه الورقة البحثية تقنية "التقليم المتوافق مع تضمين الموضع الدوراني" (RoPE-Aligned Pruning - RAP)، وهي طريقة تقليم هيكلية تحافظ على دلالات تضمين الموضع الدوراني عن طريق إزالة قنوات ذاكرة المفتاح والقيمة (KV cache) في أزواج متوافقة، مما يحقق وفراً كبيراً في الذاكرة والحوسبة لاستنتاج النماذج اللغوية الكبيرة ذات السياق الطويل دون التضحية بالدقة.

Jihao Xin, Tian Lyu, David Keyes, Hatem Ltaief, Marco Canini2026-08-04
💬 NLP

Transformers perform adaptive partial pooling

تُظهر هذه الورقة أن المحولات (transformers) تُبدي تجميعًا جزئيًا تكيفيًا مشابهًا للانحدار الهرمي من خلال الاستفادة من المعلومات المستمدة من السياقات غير المتكررة والمتشابهة، حيث يبلغ هذا السلوك ذروته عند "نقطة مثالية" محددة في التدريب حيث يتم تعظيم تأثير تكرار السياق قبل أن يتضاءل مع استمرار التدريب.

Vsevolod Kapatsinski2026-08-04
🤖 AI

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

تقدم الورقة البحثية PLuRel، وهو إطار عمل خفيف الوزن لتخليق قواعد بيانات علاقية متعددة الجداول ومتنوعة، يثبت لأول مرة أن توسيع نطاق البيانات الاصطناعية يحسن أداء وتعميم النماذج التأسيسية العلاقية.

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Le (…)2026-08-04
🤖 AI

A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video

تقدم هذه الورقة إطار عمل هجينًا شفافًا وحتميًا لاستخراج الأسماء الشخصية من فيديوهات الأخبار البثية، يعطي الأولوية للقابلية للتدقيق والتتبع الخالي من الهلوسة على حساب مكاسب الدقة الهامشية للنماذج التوليدية متعددة الوسائط.

Andrea Filiberto Lucas, Dylan Seychell2026-08-04
🤖 AI

Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents

تقدم هذه الورقة نظام توصية ذاتي التطور يستخدم وكلاء نماذج اللغة الكبيرة Gemini من Google لتوليد والتحقق ونشر بنيات النماذج ودوال المكافأة المُحسّنة بشكل مستقل عبر سير عمل ثنائي الحلقة، مما أثبت بنجاح سرعة تطوير وأداءً فائقين في بيئات الإنتاج في YouTube مقارنة بالهندسة اليدوية التقليدية.

Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt2026-08-04
💬 NLP

LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering

تُعد LangFIR طريقة مبتكرة تحدد الميزات المتفرقة والخاصة بكل لغة في النماذج اللغوية الكبيرة متعددة اللغات باستخدام البيانات أحادية اللغة فقط وتصفية الرموز العشوائية، مما يتيح توجيهاً لغوياً عالي الفعالية يتفوق على الأساليب الحالية التي تعتمد على البيانات المتوازية المكلفة.

Sing Hieng Wong, Hassan Sajjad, A. B. Siddique2026-08-04