💻 computer science

HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

يُعد HVM-GraphRAG إطار عمل مبتكر لـ GraphRAG متعدد الوسائط ذو رؤية شاملة، يعزز الإجابة على الأسئلة عبر المستندات المعقدة من خلال بناء مؤشرات رسومية موثوقة على مستوى المفاهيم لتمكين الاسترجاع الفعال وإعادة تنظيم الأدلة غير المتجانسة وفقاً لكل وسيط، مما يجعله يتفوق على النماذج المرجعية الحالية في كل من الدقة والكفاءة.

Xin He, Yili Wang, Wenqi Fan, Qing Li, Qinggang Zhang, Yi Chang, Xin Wang2026-07-29
🤖 machine learning

Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems

تقترح هذه الورقة البحثية "المعرفات الدلالية مزدوجة الغرض" (Dual-purpose Semantic IDs)، وهي طريقة تستخدم التكميم الهرمي لتحويل التضمينات الكثيفة إلى رموز منفصلة لكل من الهوية التعاونية وإعادة بناء المحتوى، مما يحقق كفاءة في الإدخال والإخراج بمستوى النماذج اللغوية الكبيرة (LLM) ويُنجح في النشر ضمن أنظمة التوصية ذات النطاق الإنتاجي للتغلب على اختناقات الذاكرة.

Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong2026-07-29
🤖 AI

MusiChat: Vibe Composing for Music Creation

إن MusiChat هو نظام ذكاء اصطناعي حواري يتيح إنشاءً موسيقياً تعاونياً وتكرارياً من خلال استخدام إطار عمل هرمي قابل للتحكم لتنقيح وتحويل البنى الموسيقية تدريجياً بناءً على مطالبات باللغة الطبيعية، متجاوزاً بذلك قيود نماذج "المطالبة وإعادة التوليد" التقليدية.

Callie C. Liao, Duoduo Liao, Ellie L. Zhang2026-07-29
🤖 machine learning

Human Preference aligned Tabular Similarity

تجادل هذه الورقة بأن طرق تضمين البيانات الجدولية الحالية، والمُحسّنة لمهام التنبؤ، تفشل في التوافق مع التفضيلات البشرية للبحث عن التشابه، وتقترح إجراء تقييم جديد لمعالجة هذه الفجوة باستخدام حالة استخدام إدارة دورة حياة المنتج (PLM).

Frederik Hoppe, Astrid Franz, Marianne Michaelis, Lars Kleinemeier, Udo Göbel2026-07-29
💬 NLP

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

تقدم هذه الورقة "Agent Retrieval Bench"، وهو معيار شامل على مستوى الملفات لتقييم استرجاع السياق في وكلاء البرمجة باستخدام إشارات سير العمل الحقيقية، والذي يكشف أنه لا توجد طريقة استرجاع واحدة تهيمن عبر المهام المتنوعة، ويسلط الضل على فجوات كبيرة في قدرة الوكلاء الحاليين على تحديد ملفات المستودع الضرورية.

Bowen Qin, Yi Xie2026-07-29
💬 NLP

Beyond "What to Retrieve": Uncertainty in Retrieval-Augmented Code Generation

تقدم هذه الورقة OpenCoder، وهو إطار عمل مدرك لعدم اليقين يقوم بتقدير واستغلال عدم اليقين الخاص بالمصدر لتصفية وترتيب أدلة الاسترجاع غير المتجانسة، مما يحسن صحة توليد الكود على مستوى المستودع مع إثبات أن فوائده تعتمد على النموذج اللغوي الكبير الخلفي وتفاعلات الأدلة.

Chandan Kumar Sah, Xiaoli Lian, Li Zhang2026-07-29
🤖 machine learning

Mechanisms of Width Scaling in Normalized Residual Networks: The Effective Alignment Dimension

تقدم هذه الورقة "بُعد المحاذاة الفعالة" ككمية قابلة للقياس لتوصيف هندسة الإشارة والضجيج لتدرجات التنشيط، مقدمةً حداً نظرياً للعينة المحدودة وأدلة تجريبية على أن النماذج الأعرض في الشبكات المتبقية تحسن أداء الاختبار من خلال زيادة هذا البُعد وتقليل عدم محاذاة التدرج بين بيانات التدريب وبيانات الاختبار.

Jinhao Zhang, Zeyu Liu, Zicheng Yan, Yunquan Zhang, Guangming Tan, Fangming Liu, Daning Cheng2026-07-29
🤖 machine learning

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

تقدم الورقة البحثية GAUGE، وهو معيار مرجعي مبتكر يقيم النماذج المالية التي تبنيها أنظمة الذكاء الاصطناعي مقابل الممارسات الملحوظة للمحللين بدلاً من إجابة "ذهبية" واحدة، مما يكشف أنه بينما تتفوق الوكلاء الحاليون في البناء الآلي للنماذج، إلا أنهم لا يزالون يتخلفون بشكل كبير عن المتخصصين البشريين في أحكام التقييم.

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yiji (…)2026-07-29
💻 computer science

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

تجادل ورقة الموقف هذه بأن كواشف السمية الشاملة تفشل في حماية المجتمعات المهمشة، مثل ذوي القزامة أو الإعاقات البصرية، وتوضح أن الكشف عن السمية الخاص بالمجتمعات، رغم تحسينه الكبير للتعرف على الضرر من خلال التكيف القائم على المطالبات والضبط الدقيق، لا يزال يتطلب بحثاً مكثفاً للوصول إلى مستويات الأداء التي تحققها الأنظمة العامة.

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camill (…)2026-07-29
🤖 machine learning

Stable FP4 Training via Transposition-Invariant Block Quantization

تقدم هذه الورقة إطار عمل مستقر للتدريب بنظام FP4 لنماذج اللغات الكبيرة، يعالج عدم استقرار التحسين الناتج عن تبديل الموتّرات في أساليب القياس المجهري التقليدية من خلال فرض تكميم كتل ثنائي الأبعاد غير متأثر بتبديل الموتّرات، محققاً أداءً يضاهي نظام BF16 مع حد أدنى من التدهور عبر نماذج تصل إلى 30 مليار معلمة.

Mehdi Rahimifar, Amin Darabi, Mehran Taghian Jazi, Xing Huang, Yao Wang, Zhijun Tu, Yufei Cui, Yunke Peng, Hongliang Li2026-07-29