🤖 AI

Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagnosis, and Cost-Aware Routing

تقدم هذه الورقة QC-T2I-Bench، وهو إطار عمل قابل للتوسع ومرتكز على الأسئلة، يستفيد من رسوم ديفيدسونية البيانية للمشاهد (Davidsonian Scene Graphs) والتجميع المقيد بالتسلسل الهرمي لتمكين التصنيف الموثوق للنماذج، والتشخيص الدقيق للإخفاقات، والتوجيه الواعي بالتكلفة عبر تفكيك المطالبات إلى أسئلة ذرية ذات سمات وتحليل تبعياتها.

Shaoan Zhao, Fang Zhao, Xueqiang Guo, Xinpei Su, Huanlin Gao, Qiang Hui, Ting Lu, Fuyuan Shi, Chao Tan, Bikun Yang, Kai (…)2026-08-26
🤖 machine learning

Structured Frequency-Domain Evidence for LLM-Based Time-Series Anomaly Detection

تقترح هذه الورقة إطار عمل للكشف عن الشذوذ في السلاسل الزمنية بنمط "التعلم الصفري" المعزز بالأدلة، والذي يعمل على تحسين أداء النماذج اللغوية الكبيرة عبر دمج أدلة موجزة من النطاق الترددي العالمي والمحلي، يتم حسابها عبر تحويل فوريه السريع (FFT)، لتكملة المدخلات الحالية للنطاق الزمني وتلتقط بشكل أفضل الشذوذ الهيكلي مثل تغير الدورية.

Jungwook Seo, Sangwon Son, Minjeong Kim, Seungmin Han, Seojin Yoo, Sungyong Baik2026-08-26
🤖 AI

Task-Adaptive Rubrics for GUI Reward Modeling

تقدم الورقة البحثية AdaptRubric، وهو إطار عمل من الخشن إلى الناعم يعزز نمذجة مكافأة واجهة المستخدم الرسومية (GUI) من خلال بناء معايير تحكيم تكيفية مع المهام ديناميكيًا عبر الاسترجاع على مستوى الفئة والتحسين على مستوى الحالة، مما يحسن بشكل كبير كلاً من دقة تقييم المكافأة ومعدلات نجاح المهام مقارنة بالطرق الحالية.

Tao Xiong, Xavier Hu, Wenkai Wang, Qinzhuo Wu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang2026-08-26
🤖 AI

Tlow: Flow-based Item Tokenizer for Recommendation

تقترح الورقة البحثية Tlow، وهو أداة ترميز عناصر قائمة على التدفق تقوم بتحويل التضمينات الدلالية إلى توزيع طبيعي قياسي موحد لتمكين الترميز المستقل الفعال وتحسين أداء التوصية، كما تم التحقق من ذلك من خلال مكاسب كبيرة في معدل النقر (CTR) في التجارب عبر الإنترنت على WeChat.

Nian Li, Chonggang Song, Jingtao Ding, Lingling Yi, Yong Li, Qingmin Liao2026-08-26
🤖 AI

Paritok-4B: Intent-Conditioned Context Compression for Coding Agents

يُعد Paritok-4B نموذج LoRA مفتوح المصدر، مشروط بالنية، واستخراجي بـ 4 مليارات معلمة، يقوم بضغط سياقات وكلاء البرمجة إلى حوالي 25% من حجمها الأصلي مع الحفاظ على 86.5% من جودة الحل، مما يوفر بديلاً فعالاً من حيث التكلفة للنماذج اللغوية الكبيرة الرائدة والمكلفة لتقليل فواتير الرموز (tokens) دون التأثير بشكل كبير على الأداء.

Jiayu Shi, Luzhuo Chen2026-08-26
💬 NLP

'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تظهر عدم اتساق ملحوظ في السلامة ومعدلات "فشل في الرصد باللغة الأردية" عند اكتشاف خطاب الكراهية بالأردية عبر مختلف النصوص، مما يسلط الضوء على فجوة حرجة في موثوقية الإشراف على المحتوى ناتجة عن الغياب التام للغة الأردية في وقائع أبحاث سلامة الذكاء الاصطناي في تسع سنوات من الأبحىث الرئيسية.

Fawzia Zehra (Fuzzy), Kara-Isitt, Sonal Khosla, Stephen Swift2026-08-26
🤖 AI

Evaluating Multiple LLM Generations with Validated Task Coverage

تقدم هذه الورقة VTC-Bench ومقياس تغطية المهام المتحقق منها (VTC) لتقييم توليدات النماذج اللغوية الكبيرة المتعددة كمجموعة جماعية، مما يوضح أن التكوينات المُحسّنة لجودة المخرجات الفردية لا تزيد بالضرورة من تنوع النتائج المتميزة والمفيدة.

Florian Le Bronnec, Rio Yokota2026-08-26
🤖 AI

TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models

تقدم هذه الورقة البحثية TRACE، وهو معيار مرجعي جديد قائم على الأدلة مصمم لتقييم السلامة عبر كامل مسار استنتاج نماذج الاستدلال الكبيرة (المطالبات، وآثار الاستدلال، والاستجابات النهائية)، مما يكشف أن نماذج الحماية الحالية تواجه صعوبة في اكتشاف المحتوى غير الآمن في آثار الاستدلال واستخراج الأدلة الداعمة بدقة.

Zhenyu Wu, Siyuan Chen, Changchun Yang, Jiaqi Dong, Min Zhou, Ali Almadan, Talal Hammad, Faisal Wahbo, Aminullah Tora, M (…)2026-08-26
🤖 AI

SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction

تقدم هذه الورقة SA-Bench، وهو معيار تشخيصي يقيم 1,491 وحدة محاذاة دلالية عبر 30 ورقة بحثية من الطراز الرفيع في مجال تعلم الآلة، ليكشف أن وكلاء النماذج اللغوية الكبيرة الحاليين يعانون من "انزياح دلالي" كبير، حيث يحققون دقة منخفضة في إعادة إنتاج المواصفات العلمية رغم محاولتهم معظم المتطلبات.

Xue Hu, Zewei Pan, Zeli Su, Zhou Liu, Wentao Zhang2026-08-26
🤖 AI

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

تقدم الورقة البحثية RePolicy، وهو وكيل حماية قائم على التعلم التعزيزي يستدعي ديناميكياً سياسات سلامة محددة السياق لإنشاء أحكام سلامة مستندة إلى أسس واقعية، مما يظهر قدرة فائقة على التكيف وأداءً في الكشف عبر معايير متنوعة مقارنة بطرق التلقين والضبط الدقيق الحالية.

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He2026-08-26