🤖 AI

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

تقدم هذه الورقة GameXpert-Bench، وهي مجموعة اختبار شاملة تتكون من ثلاثة مسارات (GameGen وGameFix وGameOpt) تقيم وكلاء البرمجة عبر دورة حياة تطوير الألعاب الكاملة، كاشفةً عن أنه في حين يتفوق الوكلاء الحاليون في إنشاء الأسس القابلة للعب وتنفيذ المتطلبات الصريحة، إلا أنهم يواجهون صعوبة في اكتشاف العيوب، والتحقق من سلوك وقت التشغيل، والحفاظ على الوظائف أثناء التحسين التكراري.

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno (…)2026-08-25
🤖 AI

AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations

تقدم هذه الورقة "AI Watchdog"، وهي واجهة وكيل تعتمد على المتصفح تكتشف الأنماط المظلمة التلاعبية في المحادثات مع الذكاء الاصطناعي، وتثبت من خلال دراسة مستخدمين أنه بينما يواجه المستخدمون صعوبة في التعرف صراحةً على هذا التلاعب، فإن التحذيرات الفورية التي لا تتضمن إكراهاً معرفياً تقلل بشكل كبير من الامتثال للتوصيات التي يوجهها الذكاء الاصطناعي.

Rachel Poonsiriwong (Pub), Chayapatr (Pub), Archiwaranguprok, Constanze Albrecht, Monchai Lertsutthiwong, Pattie Maes (…)2026-08-25
🤖 machine learning

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

تقدم الورقة البحثية ChainPrune، وهي طريقة مبتكرة تعمل على تحسين استدلال تسلسل الأفكار (Chain-of-Thought) الطويل من خلال دمج المسارات المولدة ذاتياً في بنية شجرية للاختيار متعدد المعايير وتطبيق تعلم التفضيل القائم على تحسين التفضيل المباشر (DPO)، مما يقلل بفعالية من التكرار والأعباء الحسابية مع الحفاظ على الدقة أو تحسينها.

Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye2026-08-25
💻 computer science

GuardPaint:SpeculativeSafetyDecodingforText-to-ImageGeneration

يقدم GuardPaint إطار عمل للتنفيذ الاستباقي يعزز سلامة نماذج الانتشار من النص إلى الصورة عبر توظيف مدقق خفيف الوزن للكشف عن المناطق غير الآمنة وإصلاحها جراحياً ضمن مسار التوليد، مما يقلل بفعالية من الهجمات العدائية مع الحفاظ على جودة الصورة ودقة المطالبة دون تعديل النموذج الأساسي.

Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi, Aranbi Dutta, Aman Chadha, Vinija Jain, Amitava Das2026-08-25
🤖 AI

A Scalable Vector Graphics Latent Space

تقدم هذه الورقة البحثية نموذج SLS، وهو مشفر تلقائي قائم على تقنية Transformer، يعمل على إنشاء فضاء كامن متين وقابل للعكس ومتصل لرسومات المتجهات القياسية (SVG) من خلال تعلم تمثيلات مدمجة وثابتة الحجم لمسارات SVG الفردية، مما يتيح إعادة بناء عالية الدقة، وبحثاً فعالاً عن التشابه، وتوفيراً كبيراً في العمليات الحسابية مقارنة بالنهج القائم على الرموز (token-based).

Leonardo Zini, Elia Frigieri, Lorenzo Baraldi2026-08-25
🤖 AI

Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks

تدقق هذه الورقة في فعالية دفاعات كسر الحماية المختلفة من جانب المدخلات على النماذج اللغوية الكبيرة المنشورة محلياً، وذلك من خلال تتبع إخفاقاتها بشكل منهجي وصولاً إلى الافتراضات التصميمية المنتهكة عبر اختبار تجريبي مكثف شمل ستة نماذج مفتوحة الأوزان ومتنًا متنوعًا من مطالبات كسر الحماية.

Aaditya Pratap, Harsh Kasyap, Somanath Tripathy2026-08-25
🤖 AI

Consistency Is Not Coherence: Orientation Search for Certified Alignments Between 4D Defence Upper Ontologies

تقدم هذه الورقة بحثاً حول محاذاة مبتكرة، تم إعدادها يدوياً، بين ثلاث من الأنطولوجيات الدفاعية العليا الهامة في المملكة المتحدة وحلف الناتو (IES وHQDM وBFO)، مما يثبت أنه بينما يمكن تحقيق الاتساق من خلال الاستدلال الآلي، فإن التماسك الحقيقي يتطلب توجيهاً دقيقاً وتنسيقاً يدوياً لسد الفجوات بين معايير البيانات التي لم تكن متصلة سابقاً.

Fabio Rovai2026-08-25
🤖 AI

NoTB: Oracle-Free Triage of LLM-Generated RTL via Cross-Model Formal Consensus

تقدم الورقة البحثية NoTB، وهو إطار عمل خالٍ من الأوراكل (oracle-free) يستفيد من التحقق من التكافؤ التسلسلي عبر تصميمات RTL متعددة مُنشأة بواسطة النماذج اللغوية الكبيرة (LLMs) لإنشاء إشارة إجماع رسمية، مما يتيح فرزاً عالي الدقة للصحة الوظيفية دون الاعتماد على مجموعات اختبار (testbenches) أو مراجع ذهبية (golden references).

Elisavet Lydia Alvanaki, Je Yang, Biruk Seyoum, Luca P. Carloni2026-08-25
🤖 AI

Repo2Skill-Evo: Repository Skills Go Stale in Silence

تُثبت هذه الورقة أنه في حين أن استخراج المعرفة الخاصة بالمستودع وتحويلها إلى مهارات لوكلاء النماذج اللغوية الكبيرة يحسن الأداء، إلا أن هذه المهارات تتدهور بصمت أثناء إصدارات البرمجيات، وحتى الوكلاء المتطورون يواجهون صعوبة في تحديثها بشكل موثوق دون إدخال أخطاء جسيمة في التغطية أو الدقة.

Chenyuan Duan, Ge Shi, Zineng Mao, Ge Zhang, Hao Liang, Yinzhu Piao, Yuchen Wu, Zhixin Yao, Kaiyu Huang, Wenhao Huang, L (…)2026-08-25
🤖 AI

Beyond Similarity: Heterogeneous Graph Learning for Multi-Objective Food Substitution in Charitable Food Agencies

تقترح هذه الورقة إطار عمل لشبكة عصبية رسومية غير متجانسة قائمة على المصدر، تعالج تحدي تعدد الأهداف في استبدال المواد الغذائية لدى الوكالات الخيرية من خلال التحسين المتزامن للتقارب مع سلوك الأسر، والملاءمة الغذائية، وتشابه العناصر، حتى في ظل ظروف ندرة البيانات وسيناريوهات البداية الباردة.

Naimur Rahman Chowdhury, Limon Bin Hossain2026-08-25