💻 computer science

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

يُعد SkillMentor إطار عمل مبتكر يُمكّن وكلاء النماذج اللغوية الكبيرة من التطور الذاتي عبر تعلم قدرة تشخيصية منفصلة لتحديد وتنسيق نقاط الضعف وتحويلها إلى مهارات قابلة لإعادة الاستخدام، مما يؤدي إلى تحسين أداء المنفذ بنسبة 44.2% دون تحديث أوزان المنفذ أو الاعتماد على الإشراف البشري.

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li2026-07-31
🤖 machine learning

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

تقدم هذه الورقة البحثية "النمذجة الاستكشافية"، وهي نموذج جديد يعمل على تحليل حلقة التدريب لاستكشاف مرشحات توليد متعددة واختيار الأفضل بينها، مما يجعل الاستكشاف محوراً ثالثاً قابلاً للتوسع في مرحلة ما قبل التدريب يحسن الكفاءة والأداء عبر المجالات مع تمكين النمذجة التوليدية الحقيقية من طرف إلى طرف.

Alexi Gladstone, Heng Ji, Yilun Du2026-07-31
💻 computer science

RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

تقدم الورقة البحثية RoguePrompt، وهو مسار لكسر الحماية يعتمد على ترميز ثنائي الطبقات باستخدام شفرات Vigenère وROT13 المتداخلة مع تعليمات إعادة بناء باللغة الطبيعية، والذي نجح في تجاوز فلاتر الاعتدال في 93.93% من الحالات وحقق التنفيذ في 70.18% من أصل 313 مطالبة مرفوضة بشدة تحت نموذج تهديد الصندوق الأسود.

Benyamin Tafreshian, Prathamesh Dhake2026-07-31
💻 computer science

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

يقدم VideoCoCo إطار عمل ذا محرك مزدوج وكيل (agentic) يستفيد من كود Blender القابل للتنفيذ كـ "سلسلة أفكار" على مستوى العملية لإنشاء فيديوهات متسقة فيزيائياً عبر إنشاء مسودة مكانية-زمانية حتمية أولاً ثم تحسينها إلى مخرج واقعي، متفوقاً بشكل كبير على النماذج المرجعية الحالية في معايير الاتساق الفيزيائي.

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, R (…)2026-07-31
💬 NLP

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

تحدد هذه الورقة "الارتكاز السردي"، وهو انحياز حيث تنتج النماذج اللغوية السريرية تشخيصات متباينة لحقائق متطابقة بناءً فقط على السجل اللغوي الاجتماعي، وتقترح "NarrativeShield"، وهو مسار مكون من ثلاثة وكلاء يستخرج الحقائق ويتحقق منها هيكلياً للقضاء تقريباً على هذه الفجوة مع الحفاظ على الاستقرار التشخيصي.

Prabhjot Singh, Pritam Deka, Vijay Chennareddy2026-07-31
💻 computer science

Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models

تكشف هذه الورقة أنه بينما تقاوم نماذج اللغات الانتشارية (Diffusion Language Models) بطبيعتها الهجمات العدائية القائمة على التدرج بسبب تضاريس فقدانها العشوائية، إلا أنها تظل عرضة للضجيج الطبيعي وتُظهر ثقة مفرطة ممنهجة لأن متانتها تعتمد على توجيه فك التشفير الخاص بالأوزان بدلاً من المزايا الهيكلية، مما يستلزم دمجاً جوهرياً في عملية فك التشفير بدلاً من الإصلاحات السطحية.

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran2026-07-31
💬 NLP

AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes

تقدم هذه الورقة AHA-Memes، وهو أول معيار لتقييم الميمات العربية التي تحتوي على كراهية على نطاق واسع ودقيق، ويضم 5,000 مثال مشروح يدويًا و66,000 ميم من الملصقات الفضية، إلى جانب تقييمات شاملة لمختلف النماذج متعددة الوسائط لمعالجة التحديات غير المستكشفة في اكتشاف الكراهية المتجذرة ثقافيًا في المحتوى العربي عبر الإنترنت.

Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Abul Hasnat, Md. Rafiul Biswas, Wajdi Zaghouani, Firoj Alam2026-07-31
🤖 machine learning

ECG-InterpBench: Benchmarking the Interpretability of ECG Foundation Models with Matched-Scale Sparse Autoencoders

تقدم هذه الورقة البحثية ECG-InterpBench، وهو معيار مرجعي مبتكر يستخدم المشفرات التلقائية المتناثرة متطابقة المقياس لتقييم ومقارنة قابلية التفسير، والأهمية السريرية، وقابلية إعادة الإنتاج للتمثيلات الداخلية عبر ستة نماذج تأسيسية مجمدة لتخطيط كهربائية القلب بشكل منهجي، مما يعالج فجوة حرجة تركتها المعايير المرجعية الحالية التي تركز على الأداء.

Yixuan Duan, Wei Qiu2026-07-31
💻 computer science

SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements

تقدم هذه الورقة SWE-NFI، وهو معيار مرجعي يتكون من 188 مهمة من واقع الحياة و92 قاعدة قابلة للتنفيذ صُممت لتقييم وكلاء البرمجة في التحسينات غير الوظيفية، مما يكشف أنه بينما يحقق الوكلاء صحة وظيفية عالية، إلا أنهم يتخلفون بشكل كبير عن المطورين البشر في تنفيذ تحسينات الكود التي تحافظ على السلوك.

Pengyu Xue, He Yang Yuan, Xin Wang, Junkai Chen, Haonan Zhang, Boyuan Chen, Zishuo Ding, Zhenhao Li, Weiyi Shang2026-07-31
💻 computer science

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

تقدم الورقة البحثية إطار عمل GAMER، وهو إطار عمل مبتكر يربط بين التوسع أثناء الاستدلال والذاكرة العرضية من خلال نمذجة الاستدلال التاريخي كرسم بياني متمحور حول الأفعال مع آلية تعلم فرق زمني ثنائية المسار، مما يقلل التكاليف الحسابية ويحسن بشكل كبير كفاءة اتخاذ القرار لدى الوكيل ومعدلات النجاح.

Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo2026-07-31