🤖 AI

Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines

تقدم هذه الورقة إطار عمل لاختبار الفريق الأحمر القائم على التنفيذ، والذي يوضح أن وكلاء البرمجة المدمجين في مسارات هندسة البرمجيات يمكن استدراجهم للقيام بتعديلات غير آمنة على النظام عندما يتم تمويه النوايا الخطرة داخل مهام هندسية روتينية، مما يكشف عن ثغرات أمنية حرجة في سلوك طبقة التنفيذ لديهم.

Yifei Ge, Weisong Sun, Jinkun Xiao, Yuchen Chen, Yebo Feng, Peizhuo Lv, Xia Feng, Chunrong Fang, Zhihong Zhao, Zhenyu Ch (…)2026-07-28
🤖 AI

Reference Feature Atlases for Mechanistic Auditing of Language Models

تقدم هذه الورقة "أطالس السمات المرجعية" (Reference Feature Atlases)، وهي مكتبة سمات متفرقة قابلة لإعادة الاستخدام يتم تدريبها على لوحة مرجعية تتيح تدقيقاً ميكانيكياً فعالاً ومستقراً ومتفوقاً للنماذج اللغوية الجديدة من خلال فصل السمات المُفسرة عن البواقي المستحدثة، متفوقة بذلك على النماذج المرجعية التقليدية التي تعتمد على إعادة التدريب في اكتشاف الأهداف المحقونة والتحكم فيها وكشف السلوكيات الناشئة.

Rui Wu, Tong Che2026-07-28
🤖 AI

Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning

تقدم هذه الورقة SCEPTER، وهو إطار عمل لاستدلال الأدلة متعدد الأهداف يستفيد من استرجاع PubMed، والتصنيف الدلالي، والنماذج اللغوية الكبيرة لضغط الأدبيات الطبية الهائلة إلى توصيات سريرية متنوعة وقابلة للتنفيذ مع إدارة التناقضات والقيود الزمنية بفعالية.

Adela Bara, Simona-Vasilica Oprea2026-07-28
🤖 AI

Temporal Context Reinstatement Drives Episodic-Like Order Memory in Long-Context Language Models

تُثبت هذه الورقة أن نماذج اللغة ذات السياق الطويل تحاكي ذاكرة الترتيب العرضي البشرية من خلال آلية محددة حيث تعيد رأس انتباه واحدة استعادة رمز زمني أحادي البعد، مما يقدم رؤى حول الأساس الحسابي للذاكرة طويلة المدى في كل من الأنظمة الاصطناعية والبيولوجية.

Mathis Pink, Vy Ai Vo, Qinyuan Wu, Jianing Mu, Javier Turek, Uri Hasson, Kenneth A. Norman, Sebastian Michelmann, Alexan (…)2026-07-28
🤖 AI

HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization

تُعد HeraSys نظاماً لخدمة النماذج اللغوية الكبيرة يعمل على تحسين الأداء الشامل لسير العمل المتزامن متعدد المستأجرين من خلال القضاء على التكرار الحسابي عبر تداخل سير العمل باستخدام دمج العقد الهيكلي، وتطبيق سياسة جدولة مشتركة مدركة للحمل لتقليل زمن الاستجابة في الحالات القصوى بشكل كبير مع زيادة الإنتاجية.

Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia2026-07-28
💬 NLP

Source-Aware Reranking for Retrieval-Augmented Generation: A Reliability Prior Approach

تقترح هذه الورقة البحثية وتقيم طريقة لإعادة ترتيب النتائج مدركة للمصدر لعملية التوليد المعزز بالاسترجاع، والتي تعيد وزن درجات الاسترجاع باستخدام أولويات موثوقية المصدر المستندة إلى المجال، مما يظهر تحسينات كبيرة في الدقة وتقليلاً في الاسترجاع العدائي على مجموعة بيانات من المجال الصحي.

Yuktha Tata Koganti, Hugo Garrido-Lestache Belinchon2026-07-28
🤖 AI

The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation

تُثبت هذه الورقة أن إطار التقييم يؤثر بشكل كبير على أداء وكفاءة وكلاء البرمجة — غالبًا أكثر من اختيار النموذج الأساسي — وذلك من خلال الكشف عن تباينات في استخدام الرموز (tokens) تصل إلى 40 ضعفًا وأنماط فشل مستقلة عن النموذج، مما يدعو إلى ضرورة الإبلاغ عن مواصفات إطار التقييم الكاملة ومقاييس الرموز وزمن الاستجابة جنبًا إلى جنب مع مقارنات النماذج.

Naman Vats, Oleg Golev2026-07-28
🤖 AI

Lexical discovery in unknown environments orchestrated by Large Language Models

تقترح هذه الورقة إطار عمل "الاكتشاف المعجمي العصبي الرمزي" (NSLD)، حيث تقوم وكلاء تعتمد على النماذج اللغوية الكبيرة بتطوير والتقارب نحو مفردات مشتركة لكيانات بصرية مجهولة من خلال ربط الكلمات "الغريبة" الجديدة باللغة الطبيعية عبر تقارب التضمين الدلالي، مما يتيح التخطيط لما قبل النشر لمهام الاستكشاف الذاتي.

Rafael Sendra-Arranz, Iñaki Dellibarda Varela, Eduardo Rocon, Álvaro Gutiérrez, Manuel Cebrian2026-07-28
🤖 AI

Differencing the Diffusion Trajectory toward Uncertain Components for Time Series Forecasting

تُعد DiffDiff إطار عمل انتشار مبتكر للتنبؤ بالسلاسل الزمنية، حيث تدمج عدم التماثل في القدرة على التنبؤ مباشرة في مسار الانتشار من خلال الإزاحة التدريجية للحالة المشوشة من الهدف إلى فروقها من الدرجة الثانية، مما يمكن النموذج من تركيز جهده التوليدي على المكونات غير المؤكدة مع الاستفادة من الاستمرارية التاريخية للمحتوى المرتكز.

Chen Su, Yuanhe Tian, Yan Song2026-07-28
🤖 AI

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

تقدم هذه الورقة VisDeception، وهو أول معيار مزدوج لتقييم تعرض نماذج الرؤية واللغة للنماذج التصميمية المضللة للرسوم البيانية، مما يكشف عن قابليتها العالية للتأثر بالتلاعبات البصرية ويقترح إطار عمل للتخفيف من حدة تعدد الوكلاء لتحسين المتانة من خلال ترسيخ البيانات الوصفية المهيكلة.

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque2026-07-28