🤖 AI

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

تقدم هذه الورقة FeasiGen، وهو مسار مؤتمت لإنشاء مهام غير قابلة للتنفيذ لوكلاء استخدام الأدوات عبر حجب أدوات حاسمة، وتستخدمه للكشف عن افتقار الوكلاء الحاليين إلى الوعي القوي بالجدوى، حيث يستمرون غالباً في التنفيذ على مهام مستحيلة بمعدلات خطأ عالية، رغم أن البنى متعددة الوكلاء تظهر أداءً محسناً.

Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai2026-05-28
🤖 AI

Cultural Binding Heads in Language Models

تحدد هذه الورقة رؤوس انتباه محددة في الطبقات المتوسطة في النماذج اللغوية الكبيرة والتي تقود بشكل سببي الربط الثقافي، كاشفةً أنه بينما تمتلك النماذج معرفة ثقافية كافية، فإن ميلها إلى التدرج نحو المعاملة المتساوية ينبع من عنق زجاجة في التوجيه يمكن التخفيف من حدته من خلال تدخلات ميكانيكية مستهدفة مثل تعطيل الرؤوس (head knockout) والتحجيم بـ α\alpha (α\alpha-scaling).

Avrile Floro, Luca Benedetto2026-05-28
🤖 AI

Modeling Vehicle-Type-Specific Pedestrian Crash Avoidance Behavior in Safety-Critical Interactions Using Smooth-Mamba Deep Reinforcement Learning

تقدم هذه الدراسة إطار عمل SMamba-DDPG، وهو نموذج تعلم تعزيزي عميق من نوع "Smooth-Mamba"، يلتقط بفعالية سلوكيات تجنب حوادث المشاة الخاصة بكل نوع من أنواع المركبات، كاشفاً أن المشاة يستجيبون بسرعة وحذر أكبر للمركبات ذاتية القيادة مقارنة بالمركبات التي يقودها بشر، مما يوفر رؤى بالغة الأهمية لتصميم أنظمة القيادة الذاتية الأكثر أماناً ومحاكاة حركة المرور المختلطة الواقعية.

Qingwen Pu, Kun Xie, Hong Yang, Di Yang, Junqing Wang2026-05-28
🤖 AI

Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

تُثبت هذه الورقة أن سلوك الرفض في النماذج اللغوية الكبيرة يمكن فك تشفيره خطياً من التنشيطات الوسيطة قبل توليد المخرجات، مما يتيح تطوير "Mechanism AutoDAN"، وهو أسلوب هجوم موجه بالمسبار يقلل بشكل كبير من وقت البحث مع الحفاظ على معدلات نجاح تنافسية مقارنة بالأساليب التقليدية.

Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta, Denis Kleyko, Mauro Conti, Matteo Zavatteri, Roberto Confalonieri2026-05-28
🤖 AI

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

لمعالجة حالة التشبع والتغطية المحدودة لاستخدام الأدوات في معايسات الوكلاء الحالية، تقدم هذه الورقة TASTE، وهي طريقة مؤتمتة تعكس عملية بناء المهام من خلال تطوير تسلسلات الأدوات لإنشاء τc\tau^c-Bench الأكثر تحدياً وشمولاً، والذي يكشف أن النماذج الرائدة الحالية تعاني من انخفاض كبير في الأداء عند مواجهة هذه المهام الأكثر تعقيداً وتنوعاً.

Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert2026-05-28
🤖 AI

Token Optimization Strategies for LLM-Based Oracle-to-PostgreSQL Migration

تُصوّر هذه الورقة تحسين الرموز (token optimization) كمسألة تحويل متعددة الأهداف ومقيدة لعملية الهجرة من Oracle إلى PostgreSQL القائمة على النماذج اللغوية الكبيرة (LLM)، حيث تقيم اثنتي عشرة استراتيجية لتثبت أنه بينما يؤدي الضغط الشديد إلى خفض الدقة الدلالية بشكل جذري، فإن التوجيه التكيفي وتقليم السياق الطفيف يقدمان أكثر المقايضات فعالية بين كفاءة الرموز وجودة الكود.

Oleg Grynets, Dmytro Babarytskyi, Vasyl Lyashkevych2026-05-28
🤖 machine learning

Semantic Optimal Transport for Sparse Autoencoder Feature Matching and Circuit Compression

تقدم هذه الورقة إطاراً توزيعياً موحداً قائماً على مسافة واسرستاين (Wasserstein distance) يمثل سمات المشفّر التلقائي المتناثر (Sparse Autoencoder) كتوزيعات موزونة بالتنشيط لتمكين المطابقة الدلالية القوية عبر الطبقات والضغط التلقائي لدوائر السمات إلى عقد فائقة (supernodes) قابلة للتفسير.

Tue M. Cao, Nguyen Do, My T. Thai2026-05-28
🤖 AI

Continual Model Routing in Evolving Model Hubs

تتناول هذه الورقة تحديات توسيع نطاق اختيار النماذج في مراكز الذكاء الاصطناعي سريعة التوسع من خلال صياغة إطار عمل توجيه النماذج المستمر (CMR)، وتقديم معيار CMRBench واسع النطاق، واقتراح طريقة CARvE، وهي طريقة تضمين تبايني تتفوق بشكل كبير على النماذج المرجعية الحالية في دقة التوجيه عبر مختلف النماذج والمهام.

Jack Bell, Giacomo Carfì, Gerlando Gramaglia, Vincenzo Lomonaco2026-05-28
🤖 AI

MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation

تقدم هذه الورقة MUSE، وهو معيار إطار عمل تقييمي جديد مصمم للنهوض بتوليد النماذج من النصوص إلى التصميم بمساعدة الحاسوب (Text-to-CAD) لما يتجاوز مجرد التشابه الهندسي البسيط، وذلك عبر تقييم تجميعات تمثيل الحدود المحددة (B-Rep) القابلة للتعديل والمعقدة مقابل معايير هندسية حاسمة مثل الوظيفية، وقابلية التصنيع، وقابلية التجميع.

Xiaoyu Dong, Zhi Li, Xiao-Ming Wu2026-05-28
🤖 AI

Technical Report: Exploring the Emerging Threats of the Agent Skill Ecosystem

يحلل هذا التقرير التقني ما يقرب من 4,000 مهارة من مهارات الوكلاء الذكيين من الأسواق الرئيسية ليكشف أن 13.4% منها تحتوي على مشكلات أمنية حرجة، بما في ذلك 76 حمولة ضارة مؤكدة، مما يسلط الضوء على الحاجة الملحة لتدابير أمنية مؤتمتة مع توسع الأنظمة البيئية للوكلاء.

Luca Beurer-Kellner, Aleksei Kudrinskii, Marco Milanta, Kristian Bonde Nielsen, Hemang Sarkar, Liran Tal2026-05-28