💻 computer science

Sequential Behavioral Watermarking for LLM Agents

تقدم هذه الورقة البحثية إطار عمل SeqWM، وهو إطار عمل للعلامات المائية السلوكية المتسلسلة يقوم بدمج إشارات الملكية في أنماط انتقال الوكيل المشروطة بالتاريخ لتمكين التحقق من المسار القوي والمستقل عن الموقع مع الحفاظ على فائدة الوكيل، متجاوزاً بذلك هشاشة الأساليب الحالية التي تعامل الإجراءات كتجارب مستقلة.

Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han2026-05-13
💻 computer science

Read, Extract, Classify: A Tool for Smarter Requirements Engineering

تقدم هذه الورقة ReXCL، وهي أداة مؤتمتة تعزز هندسة المتطلبات من خلال استخراج البيانات من المستندات شبه المهيكلة وتصنيف المتطلبات باستخدام النمذجة التنبؤية والضبط الدقيق التكيفي، مما يحسن بشكل كبير الكفاءة والدقة في دورة حياة تطوير البرمجيات.

Paheli Bhattacharya, Manojit Chakraborty, Santhosh Kumar Arumugam, Rishabh Gupta2026-05-13
💻 computer science

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw

تقدم هذه الورقة DeepTrap، وهو إطار عمل مؤتمت يحدد الثغرات الأمنية في أنظمة الذكاء الاصطناعي الوكيلية من خلال تحسين التلاعبات العدائية بسياقات التنفيذ القابلة للتغيير، مما يثبت أن مثل هذه الاختراقات السياقية يمكن أن تؤدي إلى سلوكيات غير آمنة مع الحفاظ على إتمام المهام، ويسلط الض {الضوء} على عدم كفاية تقييمات الاستجابة فقط التقليدية.

Hongwei Yao, Yiming Liu, Yiling He, Bingrun Yang2026-05-13
🤖 machine learning

ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder

تقدم هذه الورقة ASD-Bench، وهو معيار تقييم شامل رباعي المحاور يقيم نماذج تعلم الآلة والنماذج التأسيسية المتنوعة على مجموعة بيانات منسقة تضم 4,068 سجلاً من نوع AQ-10 عبر ثلاث فئات عمرية للكشف عن أنماط تشخيصية متميزة خاصة بكل عمر، والقيود المفروضة على التقييمات أحادية المعيار، والحاجة إلى استراتيجيات نشر مخصصة لكل فئة عمرية في الفحص الآلي لاضطراب طيف التوحد.

Shubhankit Singh, Hassan Shaikh, Kuldeep Raghuwanshi, Keshav Bulia2026-05-13
💻 computer science

Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs

تقدم هذه الورقة طريقة للتدريب المسبق تستفيد من خاصية الإضافة الخطية لفضاءات تضمين نماذج الرؤية واللغة لتفكيك تمثيلات المشهد إلى مكونات المقدمة والخلفية، مما يتيح بناء تمثيلات ثابتة تجاه الخلفية تحقق دقة قياسية في أسوأ حالات المجموعات على مجموعة بيانات "Waterbirds" دون الحاجة إلى بيانات واقعية غير منحازة.

Youssef Zaazou, Mark Thomas2026-05-13
🤖 AI

A Cascaded Generative Approach for e-Commerce Recommendations

تقدم هذه الورقة إطار عمل توليدي متتالي يستبدل مكونات واجهة المتاجر الإلكترونية الجامدة بتوليد ديناميكي للمواضيع والكلمات المفتاحية لتعزيز التخصيص والتماسك الدلالي، محققاً زيادة بنسبة 2.7% في عمليات إضافة المنتات إلى السلة من خلال صقل نموذج المعلم والطالب القابل للتوسع والتكامل الهجين مع نماذج التصنيف التقليدية.

Moein Hasani, Hamidreza Shahidi, Trace Levinson, Yuan Zhong, Guanghua Shu, Vinesh Gudla, Tejaswi Tenneti2026-05-13
💬 NLP

ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

تقدم هذه الورقة ClinicalBench، وهو إطار عمل ومجموعة بيانات لاختبار الإجهاد في استرجاع المعلومات المدرك للادعاءات في الأسئلة والأجوبة السريرية عبر حالات التنويم المختلفة، مما يثبت أن نظام استرجاع الرسوم البيانية للمعرفة المدرك للقصد يحسن دقة الاسترجاع بشكل كبير مقارنة بالنماذج الكثيفة عبر نماذج لغوية كبيرة متعددة، مع تسليط الضوء على الضرورة القصوى للمراجعة الطبية من قبل الأطباء للتحقق من صحة معايير الأسئلة والأجوبة السريرية.

Alex Stinard2026-05-13
🤖 AI

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

تُعد RankQ طريقة للتعلم التعزيزي من النوع "من عدم الاتصال إلى الاتصال" (offline-to-online) تعمل على تحسين كفاءة العينات وأداء السياسة عبر استبدال التشاؤم الموحد بخسارة ترتيب متعددة الحدود ذاتية الإشراف لتعلم تفضيلات الأفعال المهيكلة، مما يُظهر نتائج متفوقة في معايير المكافآت الشحيحة ومكاسب كبيرة في نقل المحاكاة إلى الواقع في مجال تعلم الروبوتات القائم على الرؤية.

Andrew Choi, Wei Xu2026-05-13
🔭 astrophysics

Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

تقدم هذه الورقة إطاراً نظرياً للمعلومات باستخدام النماذج اللغوية الكبيرة لقياس مدى قابلية إعادة بناء الأساليب الفيزيائية الفلكية، كاشفةً أنه في حين أن الأوصاف النصية توضح البنى الخوارزمية، إلا أنها تفشل في القضاء على التباين في التنفيذ بسبب المعرفة الضمنية المفقودة لدى الخبراء، مما يؤسس أداة تشخيصية جديدة لتدقيق الشفافية المنهجية.

Hsing Wen Lin, Zong-Fu Sie2026-05-13
🤖 machine learning

Interpretability Can Be Actionable

تجادل هذه الورقة البحثية بأن مجال القابلية للتفسير يجب أن ينقل تركيزه من تطوير طرق جديدة إلى وضع معايير تقييم "قابلة للتنفيذ"، تُعرف من خلال الملموسية والتحقق، لضمان أن تؤدي الرؤى إلى قرارات وتدخلات ملموسة في العالم الحقيقي.

Hadas Orgad, Fazl Barez, Tal Haklay, Isabelle Lee, Marius Mosbach, Anja Reusch, Naomi Saphra, Byron Wallace, Sarah Wiegr (…)2026-05-13