💬 NLP

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

تقدم هذه الورقة BacktestBench، وهو أول معيار مرجعي واسع النطاق للاختبار الخلفي الكمي المؤتمت يضم أكثر من 18,000 مهمة مشروحة مستمدة من 6 ملايين سجل سوقي، إلى جانب AutoBacktest، وهو إطار عمل متعدد الوكلاء مصمم لترجمة الاستراتيجيات ذات اللغة الطبيعية إلى اختبارات خلفية قابلة للتكرار وتقييم قدرات 23 نموذجاً لغوياً كبيراً رائجاً.

Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia2026-05-19
🤖 machine learning

A More Word-like Image Tokenization for MLLMs

تقترح هذه الورقة البحثية "الترميز البصري المتفكك" (DiVT)، وهي طريقة مبتكرة تعمل على تجميع تضمينات رقع الصور في وحدات دلالية متماسكة وتعديل ميزانيات الرموز ديناميكيًا بناءً على تعقيد الصورة، مما يمكن النماذج اللغوية الكبيرة متعددة الوسائط من معالجة المدخلات البصرية بكفاءة أكبر وتوافق أعلى مع تقليل تكاليف الذاكرة وزمن الاستجابة بشكل كبير.

Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee2026-05-19
💻 computer science

BLAgent: Agentic RAG for File-Level Bug Localization

يُعد BLAgent إطار عمل وكيل جديد للجيل المعزز بالاسترجاع (RAG) يعمل على تعزيز تحديد مواقع الأخطاء البرمجية على مستوى الملف من خلال الترميز المدرك لهيكل الكود، وتحويل الاستعلام ثنائي المنظور، وإعادة الترتيب الوكيل ثنائي المراحل، محققاً بذلك دقة رائدة في SWE-bench Lite مع تقليل التكاليف بشكل كبير وتحسين نجاح إصلاح البرامج الآلي في المهام اللاحقة.

Md Afif Al Mamun, Gias Uddin2026-05-19
💻 computer science

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

تقترح هذه الورقة منظوراً قائماً على التفاعل لتفسير عدم اتساق فعالية الضبط الدقيق الخاضع للإشراف (SFT) على النماذج اللغوية الكبيرة، كاشفةً أن الضبط الدقيق الخاضع للإشراف يزيل في البداية التفاعلات الشبيهة بالضجيج، ولكنه يؤدي سريعاً إلى تفاعلات مفرطة في التخصيص إذا استمر التدريب لما بعد مرحلة إزالة الضجيج الوجيزة.

Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang2026-05-19
💻 computer science

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

تقدم الورقة البحثية "بابل" (Babel)، وهو إطار عمل فعال لكسر الحماية بنظام الصندوق الأسود يستغل التوزيع المتناثر لرؤوس الانتباه الحرجة أمنياً في النماذج اللغوية الكبيرة، وذلك عبر استخدام أخذ عينات التمويه القائم على التغذية الراجعة والتكرار لتحقيق معدلات نجاح هجوم رائدة في مجال كسر الحماية على النماذج المتطورة مثل GPT-4o وClaude-3.5-Haiku بكفاءة عالية في عدد الاستعلامات.

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu2026-05-19
🔢 mathematics

Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery

تقدم هذه الورقة البحثية "التحسين البايزي الموجه بنماذج اللغات الكبيرة" (LGBO)، وهو إطار عمل مبتكر يدمج تفضيلات نماذج اللغات الكبيرة باستمرار في حلقة التحسين للتغلب على قيود البداية الباردة وقابلية التوسع التي تواجهها الطرق التقليدية، محققاً تقارباً أسرع بشكل ملحوظ في كل من الاختبارات الجافة والتجارب المختبرية الرطبة في العالم الحقيقي من أجل الاكتشاف العلمي.

Xinzhe Yuan, Zhuo Chen, Jianshu Zhang, Huan Xiong, Nanyang Ye, Yuqiang Li, Qinying Gu2026-05-19
💻 computer science

LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injectio

تقدم هذه الورقة LivePI، وهو معيار هيكلي يقيم مخاطر حقن الأوامر غير المباشر عبر سبعة أسطح إدخال من واقع الحياة وخمسة أهداف خبيثة على وكلاء الذكاء الاصطناي الرائدين، مما يكشف عن ثغرات أمنية كبيرة (معدلات نجاح تتراوح بين 10.7% و29.6%) ويثبت فعالية استراتيجية دفاع مكونة من طبقتين في التخفيف من هذه التهديدات مع الحفاظ على الفائدة.

Lei Zhao, Abhay Bhaskar, Edgar Dobriban2026-05-19
💬 NLP

Predictive Prefetching for Retrieval-Augmented Generation

تقترح هذه الورقة إطار عمل استرجاع غير متزامن متطور لعملية التوليد المعزز بالاسترجاع، يستخدم الجلب المسبق التنبؤي بناءً على السوابق الدلالية لتقليل زمن الاستجابة بشكل كبير وتحسين زمن الوصول إلى أول رمز (time-to-first-token) مع الحفاظ على جودة إجابات مماثلة للنماذج المتزامنة المرجعية.

Wuyang Zhang, Shichao Pei2026-05-19
🤖 machine learning

MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization

تقترح هذه الورقة البحثية طريقة MARR، وهي طريقة إعادة بناء المتبقي المتكيفة مع الوحدات (module-adaptive residual reconstruction) للكمية بعد التدريب منخفضة البت، والتي تستخدم استراتيجية قائمة على نظام التحكم التناسبي التكاملي التفاضلي (PID) لتعيين معاملات قياس خاصة بكل وحدة ديناميكيًا، مما يوازن بفعالية بين تصحيح الخطأ المتراكم وانحياز تقريب هسيان (Hessian-approximation bias) لتحسين الأداء بشكل كبير في النماذج اللغوية الكبيرة (LLMs) ونماذج المحولات الرؤيوية (ViTs).

Le Su, Xing Luo, Zhi Jin2026-05-19
📊 statistics

Unveiling Memorization-Generalization Coexistence: A Case Study on Arithmetic Tasks with Label Noise

تتقصى هذه الورقة كيف تقوم الشبكات العصبية ذات المعلمات الزائدة بحفظ التسميات الضوضائية والتعميم على المهام الحسابية في آن واحد، كاشفةً أنه بينما تعمل الضوضاء على كبح مخرجات بنية تعميم داخلية، يمكن استعادة هذه البنية بفعالية من خلال الطرق القائمة على التردد حتى في ظل وجود ضوضاء تسمية كثيفة.

Linyu Liu, Pinyan Lu2026-05-19