💬 NLP

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

يقدم النموذج ثنائي المجلس (Bicameral Model) واجهة عصبية قابلة للتدريب تتيح لنموذجين لغويين مجمدين التنسيق بشكل ثنائي الاتجاه من خلال اقتران مستمر للحالة الخفية، مما يسمح لنموذج أولي بقيادة المهام بينما يقوم نموذج مساعد بتنفيذ الأدوات أو الأكواد، وهو ما يعزز الأداء بشكل كبير في الحساب والمنطق والاستدلال الرياضي دون الاعتماد على التواصل القائم على النصوص.

Cedric Flamant, Udaya Ghai, Kanna Shimizu2026-05-13
💻 computer science

Adversarial SQL Injection Generation with LLM-Based Architectures

تقدم هذه الورقة نظامين جديدين يعتمدان على النماذج اللغوية الكبيرة، وهما RADAGAS وRefleXQLi، لتوليد حمولات حقن SQL العدائية وتقييم فعاليتهما ضد جدران حماية تطبيقات الويب المتنوعة، مما يكشف أنه في حين تتفوق هذه النماذج بشكل كبير على الخطوط المرجعية في تجاوز الدفاعات القائمة على الذكاء الاصطناست/تعلم الآلة، إلا أنها تواجه صعوبة أمام الأنظمة القائمة على القواعد وتُظهر أن تنوع الحمولات لا يرتبط دائمًا بنجاح أعلى في التجاوز.

Ali Karakoc, H. Birkan Yilmaz2026-05-13
💻 computer science

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

تقدم هذه الورقة GRIEF، وهو فاحص (fuzzer) من نوع الصندوق الرمادي (greybox) يستهدف تعقيدات التزامن وإدارة الحالة في أنظمة خدمة النماذج اللغوية الكبيرة (LLM) للكشف عن الثغرات الحرجة مثل فشل عزل ذاكرة التخزين المؤقت وتداخل الأداء، حيث نجح في تحديد 15 مشكلة جديدة بما في ذلك ثغرتان من نوع CVE في محركات مثل vLLM وSGLang.

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek2026-05-13
🤖 machine learning

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

تُظهر هذه الورقة أن المتوسط الحسابي البسيط يفشل في إنتاج ترتيبات دقيقة في مصفوفات التقييم المتفرقة ذات مستويات صعوبة العناصر المتباينة عبر مجالات متعددة، بينما تستطيع نماذج نظرية الاستجابة للمفردة (IRT) استعادة ترتيبات الحقيقة الأرضية بمتانة في ظل هذه الظروف.

Jung Min Kang2026-05-13
🤖 AI

Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs

تثبت هذه الورقة أن المرتكزات الرقمية المضمنة تحيز بشكل منهجي أحكام جودة نماذج الرؤية واللغة من خلال الكشف عن رابط سببي بين القابلية السلوكية وديناميكيات التمثيل الخاصة بالطبقات، حيث يتشبع تصنيف المرتكز في الطبقات المبكرة بينما يحدث التنبؤ الأمثل للجودة في أعماق الشبكة.

M. Shalankin2026-05-13
🤖 AI

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

تقدم هذه الورقة VLATIM، وهو معيار مرجعي قائم على لعبة *The Incredible Machine 2* يكشف عن فجوة كبيرة بين قدرات التخطيط رفيعة المستوى والربط البصري الدقيق للنماذج اللغوية الرؤية الحالية، مما يثبت أنها لم تحقق بعد قدرات حل المشكلات المنطقية الشبيهة بالبشر في بيئات الألغاز التفاعلية القائمة على النقر والتشير.

Dominik Helfenstein, Marco Menner, Maximilian Triebel2026-05-13
💻 computer science

ABRA: Agent Benchmark for Radiology Applications

تقدم الورقة البحثية ABRA، وهو معيار مرجعي جديد لوكلاء الأشعة، يضم 655 مهمة تم إنشاؤها برمجياً ضمن بيئة DICOM واقعية، والتي تكشف عن قدرات النماذج الحالية القوية في تنسيق الأدوات ولكنها تظهر أيضاً قصوراً كبيراً في الإدراك الصوري الطبي وتحديد مواقع النتائج.

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo2026-05-13
🤖 AI

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

إن PIVOT هو إطار عمل للتعلم الذاتي يجسّر الفجوة بين التخطيط والتنفيذ في وكلاء النماذج اللغوية الكبيرة (LLM agents) من خلال تحسين المسارات المرشحة بشكل تكراري عبر عملية مكونة من أربع مراحل هي التخطيط، والفحص، والتطوير، والتحقق، محققاً أداءً هو الأفضل في فئته مع تقليل التكاليف الحسابية بشكل كبير.

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis2026-05-13
🤖 machine learning

LiBaGS: Lightweight Boundary Gap Synthesis for Targeted Synthetic Data Selection

تُعدُّ LiBaGS طريقةً خفيفة الوزن وغير مرتبطة بمولد محدد، تعمل على تحسين اختيار البيانات الاصطناعية من خلال تقييم العينات بناءً على القرب من الحدود، وعدم اليقين، والكثافة، مع توظيف قاعدة تخصيص فجوة الحدود ومعيار توقف القيمة الهامشية لتحسين دقة المهام اللاحقة دون بيانات زائدة أو غير واقعية.

Abhishek Moturu, Anna Goldenberg, Babak Taati2026-05-13
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

تقدم هذه الورقة بنية تحتية لعمليات النماذج اللغوية الكبيرة (LLMOps) مدركة لحجم عبء العمل ومصممة خصيصاً للامتثال لمكافحة الاحتيال ومكافحة غسل الأموال، والتي تستفيد من النماذج ذات الأوزان المفتوحة، وتحسينات الخدمة المتقدمة مثل PagedAttention وتخزين البادئة المؤقت (prefix caching)، وبوابات جودة صارمة لتحقيق تحسينات كبيرة في معدل الإنتاجية، وزمن الاستجابة، واستغلال وحدة معالجة الرسومات مقارنة بنهج خدمة النماذج اللغوية الكبيرة العامة.

Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang2026-05-13