🔭 astrophysics

Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

تقدم هذه الورقة إطاراً نظرياً للمعلومات باستخدام النماذج اللغوية الكبيرة لقياس مدى قابلية إعادة بناء الأساليب الفيزيائية الفلكية، كاشفةً أنه في حين أن الأوصاف النصية توضح البنى الخوارزمية، إلا أنها تفشل في القضاء على التباين في التنفيذ بسبب المعرفة الضمنية المفقودة لدى الخبراء، مما يؤسس أداة تشخيصية جديدة لتدقيق الشفافية المنهجية.

Hsing Wen Lin, Zong-Fu Sie2026-05-13
🤖 machine learning

Interpretability Can Be Actionable

تجادل هذه الورقة البحثية بأن مجال القابلية للتفسير يجب أن ينقل تركيزه من تطوير طرق جديدة إلى وضع معايير تقييم "قابلة للتنفيذ"، تُعرف من خلال الملموسية والتحقق، لضمان أن تؤدي الرؤى إلى قرارات وتدخلات ملموسة في العالم الحقيقي.

Hadas Orgad, Fazl Barez, Tal Haklay, Isabelle Lee, Marius Mosbach, Anja Reusch, Naomi Saphra, Byron Wallace, Sarah Wiegr (…)2026-05-13
💬 NLP

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

يقدم النموذج ثنائي المجلس (Bicameral Model) واجهة عصبية قابلة للتدريب تتيح لنموذجين لغويين مجمدين التنسيق بشكل ثنائي الاتجاه من خلال اقتران مستمر للحالة الخفية، مما يسمح لنموذج أولي بقيادة المهام بينما يقوم نموذج مساعد بتنفيذ الأدوات أو الأكواد، وهو ما يعزز الأداء بشكل كبير في الحساب والمنطق والاستدلال الرياضي دون الاعتماد على التواصل القائم على النصوص.

Cedric Flamant, Udaya Ghai, Kanna Shimizu2026-05-13
💻 computer science

Adversarial SQL Injection Generation with LLM-Based Architectures

تقدم هذه الورقة نظامين جديدين يعتمدان على النماذج اللغوية الكبيرة، وهما RADAGAS وRefleXQLi، لتوليد حمولات حقن SQL العدائية وتقييم فعاليتهما ضد جدران حماية تطبيقات الويب المتنوعة، مما يكشف أنه في حين تتفوق هذه النماذج بشكل كبير على الخطوط المرجعية في تجاوز الدفاعات القائمة على الذكاء الاصطناست/تعلم الآلة، إلا أنها تواجه صعوبة أمام الأنظمة القائمة على القواعد وتُظهر أن تنوع الحمولات لا يرتبط دائمًا بنجاح أعلى في التجاوز.

Ali Karakoc, H. Birkan Yilmaz2026-05-13
💻 computer science

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

تقدم هذه الورقة GRIEF، وهو فاحص (fuzzer) من نوع الصندوق الرمادي (greybox) يستهدف تعقيدات التزامن وإدارة الحالة في أنظمة خدمة النماذج اللغوية الكبيرة (LLM) للكشف عن الثغرات الحرجة مثل فشل عزل ذاكرة التخزين المؤقت وتداخل الأداء، حيث نجح في تحديد 15 مشكلة جديدة بما في ذلك ثغرتان من نوع CVE في محركات مثل vLLM وSGLang.

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek2026-05-13
🤖 machine learning

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

تُظهر هذه الورقة أن المتوسط الحسابي البسيط يفشل في إنتاج ترتيبات دقيقة في مصفوفات التقييم المتفرقة ذات مستويات صعوبة العناصر المتباينة عبر مجالات متعددة، بينما تستطيع نماذج نظرية الاستجابة للمفردة (IRT) استعادة ترتيبات الحقيقة الأرضية بمتانة في ظل هذه الظروف.

Jung Min Kang2026-05-13
🤖 AI

Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs

تثبت هذه الورقة أن المرتكزات الرقمية المضمنة تحيز بشكل منهجي أحكام جودة نماذج الرؤية واللغة من خلال الكشف عن رابط سببي بين القابلية السلوكية وديناميكيات التمثيل الخاصة بالطبقات، حيث يتشبع تصنيف المرتكز في الطبقات المبكرة بينما يحدث التنبؤ الأمثل للجودة في أعماق الشبكة.

M. Shalankin2026-05-13
🤖 AI

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

تقدم هذه الورقة VLATIM، وهو معيار مرجعي قائم على لعبة *The Incredible Machine 2* يكشف عن فجوة كبيرة بين قدرات التخطيط رفيعة المستوى والربط البصري الدقيق للنماذج اللغوية الرؤية الحالية، مما يثبت أنها لم تحقق بعد قدرات حل المشكلات المنطقية الشبيهة بالبشر في بيئات الألغاز التفاعلية القائمة على النقر والتشير.

Dominik Helfenstein, Marco Menner, Maximilian Triebel2026-05-13
💻 computer science

ABRA: Agent Benchmark for Radiology Applications

تقدم الورقة البحثية ABRA، وهو معيار مرجعي جديد لوكلاء الأشعة، يضم 655 مهمة تم إنشاؤها برمجياً ضمن بيئة DICOM واقعية، والتي تكشف عن قدرات النماذج الحالية القوية في تنسيق الأدوات ولكنها تظهر أيضاً قصوراً كبيراً في الإدراك الصوري الطبي وتحديد مواقع النتائج.

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo2026-05-13
🤖 AI

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

إن PIVOT هو إطار عمل للتعلم الذاتي يجسّر الفجوة بين التخطيط والتنفيذ في وكلاء النماذج اللغوية الكبيرة (LLM agents) من خلال تحسين المسارات المرشحة بشكل تكراري عبر عملية مكونة من أربع مراحل هي التخطيط، والفحص، والتطوير، والتحقق، محققاً أداءً هو الأفضل في فئته مع تقليل التكاليف الحسابية بشكل كبير.

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis2026-05-13