💻 computer science

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

تقدم هذه الورقة GRIEF، وهو فاحص (fuzzer) من نوع الصندوق الرمادي (greybox) يستهدف تعقيدات التزامن وإدارة الحالة في أنظمة خدمة النماذج اللغوية الكبيرة (LLM) للكشف عن الثغرات الحرجة مثل فشل عزل ذاكرة التخزين المؤقت وتداخل الأداء، حيث نجح في تحديد 15 مشكلة جديدة بما في ذلك ثغرتان من نوع CVE في محركات مثل vLLM وSGLang.

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek2026-05-13
🤖 machine learning

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

تُظهر هذه الورقة أن المتوسط الحسابي البسيط يفشل في إنتاج ترتيبات دقيقة في مصفوفات التقييم المتفرقة ذات مستويات صعوبة العناصر المتباينة عبر مجالات متعددة، بينما تستطيع نماذج نظرية الاستجابة للمفردة (IRT) استعادة ترتيبات الحقيقة الأرضية بمتانة في ظل هذه الظروف.

Jung Min Kang2026-05-13
🤖 machine learning

Enforcing Constraints in Generative Sampling via Adaptive Correction Scheduling

تقدم هذه الورقة جدولة التصحيح التكيفي، وهي سياسة تعتمد على الحالة تعمل على تحسين توقيت إسقاطات القيود أثناء أخذ العينات التوليدية للحفاظ بشكل أفضل على الديناميكيات المقصودة وتحسين جبهة التكلفة-الدقة مقارنة باستراتيجيات الإسقاط الثنائية التقليدية.

Noah Trupin, Yexiang Xue2026-05-13
🧬 biology

Beyond Manual Curation: Augmenting Targeted Protein Degradation Databases via Agentic Literature Extraction Workflows

تقدم هذه الورقة سير عمل وكيلًا يعتمد على وجود خبير في الحلقة، والذي يستفيد من تحسين الأوامر البرمجية لأتمتة استخراج بيانات تحلل البروتين المستهدف المعقدة من الأدبيات العلمية، محققًا دقة عالية وموسعًا قواعد البيانات الحالية بشكل كبير مع التقاط السياق التجريبي الجوهري الذي فُقد سابقًا في عمليات التقييم اليدوي.

Yaochen Rao, Farzaneh Jalalypour, N. M. Anoop Krishnan, Rocío Mercado2026-05-13
🤖 machine learning

ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

تُعد ADMM-Q خوارزمية مبتكرة وتركيبية لتكميم أوزان ما بعد التدريب، تعتمد على متغير توافقي من طريقة "ألتيرنيتنج دايركشن ميثود أوف مالتي بلايرز" (ADMM)، تعمل على تحسين فائدة النماذج اللغوية الكبيرة بشكل كبير عند مستويات التكميم الهجومية التي تقل عن 4 بت، وذلك من خلال تقليل خطأ إعادة البناء لكل طبقة مع فرض قيود التكميم.

Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder2026-05-13
🤖 AI

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

إن PIVOT هو إطار عمل للتعلم الذاتي يجسّر الفجوة بين التخطيط والتنفيذ في وكلاء النماذج اللغوية الكبيرة (LLM agents) من خلال تحسين المسارات المرشحة بشكل تكراري عبر عملية مكونة من أربع مراحل هي التخطيط، والفحص، والتطوير، والتحقق، محققاً أداءً هو الأفضل في فئته مع تقليل التكاليف الحسابية بشكل كبير.

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis2026-05-13
🤖 machine learning

LiBaGS: Lightweight Boundary Gap Synthesis for Targeted Synthetic Data Selection

تُعدُّ LiBaGS طريقةً خفيفة الوزن وغير مرتبطة بمولد محدد، تعمل على تحسين اختيار البيانات الاصطناعية من خلال تقييم العينات بناءً على القرب من الحدود، وعدم اليقين، والكثافة، مع توظيف قاعدة تخصيص فجوة الحدود ومعيار توقف القيمة الهامشية لتحسين دقة المهام اللاحقة دون بيانات زائدة أو غير واقعية.

Abhishek Moturu, Anna Goldenberg, Babak Taati2026-05-13
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

تقدم هذه الورقة بنية تحتية لعمليات النماذج اللغوية الكبيرة (LLMOps) مدركة لحجم عبء العمل ومصممة خصيصاً للامتثال لمكافحة الاحتيال ومكافحة غسل الأموال، والتي تستفيد من النماذج ذات الأوزان المفتوحة، وتحسينات الخدمة المتقدمة مثل PagedAttention وتخزين البادئة المؤقت (prefix caching)، وبوابات جودة صارمة لتحقيق تحسينات كبيرة في معدل الإنتاجية، وزمن الاستجابة، واستغلال وحدة معالجة الرسومات مقارنة بنهج خدمة النماذج اللغوية الكبيرة العامة.

Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang2026-05-13
🤖 machine learning

A Comparative Study of Model Selection Criteria for Symbolic Regression

تقدم هذه الورقة مقارنة تجريبية منهجية لمعايير اختيار النماذج في الانحدار الرمزي عبر سبع مجموعات بيانات اصطناعية، كاشفةً أن معيار طول الوصف الأدنى (MDL) ومعيار المعلومات البايزي (BIC) هما الطريقتان الأكثر فعالية لتحديد التعبيرات الحقيقية وتقليل خطأ الاختبار.

Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio2026-05-13
🤖 machine learning

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

تقدم الورقة البحثية METIS، وهو إطار عمل مبتكر يستوعب حكم المنهج الدراسي كقدرة معرفية فوقية أصيلة للضبط الدقيق بالتعزيز للنماذج اللغوية الكبيرة عبر الاستفيد من تباين المكافأة داخل المطالبة لتخصيص موارد التدريب ديناميكيًا، مما يلغي الاعتماد على الاستدلالات الخارجية ويحقق أداءً فائقًا مع تقارب أسرع بشكل ملحوظ.

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu2026-05-13