💬 NLP

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

تقدم هذه الورقة "govllm"، وهو إطار عمل مفتوح المصدر يطبق مبدأ "الحوكمة من خلال المقاييس" لتمكين المراقبة المستمرة لامتثال النماذج اللغوية الكبيرة بموجب قانون الذكاء الاصطناعي للاتحاد الأوروبي، وذلك عبر استخدام مجموعة من النماذج اللغوية الصغيرة المتخصصة كقضاة تنظيميّين لتوليد إشارات امتثال في الوقت الفعلي وتحديد حالات عدم اليقين للتحكيم البشري.

Jehanne Dussert2026-05-26
🤖 machine learning

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

تقدم الورقة البحثية BOOST، وهو إطار عمل للتحسين ثنائي المستوى يتعلم تلقائيًا كيفية إعادة وزن المسارات الاصطناعية غير المتجانسة متعددة الجولات لضبط النماذج اللغوية الكبيرة (LLM) من خلال تحسين رأس خفيف الوزن على بيانات تحقق حقيقية، مما يوازن بين التنوع والجودة للتفوق على النماذج المرجعية الحالية دون الحاجة إلى حكام خارجيين.

Shresth Verma, Mauricio Tec, Cheol Woo Kim, Kai Wang, Milind Tambe2026-05-26
🤖 AI

Proper Scoring Rules for Agentic Uncertainty Quantification

تقدم هذه الورقة "درجة المسار الملائمة" (TPS)، وهي قاعدة تسجيل ملائمة تماماً تستخلص بدقة كامل أثر احتمالية النجاح المشروط بالبادئة لنماذج اللغة الوكيلية، مما يعالج أوجه القصور في المقاييس الحالية التي تفشل في التمييز بين أداء التصنيف والصدق الاحتمالي في التكميم اليقيني للوكلاء.

Suresh Raghu, Satwik Pandey, Shashwat Pandey2026-05-26
🤖 machine learning

Complement Submodular Information Measures for Balanced and Robust Data Selection

تقدم هذه الورقة البحثية "معلومات المتمم شبه المحدبة" (CSI)، وهي فئة جديدة من الأهداف التي تقيس العلاقات الهيكلية بين مجموعة فرعية مختارة ومتممها لتحقيق اختيار بيانات متوازن وقوي مع ضمانات تقريب جشعة شبه مثالية وأداء فائق في المهام اللاحقة.

Rishabh Iyer2026-05-26
🤖 AI

GRAIL: AI translation for scientists application workflow on satellite data

تقدم هذه الورقة GRAIL، وهو نظام ذكاء اصطناعي وكيل يقوم تلقائيًا بترجمة سير عمل البيانات الجيومكانية بلغة بايثون القابلة للتوسع إلى برامج Spark قابلة للتنفيذ لتحليل بيانات الأقمار الصناعية عبر تكييف مكتبة RDPro واستخدام مسار LangGraph مهيكل لإصلاح الكود المستهدف، مما يمكّن علماء المجال من معالجة البيانات واسعة النطاق دون الحاجة لتعلم إطار عمل جديد.

Zhuocheng Shang, Ahmed Eldawy2026-05-26
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

يقدم PANDO إطار عمل فعال لتقطير المهارات عبر الإنترنت يُمكّن الوكلاء الويب متعددي الوسائط من تحسين الأداء وتقليل استهلاك الرموز (tokens) من خلال الحفاظ على مكتبة مهارات مهيكلة وتوظيف تقنيات مثل انعكاس التقدم والتحفيز المدرك للتخزين المؤقت، محققاً معدل نجاح بنسبة 58.3% في VisualWebArena بتكاليف استدلال أقل بكثير مقارنة بالطرق الحالية.

Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu2026-05-26
🤖 machine learning

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

تُعد استراتيجية CONF-KV طريقة مبتكرة لإخلاء ذاكرة التخزين المؤقت لـ KV، حيث تقوم بتعديل ميزانيات التخزين المؤقت ديناميكيًا بناءً على ثقة النموذج في التنبؤ لكل خطوة، وتستخدم تخزينًا بدقة مختلطة لتقليل استخدام الذاكرة بشكل كبير مع الحفاظ على دقة استرجاع عالية وأداء المهام للاستنتاج طويل الأمد في النماذج اللغوية الكبيرة.

Yubo Li, Yidi Miao2026-05-26
🤖 AI

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

تقترح هذه الورقة إطار عمل للضبط الدقيق كفء في المعلمات يجمع بين نموذج الرؤية واللغة Florence-2 للإجابة على الأسئلة البصرية السريرية، ونموذج Stable Diffusion 2.1 المعزز بتقنية LoRA لتوليد صور جهاز هضمي اصطناعية تحافظ على الخصوصية، مما يظهر أداءً فائقًا وتكاليف حوسبة منخفضة مقارنة بالنماذج الحالية.

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman2026-05-26
🤖 AI

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

تقدم هذه الورقة استنتاج "فرق تسد" (DCI)، وهي استراتيجية مبتكرة لتوسيع نطاق الاستنتاج في وقت الاختبار، تعمل على تخفيف انهيار الأداء في التعرف البصري واسع النطاق من خلال تفكيك مهام التصنيف المعقدة بشكل متكرر إلى مشكلات فرعية محلية، مما يؤدي إلى تحسين نسب الإشارة إلى الضوضاء والكفاءة الحسابية لتمكين النماذج اللغوية الكبيرة متعددة الوسائط مفتوحة المصدر والخفيفة من منافسة العمالقة المغلقين من الطراز الأول دون تدريب إضافي.

Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao2026-05-26
🤖 AI

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

يُعد CoRe-Code إطار عمل للتعلم التعزيزي التعاوني يوظف وكلاء "مخطط" (Planner) و"مبرمج" (Coder) متخصصين في الأدوار، معززين بخوارزمية تحسين السياسة النسبية للمجموعة (GRPO)، للتغلب على قيود فك الترميز ذاتي الانحدار وتحسين دقة وكفاءة توليد الكود عبر المهام المعقدة.

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas2026-05-26