🤖 AI

Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode

تكشف هذه الورقة أنه بينما يعتمد استنتاج النماذج اللغوية الكبيرة (LLM) في مرحلة الدفعة الأولى (batch-1) للذكاء الاصطناعي الفيزيائي على الذاكرة، فإن وحدات معالجة الرسومات الأسرع تعاني من أعباء إضافية غير متناسبة في جانب الإطلاق تمنع تحقيق مكاسب متناسبة في زمن الاستجابة، وأن طرق التكميم القياسية غالبًا ما تفشل في تحقيق تسريع السرعة المتوقع ما لم تقترن بنواة محسنة للغاية مثل GPTQ+ExLlamaV2.

Josef Chen2026-06-01
🤖 AI

Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

تقترح هذه الورقة إطار عمل للتعلم التعزيزي المدرك لعدم اليقين من أجل القيادة الذاتية، يقوم بتفعيل وتنظيم نصيحة الخبير ديناميكياً بناءً على عتبات عدم يقين تكيفية واستراتيجية التزام-فترة تبريد، مما يتيح استكشافاً أكثر أماناً وكفاءة في التقاطعات غير المنظمة مع تجنب الاعتماد طويل الأمد على توجيه الخبير.

Ahmed Abouelazm, Felix Klingebiel, Philip Schörner, J. Marius Zöllner2026-06-01
💬 NLP

ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law

تقدم هذه الورقة ImmigrationQA، وهي مجموعة بيانات مستندة إلى مصادر تتضمن أكثر من 17,000 زوج من الأسئلة والأجوبة المستمدة من لوائح الهجرة الأمريكية، وتثبت أن الضبط الدقيق لنموذج Llama 3.2 الصغير ذي الـ 3 مليارات معلمة على هذه البيانات يحسن أداءه بشكل كبير في استعلامات إجراءات الهجرة مقارنة بالنماذج الأساسية الأكبر، كل ذلك مع الحفاظ على تكلفة حوسبة منخفضة.

Nazarii Shportun2026-06-01
🤖 machine learning

Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents

تقدم هذه الورقة "درجة الحساسية السببية" (CSS)، وهي مقياس تدخلي يكشف عن تباينات جوهرية بين أداء نماذج الذكاء الاصطناٍعي السريري في معايير التغطية القياسية وبين استجابتها الفعلية للتغيرات الحرجة في بيانات المرضى، مما يكشف عن ملفات تعريف القدرات الخفية ونقاط العمى في السلامة الشاملة التي تغفل عنها طرق التقييم التقليدية.

Matt Turk2026-06-01
🤖 AI

An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations

تقترح هذه الورقة بنية تشغيل لوكلاء نماذج لغوية كبيرة (LLM) قابلة للنشر محلياً وعلى نطاق المؤسسة للأمن السيبراني المالي المنظم، والتي تفرض سياقاً أمنياً نمطياً عبر جميع المكونات، وتدمج أنظمة SIEM/XDR كمحفزات أساسية، وتضمن القابلية للتدقيق من خلال مهايئات أدوات محكومة، ونتائج مهيكلة، وبوابات تدخل بشري متعددة المستويات.

George Fatouros, Georgios Makridis, George Kousiouris, John Soldatos, Dimosthenis Kyriazis2026-06-01
📊 statistics

Reward Learning from Best-of-NN Preference Data: Targets, Tradeoffs, and Design Principles

تحلل هذه الورقة تعلم المكافأة من بيانات التفضيل من نوع "الأفضل من N" عبر اشتقاق أهداف ذات صيغة مغلقة للمتغيرات المستقلة، وتوصيف المقايضة بين الهامش والاتصال التي تملي الاختيار الأمثل لـ N، واقتراح مبادئ تصميمية لموازنة تكاليف التوليد مقابل كفاءة التسمية.

Rattana Pukdee, Maria-Florina Balcan, Pradeep Ravikumar2026-06-01
📊 statistics

Active Timepoint Selection for Learning Measure-Valued Trajectories

تقدم هذه الورقة إطار عمل جديد للتعلم النشط يستفيد من النقل الأمثل الخطي لتعيين التوزيعات الاحتمالية في نموذج عملية غاوس، مما يتيح الاختيار الاستراتيجي لأوقات القياس المثلى لاستنتاج المسارات المستمرة من لقطات متباعدة ومدمرة في مجالات مثل بيولوجيا الخلية الواحدة.

Nicolas Huynh, Mihaela van der Schaar2026-06-01
🤖 AI

Rationalize: Shared Semantic Reasoning for Human-AI Alignment

تقدم الورقة البحثية "Rationalize"، وهو إطار عمل قائم على ثنائية الأدوار يعزز التوافق بين الإنسان والذكاء الاصطنا_عي في عملية استنباط المعنى القائمة على البيانات من خلال إنشاء مساحة استدلال مشتركة حيث تقوم الأدوار المتكاملة بصياغة القصد والمنطق بشكل صريح لتسهيل الفهم والتعاون ثنائي الاتجاه.

Aritra Dasgupta, Naga Datha Saikiran Battula, Avina Nakarmi, Sohom Sen, Subhodeep Ghosh, Xun Song2026-06-01
🤖 AI

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

تقدم هذه الورقة البحثية PInVerify، وهو معيار تجريبي مجسد غير متصل بالإنترنت مصمم لتقييم مهام التحقق النشط من العينات (AIV) حيث يجب على الوكلاء إجراء عمليات فحص متعددة المشاهد للتمييز بين سمات الأشياء دقيقة التفاصيل، مما يكشف أنه بينما يحقق الوكلاء الذين تم ضبطهم باستخدام تقنية LoRA أداءً قويًا، فإن استراتيجيات "أفضل مشهد تالٍ" الحالية لا توفر بعد مكاسب موثوقة مقارنة بالنماذج المرجعية الثابتة.

Yuhang Jiang2026-06-01
💬 NLP

COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models

تُعد COFT طريقةً للتدريب في وقت فك التشفير، تعمل على تقليل التحيزات المجتمعية في استدلال تسلسل الأفكر (chain-of-thought) للنماذج اللغوية الكبيرة من خلال الجمع بين دمج اللوجيتات الواقعي المضاد والمعايرة المطابقة، مما يحقق تقليلاً كبيراً في التحيز مع الحفاظ على فائدة المهمة دون الحاجة إلى إعادة تدريب النموذج.

Arya Fayyazi, Mehdi Kamal, Massoud Pedram2026-06-01