🤖 machine learning

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

تقدم هذه الورقة **CostAda**، وهو متحكم تكيفي مُعاير بالتكلفة يعمل على تحسين عملية اكتشاف النماذج اللغوية الكبيرة (LLM) عبر تخصيص موارد البحث ديناميكيًا بناءً على نسبة مكاسب الجودة إلى تكلفة الرموز (tokens)، مما يحقق نتائج متفوقة أو مكافئة بميزانيات أقل بكثير مقارنة بالطرق الحالية.

Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi2026-07-30
🤖 machine learning

ReCo: Reweighting GRPO Against Distributional Concentration

تقدم الورقة البحثية ReCo، وهي طريقة لإعادة الوزن تخفف من ميل GRPO للتركيز على الاستجابات والرموز ذات الاحتمالية العالية من خلال تطبيع مساهمات الاستجابة واستبدال نسب الأهمية بمقياس قائم على التباين، مما يحسن أداء Pass@k في معايسات الاستدلال الرياضي دون التضحية بدقة k الصغيرة.

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim2026-07-30
📊 statistics

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

تقترح الورقة البحثية إطار عمل "فكر باختصار، وأجّل بذكاء" (TSDS)، وهو مخصص لوكلاء النماذج اللغوية الكبيرة (LLMs) على الحافة، والذي يعمل على تحسين الإنهاء المبكر للاستنتاج والتأجيل السحابي المدرك لعدم اليقين بشكل مشترك عبر إجراء تعلم متعدد الأهداف ومعاير، مما يقلل بشكل كبير من الحوسبة على الجهاز مع الحفاظ على ضمانات الأداء الموثوق والموثوقية عبر مختلف مهام الاستنتاج والتخطيط.

Amirmohammad Farzaneh, Osvaldo Simeone2026-07-30
💬 NLP

Hearsay: Vision-Language Medical Diagnoses Without an Image

تُظهر هذه الورقة أن النماذج الرؤيوية-اللغوية المتطورة تفتري بشكل منهجي على تشخيصات طبية مهيكلة بناءً فقط على الخصائص الديموغرافية للمريض عند عدم توفر أي صورة، مما يكشف عن أنماط فشل متميزة وغير عشوائية عبر النماذج المختلفة، ويسلط الض light الضوء على الحاجة الماسة لتدقيق المخرجات المهيكلة وفحص الحساسية تجاه الكلمات في عمليات النشر السريري.

Siddharth Vohra2026-07-30
🤖 AI

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

يُعد Pegasus إطار عمل منخفض الموارد يسد فجوة التجسيد بين التحكم البشري والتحكم الروبوتي من خلال ترجمة فيديوهات العروض البشرية إلى بيانات قابلة للتعلم من قبل الروبوت عبر مسار نقل معرفة مهيكل وقائم على الرسوم البيانية، معزز بمدقق فيزيائي.

Jia Luo2026-07-30
🤖 machine learning

Actions Have Consequences: Detecting Outcome Performativity using Intervention Testing

تقدم هذه الورقة "كشف اختبار (أ/ب) للأداء الناتجي" (OPAB)، وهو إطار عمل رسمي يستخدم اختبار التدخل للكشف عن الحالات التي تؤثر فيها التنبؤات سببياً على نتائجها الخاصة، مع اشتقاق والتحقق من حدود تعقيد العينة لتحديد الإعدادات التي يكون فيها هذا الكشف ممكناً أو مستحيلاً بسبب قيود البيانات.

Brandon Gower-Winter, Georg Krempl2026-07-30
🤖 machine learning

Defending Against Backdoor Attacks via Alignment Checking in Model-Contrastive Federated Learning

تقترح الورقة البحثية FedDAB، وهو دفاع للتعلم الاتحادي يتكون من مرحلتين يجمع بين تنظيم التباين للنموذج المحلي والتحقق من المحاذاة للتخفيف بفعالية من هجمات الباب الخلفي مع مراعتق التباين الإحصائي وضمان التقارب النظري.

Hongliang Zhang, Zhongyuan Yu, Guijuan Wang, Tianqing He, Wenshuo Ma, Xiaosong Zhang, Jiguo Yu2026-07-30
🤖 AI

What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation

تقترح هذه الورقة إطار عمل للكشف ثلاثي الفئات يتغلب على قيود مصنفات "الإنسان مقابل البوت" الثنائية من خلال تحديد الوكلاء الاصطناعيين عبر مجموعات سمات سلوكية دنيا ومتينة (تحديداً معدل أحداث الماوس ونسبة النقر بالانتقال الآني) التي تستغل آثار أتمتة المتصفح المتأصلة بدلاً من أنماط الاستدلال، محققةً دقة كشف تقارب الكمال حتى في ظل محاولات التهرب المتطورة.

Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger2026-07-30
🤖 AI

Belief-Guided Decision Making with Uncertainty Gating in the Game of Go

تقترح هذه الورقة بنية "الموجهة بالاعتقاد" (Belief-Guided) مبتكرة للعبة "غو" الحاسوبية، تعمل على فصل رؤوس السياسة والاعتقاد لنمذجة عدم اليقين المعرفي وتصفية الهلوسات عبر آلية بوابية، مما يتيح لعباً بمستوى المحترفين دون الحاجة للبحث، وذلك على أجهزة استهلاكية من خلال نقل الذكاء الحسابي من البحث الشجري أثناء وقت التشغيل إلى الحدس البارامتري.

Mehrad Yaghoubi, Azam Bastanfard, Abbas Jalilvand, Ashkan Rezaei2026-07-30
📊 statistics

BayesAME: Bayesian Active Model Evaluation

تُعد BayesAME إطاراً بايزياً متسلسلاً يحدد تلقائياً الحجم الأمثل للمجموعة الجوهرية (coreset) لتقييم النماذج التوليدية الضخمة بكفاءة، وذلك عبر نمذجة قدرات العناصر الكامنة، وقياس عدم اليقين، والاختيار المتكرر للعناصر المعلوماتية حتى تستقر تقديرات الأداء، مع إثبات تفوقها على الاختيار العشوائي والأساليب القائمة من خلال استخدام احتمالات لوغاريتمية مستمرة.

Paula Cordero Encinar, Taylan Cemgil, Arnaud Doucet, Virginia Aglietti, Silvia Chiappa2026-07-30