🤖 AI

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

تقترح هذه الورقة استراتيجية "تحسين السياسة النسبية للمجموعات المعايرة للرفض" (RC-GRPO)، وهي استراتيجية تعلم تعزيزي تمكن النماذج اللغوية الكبيرة متعددة الوسائط من رفض الكائنات غير الموجودة بفعالية في مهام فهم التعبيرات المرجعية المعممة دون المساس بدقة تحديد المواقع للأهداف الموجودة.

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang2026-08-06
🤖 machine learning

Design Choices That Matter: A Functional ANOVA Analysis for Remote Sensing Multi-Label Classification

تستخدم هذه الورقة تحليل التباين الوظيفي (functional ANOVA) لتحليل كيفية تأثير خيارات تصميم التعلم العميق المختلفة وتفاعلاتها بشكل منهجي على أداء التصنيف متعدد الملصقات عبر مجموعات بيانات متنوعة للاستشعار عن بعد، مما يكشف أن الاستراتيجيات المثلى تعتمد على خصائص محددة لمجموعة البيانات مثل النطاق والدقة.

Maryam Gholami Shiri, Eva Tuba, Sašo Džeroski, Tome Eftimov, Ana Nikolikj2026-08-06
🤖 AI

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

تقدم هذه الورقة البحثية "أدوات الكناري" (canary tools)، وهي إطار تشخيصي يستخدم تصنيفاً سداسي الأنواع من أدوات الاستقصاء المصممة هندسياً لتجاوز مقاييس النجاح والفشل البسيطة والكشف عن نقاط الضعف المحددة في التفكير لدى وكلاء النماذج اللغوية الكبيرة عند اختيار الأدوات، حيث وجدت أن القابلية للتأثر بهذه الاستقصاءات تتباين بشكل كبير باختلاف قدرة النموذج وتتنبأ بالفشل في المهام.

Atul Anand, Sourav Chattaraj2026-08-06
🤖 AI

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

تقدم هذه الورقة البحثية "دلالات المهام المرئية" (VTS) للكشف عن فجوة أداء كبيرة في النماذج متعددة الوسائط عندما تُدمج التعليمات كبكسلات بدلاً من نصوص، وتقترح طريقة لربط منطقة التلقين (prompt-region grounding) تسد بفعالية فجوة القناة الدلالية هذه دون الحاجة إلى التعرف الضوئي على الحروف (OCR) أو بيانات وصف المناطق أثناء الاستدلال.

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang2026-08-06
🤖 AI

Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

تقدم هذه الورقة معياراً مرجعياً يوضح أنه بينما تنجح مراقبة "سلسلة الأفكال" (Chain-of-Thought) بفعالية في اكتشاف التحولات السلوكية الناتجة عن التعليمات الصريحة للتستر، فإن موثوقيتها تنخفض بشكل كبير في إعدادات التأثير الضمني حيث لا توجد مثل هذه التعليمات، مما يشير إلى أن التقييمات الأمنية الحالية قد تبالغ في تقدير قابلية المراقبة.

Agatha Duzan, Asa Cooper Stickland2026-08-06
🤖 AI

InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval

تقدم الورقة البحثية InsightEmb، وهو إطار عمل للتمثيل التبايني (contrastive embedding framework) يتعلم هندسة استرجاع قابلة للنقل وموجهة نحو التقدم من بيانات الاستدلال الرياضي لتمكين الوكلاء من استرجاع رؤى قابلة للتنفيذ بفعالية تحل اختناقات اتخاذ القرار عبر مجالات متنوعة دون الحاجة إلى تدريب خاص بالبيئة.

Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu2026-08-06
🤖 AI

FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening

تقدم هذه الورقة FUSEP، وهو أول مجموعة بيانات مرجعية متعددة المراكز متاحة للجمهور وتتكون من 4,017 صورة بالموجات فوق الصوتية لأجنة في مراحل الحمل المبكرة مع 45,820 تعليقاً خبيراً عبر 14 بنية تشريحية، صُممت لتعزيز أبحاث التشخيص الآلي المساعد وتكيف النطاق في فحص الأجنة.

Bin Pu, Jiewen Yang, Liwen Wang, Ying Tan, Guannan He, Xingbo Dong, Qika Lin, Jiarong Guo, Lixian Yang, Zuozhu Liu, Shen (…)2026-08-06
🤖 AI

Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

تقدم الورقة البحثية ReCo، وهو إطار عمل منسق بالمكافأة يعمل على تحسين نماذج الاستدلال الكبيرة عبر الضبط الديناميكي لضغط ذاكرة التخزين المؤقت (KV-cache)، وكبح عمليات التأمل الزائدة، وتمكين التوقف المبكر بناءً على مكافآت العمليات، مما يقلل بشكل كبير من تكاليف الاستدلال وزمن الاستجابة مع الحفاظ على الدقة.

Qiyuan Zhu, Dezhi Li, Pengyu Cheng, Tianle Chen, Jiacheng Wang, Ruijie Shen, Hao Gu, Sida Lin, Zirui Liu, Jiacheng Liu (…)2026-08-06
🤖 machine learning

IMFACT: Counterfactual Explanations for Time Series via Intrinsic Mode Function Substitution

تقدم هذه الورقة IMFACT، وهو إطار عمل مستقل عن النموذج يولد تفسيرات مضادة للواقع ذات معقولية فيزيائية لمصنفات السلاسل الزمنية عبر تفكيك الإشارات إلى دوال الأنماط الجوهرية بواسطة تفكيك النمط التجريبي واستبدال المكونات المختارة بأخرى من أقرب الجيران غير المتشابهين، وهي طريقة تتفوق على النماذج المرجعية الحالية في الموثوقية والمعقولية والقرب في مجموعات البيانات المعيارية.

Udo Schlegel, Julian Rakuschek, Thomas Seidl, Andreas Holzinger, Tobias Schreck, Javier Del Ser2026-08-06
🤖 AI

Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First

يُعد SuperScout إطار عمل فعال من حيث التكلفة يقوم بنشر وكيل "بحث" خفيف الوزن لاستكشاف المستودع وتوليد تسليم مهيكل ومتحقق منه، مما يمكّن الموجه من إرسال مهام إصلاح البرمجيات إلى النماذج الرائدة بتكلفة تبلغ حوالي خمس التكلفة لكل عملية حل مع مطابقة أداء أفضل نموذج منفرد.

Ishaan Bhola, Adithyan Krishnan, Mukunda NS2026-08-06