🤖 AI

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

تقدم الورقة البحثية DASH (آفاق الإشراف المتكيفة مع التباعد)، وهي طريقة تعزز التقطير الذاتي داخل السياسة (on-policy self-distillation) لنماذج الاستنتاج من خلال ضبط أوزان الإشراف على مستوى الرمز (token-level) بشكل تكيفي بناءً على التطور الزمني لتباعد المعلم والطالب، مما يؤدي إلى تحسين الأداء عبر الاختبارات المرجعية الرياضية دون الحاجة إلى عمليات تمرير أمامي إضافية.

ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, We (…)2026-08-07
🤖 AI

Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model

تقدم هذه الورقة البحثية RSBdSL38، وهو عبارة عن مجموعة بيانات لصور لغة الإشارة البنغالية مكونة من 10,874 صورة تم التحقق منها من قبل خبراء، ونموذجًا خفيف الوزن يعتمد على آلية الانتباه ويُبنى من الصفر، يحقق دقة عالية وأداءً في الوقت الفعلي على الأجهزة المحمولة، مما يوفر بديلًا قابلاً للنشر للهياكل الضخمة سابقة التدريب.

Saad Ahmed, Md Khalid Syfullaha2026-08-07
🤖 AI

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

تقترح هذه الورقة وتتحقق من صحة إطار عمل لتعزيز الواقعية الهيكلية للمعايير المرجعية السريرية الاصطناعية عبر التعامل مع المنفعة كقيد بدلاً من كونها مؤشراً للجودة، مبرهنةً على أن المراجعات المستهدفة يمكن أن تحسن بشكل كبير من واقعية البيانات وتنوعها دون المساس بالأداء التشغيلي اللاحق.

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christin (…)2026-08-07
🤖 AI

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

تقدم هذه الورقة إطار عمل للتدقيق السببي لإثبات أن نموذج "التفكير بالصور" في النماذج اللغوية الكبيرة متعددة الوسائط غالبًا ما يخلق وهمًا بالفعالية، حيث يفشل استخدام الأدوات البصرية في تحسين الإجابات سببيًا بسبب سوء معايرة السياسة، على الرغم من مكاسب الدقة الإجمالية.

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu2026-08-07
🤖 AI

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

تقدم هذه الورقة HarnessOpt-Bench، وهو معيار مرجعي جديد صُمم لتقييم قدرة النماذج اللغوية الكبيرة الرائدة على تحسين أطر العمل الوكيلة (بما في ذلك المطالبات، والأدوات، وكود التنسيق) بشكل تكراري تحت قيود الموارد، مما يثبت أن قدرة التحسين هذه هي مهارة متميزة وقابلة للقياس مع وجود مجال كبير للتحسين.

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue2026-08-07
🤖 AI

Challenges in Evaluating Explanation Methods for Static and Evolving Data

تتناول هذه الورقة أوجه القصور في تقييم الذكاء الاصطناعي القابل للتفسير من خلال تقديم تقييمات قائمة على العنصر البشري للكشف عن الانحياز وإلغاء تعلم المفاهيم في نظام DetoxAI، مع استكشاف تحديات تكييف التفسيرات مع تدفقات البيانات المتطورة وتتبع التطور المشترك للبيانات والنماذج والتفسيرات.

Jerzy Stefanowski2026-08-07
🤖 AI

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

تقدم هذه الورقة إطار عمل للتحليل القائم على التتبع يكشف أن نماذج لغة الفيديو تعاني من "فخ التردد المنخفض"، حيث تنهار قدرتها على العد والاسترجاع بدقة للأحداث مع زيادة تردد الأحداث وعددها، وغالباً ما تفشل حتى عندما يؤدي تحسين أخذ العينات المرئية إلى تحسين الدرجات الإجمالية دون ضمان التفكير الزمني الأمين.

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein (…)2026-08-07
🤖 AI

Investigating Artificial Intelligence Digital Sovereignty in Mobile Shopping Apps: A Case Study of Nigeria

تستقصي هذه الدراسة تأثير الذكاء الاصطناعي على السيادة الرقمية ضمن تطبيقات التسوق عبر الهاتف المحمول في نيجيريا، كاشفةً أنه بينما يتم تطبيق الذكاء الاصطناعي على نطاق واسع، فإن محدودية الشفافية والوعي المتوسط لدى المستخدمين يخلقان تحديات كبيرة للحفاظ على تحكم المستخدم ومساءلة المنصات.

George Grispos, Sajda Qureshi2026-08-07
💬 NLP

Learning When to Trust via Selective Context Preference Optimization

تقدم الورقة البحثية MIST، وهو معيار للثقة الانتقائية، وتقترح SCOPE، وهي طريقة تدريب تعمل على تحسين النماذج لمقاومة السياق المضلل مع الحفاظ على قدرتها على الاستخدام الصحيح للمعلومات المفيدة أو غير ذات الصلة، مما يعالج قصور مجرد تجاهل جميع الإشارات الخارجية.

Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong2026-08-07