🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

يُعد CoTinyVLA نموذجاً للرؤية واللغة والعمل (Vision-Language-Action) يقل حجمه عن مليار معلمة، وهو يحقق أداءً فائقاً من حيث المتانة على معيار LIBERO-Plus عبر الاستفيد من تقنيات الإشراف المهيكل — بما في ذلك المدخلات الزمنية ثنائية الرؤية، وتقطير سلسلة الأفكما التسلسلي الهرمي، وتعزيز إعادة الصياغة — بدلاً من زيادة حجم النموذج.

Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim2026-07-29
🤖 AI

I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models

يُعد I2VShield إطار عمل فعال حاسبياًًا ومحافظاً على الخصوصية، يحمي نماذج تحويل الصور إلى فيديو القائمة على محولات الانتشار (Diffusion Transformers) من سوء الاستخدام عبر توظيف مولد تشويش متكيف مع النص وهجوم تعطيل الانتباه متعدد الوسائط غير المستهدف لتعطيل التماسك المكاني والزماني دون الحاجة إلى موارد وحدة معالجة رسومات عالية الأداء.

Yimao Guo, Zuomin Qu, Wei Lu2026-07-29
🤖 machine learning

Multi-Scale Structural Features for Continual, Comprehensible Visual Recognition in a Developmental Learning Framework

تقدم هذه الورقة تمثيلاً لسمات هيكلية متعددة المقاييس مدمجاً في إطار تعلم تطوري خالٍ من التدرج لتحقيق تعرّف بصري مستمر ومفهوم على مجموعة بيانات MNIST، بما يضاهي أو يتجاوز دقة النماذج المرجعية القائمة على إعادة التشغيل، مع الحفاظ على المعرفة السابقة والبنية القابلة للتفسير البشري دون تخزين أي بيانات سابقة.

Zeki Doruk Erden2026-07-29
🤖 AI

Entangled by Design: Spurious Intra-Variable Signal Routing in Tabular In-Context Learners

تكشف هذه الورقة أن المتعلمين في السياق (in-context learners) للبيانات الجدولية يوجهون التنبؤات حتمًا عبر إشارات زائفة مدمجة في الميزات المركبة بدلاً من الإشارات السببية الحقيقية، وهو فشل يزداد سوءًا مع زيادة حجم السياق وقدرة النموذج التعبيرية، ولكن يمكن التخفيف منه بفعالية من خلال بناء سياق مُصنف بيئيًا وتعزيز S-swap.

Athanasios Vlontzos, Giorgos Papanastasiou, Bernhard Kainz, Sotirios Tsaftaris2026-07-29
🤖 AI

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

تقدم هذه الورقة البحثية DAV-Det، وهو نظام كشف صوتي بصري منفصل يعمل على نمذجة الأدلة الجنائية من كل وسيط بشكل مستقل باستخدام تمثيلات بصرية متعددة التدرج وبنية صوتية زمنية-طيفية ذات بوابة، محققاً المركز الأول في تحدي IJCAI-ECAI 2026 للكشف عن المحتوى المولد بواسطة الذكاء الاصطرعي التوليدي (AIGC) الصوتي والمرئي العام عبر تحدي الافتراض القائل بأن عدم الاتساق بين الوسائط يكون دائماً موثوقاً للكشف عن التزوير.

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos2026-07-29
🤖 AI

From Training to Deployment: Post-Hoc Causal Feature Identification via Sensitivity Ratios

تقدم هذه الورقة نسبة الحساسية المعيارية (NSR)، وهي أداة تشخيصية لا تعتمد على نموذج محدد وتُستخدم بعد التدريب، لتحديد الميزات السببية مقابل الميزات الزائفة في النماذج المدربة من خلال الاستفادة من استقرار الحساسية عبر التحولات البيئية الهيكلية، محققةً تحديداً دقيقاً في ظل ظروف محددة ومظهرةً دقة عالية في كل من مجموعات البيانات الاصطناعية والواقعية.

Athanasios Vlontzos, Giorgos Papanastasiou, Bernhard Kainz, Sotirios Tsaftaris2026-07-29
🤖 AI

Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis

تقترح هذه الورقة استخدام أداة بتر زمني لتمكين توليد بيانات فعال وخالٍ من التسرب للبحث والاستنتاج الزمني، مما يسمح بتقطير النماذج اللغوية الكبيرة إلى قدرات تنبؤ مستقبلية فائقة دون الاعتماد على أطر عمل الوكلاء الخارجية.

Wanxu Cai, Zhengyu Chen, Huaisheng Zhu, Wei Wang, Jingang Wang, Qiang Xu2026-07-29
🤖 AI

How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model

تقيم هذه الدراسة بشكل منهجي المقايضات بين رتبة (rank) تقنية LoRA، والوحدات المستهدفة، والتكميم (quantization) على نموذج T5-small بـ 60 مليون معلمة لمهمة تحويل النص إلى SQL، حيث أثبتت أن الرتبة 16 تحقق دقة تقارب الضبط الدقيق الكامل مع حد أدنى من العبء الإضافي للمعلمات، بينما يتيح التكميم بنوعي INT8 وNF4 عمليات النشر في البيئات ذات الذاكرة المحدودة بأداء مماثل.

Mahendra Singh Rathor, Anagheem Azzam2026-07-29
💬 NLP

Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs

تقدم الورقة البحثية BeyondUncertainty، وهي طريقة لتوليد النصوص المعزز بالاسترجاع تستفيد من الثقة اللفظية من النماذج اللغوية لتوجيه الاستعلامات بشكل انتقائي إلى عملية الاسترجاع، مما يحقق دقة محسنة وتقليلاً في استخدام الرموز (tokens) مقارنة بالنماذج المرجعية التي تعتمد دائماً على الاسترجاع أو لا تعتمد عليه أبداً، وذلك رغم تحمل عبء إضافي طفيف ناتج عن فحص الثقة الأولي.

Chandan Kumar Sah, Xiaoli Lian, Li Zhang2026-07-29