💻 computer science

Delving into Spectral Clustering with Vision-Language Representations

تقترح هذه الورقة البحثية "التجميع الطيفي لنواة التماس العصبي" (Neural Tangent Kernel Spectral Clustering)، وهو نهج متعدد الوسائط يستفيد من نماذج الرؤية واللغة مسبقة التدريب ومن عملية تثبيت الأسماء الإيجابية لبناء مصفوفات تقارب محسنة، محققاً أداءً هو الأفضل في فئته عبر 16 معياراً متنوعاً من خلال تضخيم الروابط داخل العنقود بفعالية مع كبح الضجيج بين العناقيد.

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang2026-03-17
🤖 AI

Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training

تقدم هذه الورقة نظرية تمييز التوزيع (DDT) لتمكين الضبط الدقيق الخاضع للإشراف أثناء السياسة (On-Policy)، مقترحةً تقنيتي "الضبط الدقيق داخل التوزيع" و"فك التشفير الملمّح" اللتين تحققان أداء تعميم يتجاوز خوارزميات التعلم المعزز غير المتصل بالسياسة مثل DPO وSimPO، مع الاحتفاظ بالكفاءة الحسابية للضبط الدقيق الخاضع للإشراف (SFT).

Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baini (…)2026-03-17
🤖 machine learning

Flow-Factory: A Unified Framework for Reinforcement Learning in Flow-Matching Models

يُعد Flow-Factory إطار عمل موحداً ونموذجيًا يعمل على تبسيط وتسريع التعلم التعزيزي لنماذج مطابقة التدفق (flow-matching) والنماذج الانتشارية (diffusion models) من خلال فصل الخوارزميات، والبنيات، والمكافآت لتمكين النمذجة الأولية السريعة والتدريب القابل للتوسع والجاهز للإنتاج عبر نماذج متنوعة.

Bowen Ping, Chengyou Jia, Minnan Luo, Hangwei Qian, Ivor Tsang2026-03-17
💻 computer science

IRIS-SLAM: Unified Geo-Instance Representations for Robust Semantic Localization and Mapping

يُعد IRIS-SLAM نظاماً جديداً للتحديد والتموضع ورسم الخرائط المتزامن (SLAM) القائم على الرؤية اللونية (RGB) والدلالات، حيث يستفيد من تمثيلات هندسية-مثالية موحدة مستمدة من نموذج تأسيسي موسع لتحقيق تحديد مواقع دلالي قوي ورسم خرائط بمتانة محسنة واتساق في الخرائط وموثوقية عالية في إغلاق الحلقة واسع النطاق.

Tingyang Xiao, Liu Liu, Wei Feng, Zhengyu Zou, Xiaolin Zhou, Wei Sui, Hao Li, Dingwen Zhang, Zhizhong Su2026-03-17
🤖 AI

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

تقترح هذه الورقة البحثية إطار عمل LESA، وهو متنبئ قابل للتعلم يعتمد على الوعي بالمراحل ويستخدم شبكات كولموغوروف-أرنولدولد وهيكلية متعددة المراحل ومتعددة الخبراء لتسريع نماذج "ديفيوجن ترانسفورمرز" (Diffusion Transformers) بشكل كبير مع الحفاظ على جودة التوليد أو تحسينها عبر مختلف نماذج تحويل النص إلى صورة والنص إلى فيديو.

Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang2026-03-17
💻 computer science

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

يُعد MemRoPE إطار عمل لا يتطلب تدريباً يتيح توليد فيديوهات لانهائية وعالية الدقة من خلال تقديم رموز ذاكرة متطورة لضغط السياق الديناميكي وفهرسة RoPE عبر الإنترنت لحل الصراعات الموضعية، مما يتغلب بذلك على انزياح الهوية وركود الحركة المتأصلين في أساليب الانتشار ذاتية الانحدار الحالية.

Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel2026-03-17
💻 computer science

Addressing Data Scarcity in 3D Trauma Detection through Self-Supervised and Semi-Supervised Learning with Vertex Relative Position Encoding

تقترح هذه الورقة إطار عمل كفؤاً في استهلاك الملصقات يجمع بين التعلم المسبق ذاتي الإشراف على 1,206 حجماً من صور الأشعة المقطعية للبطن غير المصنفة وبين التعلم شبه الإشرافي لتحسين أداء الكشف والتصنيف ثلاثي الأبعاد لإصابات الحوادث بشكل كبير رغم الندرة الشديدة في البيانات.

Shivam Chaudhary, Sheethal Bhat, Andreas Maier2026-03-17
💻 computer science

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

تقدم هذه الورقة البحثية EgoPointVQA، وهي مجموعة بيانات ومعيار جديد للإجابة على الأسئلة من منظور الشخص الأول القائمة على الإيماءات، إلى جانب طريقة رموز نية اليد (HINT) التي تستفيد من النقاط المفتاحية ثلاثية الأبعاد لليد لتحسين قدرة النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير على استنتاج نية التأشير من فيديوهات منظور الشخص الأول.

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou2026-03-17
💻 computer science

Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA

تُظهر هذه الدراسة المنضبطة ضمن إطار عمل LLaVA أن الإخفاقات المستمرة في الاستدلال المكاني في نماذج الرؤية واللغة مرتبطة جوهرياً بالخيارات الهيكلية مثل المشفرات من طراز CLIP والترميز أحادي البعد، بدلاً من كونها مجرد نقص في البيانات، رغم أن تعديل هذه المكونات لا يخفف المشكلة إلا جزئياً.

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Ki (…)2026-03-17
💻 computer science

AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation

تُعد AccelAes إطار عمل لا يتطلب تدريباً يعمل على تسريع نماذج محولات الانتشار (Diffusion Transformers) وتعزيز الجماليات الإدراكية عبر الاستفادة من إشارات الانتباه المستمدة من الأوامر النصية لتقليل الحسابات المكانية والزمانية الزائدة ديناميكياً أثناء توليد الصور.

Xuanhua Yin, Chuanzhi Xu, Haoxian Zhou, Boyu Wei, Weidong Cai2026-03-17