💬 NLP

See the Text: From Tokenization to Visual Reading

تقدم الورقة البحثية SeeTok، وهو نهج متمحور حول الرؤية يقوم بتصوير النصوص كصور لتقوم النماذج اللغوية الكبيرة متعددة الوسائط بتفسيرها، مما يستبدل بفعالية عملية تقسيم الكلمات إلى وحدات فرعية (subword tokenization) لتحقيق كفاءة حوسبية كبيرة، وتحسين المتانة تجاه الضجيج الطباعي، وتحقيق تعميم أفضل عبر اللغات من خلال محاكاة القراءة البصرية البشرية.

Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang2026-03-27
🤖 AI

Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation

يُعد Ming-Flash-Omni نموذج "خليط من الخبراء" (Mixture-of-Experts) متفرقاً وعالي الكفاءة، يضم 100 مليار معلمة، ويوحد قدرات الإدراك والتوليد متعددة الوسائط المتقدمة عبر الرؤية والكلام واللغة، محققاً أداءً يضاهي نموذج Gemini 2.5 Pro، وممثلاً خطوة كبيرة نحو الذكاء الاصطنا_الاصطناعي العام.

Inclusion AI, :, Bowen Ma, Cheng Zou, ChengKun Du, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Chenyu Lian, Chengxiang F (…)2026-03-27
💬 NLP

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

تقدم هذه الورقة AoT-PsyPhyBENCH، وهو معيار تم التحقق من صحته نفسيًا وجسديًا يوضح أن نماذج الرؤية واللغة الحالية تعاني في تحديد سهم الزمن في الفيديوهات الطبيعية، مما يكشف عن فجوة جوهرية في قدراتها على الاستدلال الزمني والسببي مقارنة بالبشر.

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa2026-03-27
💻 computer science

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

تقدم هذه الورقة تقنية تقسيم الآفات الموجهة بالتعليمات (ILS) لصور الأشعة السينية للصدر، مقدمةً مجموعة بيانات MIMIC-ILS الضخمة والمولدة تلقائياً ونموذج ROSALIA لتمكين التقسيم الدقيق وسهل الاستخدام وشرح الآفات المتنوعة عبر تعليمات نصية بسيطة.

Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi2026-03-27
💻 computer science

DiP: Taming Diffusion Models in Pixel Space

يُعد DiP إطار عمل انتشار في فضاء البكسل يتسم بالكفاءة، حيث يحل المقايضة بين جودة التوليد والتكلفة الحسابية من خلال فصل تركيب الهيكل العالمي عن تركيب التفاصيل المحلية إلى عملية مكونة من مرحلتين، محققاً أداءً في ImageNet 256×256 مماثلاً لنماذج الانتشار الكامن مع سرعة استنتاج تزيد بمقدار 10 أضعاف مع حد أدنى من العبء الإضافي للمعلمات.

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai2026-03-27
💻 computer science

MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation

تقدم هذه الورقة MultiBanana، وهو معيار مفتوح شامل مصمم لتقييم وتطوير نماذج توليد الصور من النصوص متعددة المراجع من خلال تقييم قدراتها عبر تحديات متنوعة مثل تباين أعداد المراجع، وعدم تطابق النطاق والمجال، والمفاهيم النادرة، والمدخلات متعددة اللغات.

Yuta Oshima, Daiki Miyake, Kohsei Matsutani, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta2026-03-27
💻 computer science

Inferring Compositional 4D Scenes without Ever Seeing One

تقترح الورقة البحثية COM4D، وهي طريقة مبتكرة تعيد بناء مشاهد رباعية الأبعاد متسقة تحتوي على أجسام متعددة متفاعلة من فيديوهات أحادية العدسة، وذلك عبر فصل التركيب المكاني والديناميكيات الزمنية المتعلمة بشكل مستقل ثم دمجهما لاحقاً، مما يلغي الحاجة إلى بيانات تدريب تركيبية رباعية الأبعاد.

Ahmet Berke Gokmen, Ajad Chhatkuli, Luc Van Gool, Danda Pani Paudel2026-03-27
💻 computer science

Unified Camera Positional Encoding for Controlled Video Generation

تقدم هذه الورقة البحثية UCPE (ترميز موضع الكاميرا الموحد)، وهو تمثيل متسق هندسيًا يوحد أوضاع الكاميرا، والخصائص الداخلية، وتشويهات العدسة عبر ترميزات التوجيه النسبية والمطلقة، مما يتيح قدرة تحكم في الكاميرا هي الأحدث من نوعها في توليد الفيديو مع حد أدنى من العبء الإضافي للمعلمات.

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai2026-03-27
💻 computer science

MoLingo: Motion-Language Alignment for Text-to-Motion Generation

يقدم MoLingo نموذجاً متطوراً لتوليد الحركة من النص يحقق حركة بشرية واقعية ومتوافقة دلالياً عبر استخدام مشفر مدرب نصياً على مستوى الإطار لإنشاء مساحات كامنة صديقة للانتشار، وتوليد ذاتي الانحدار، وتكييف عبر الانتباه المتقاطع متعدد الرموز.

Yannan He, Garvita Tiwari, Xiaohan Zhang, Pankaj Bora, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll2026-03-27
💬 NLP

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

تقدم هذه الورقة TimeLens، وهو إطار عمل منهجي لتوطين الزمن في الفيديو، والذي يؤسس لمعيار عالي الجودة ومجموعة بيانات تدريبية (TimeLens-Bench وTimeLens-100K) مع اقتراح تصميمات خوارزمية فعالة مثل الترميز النصي المتداخل والتعلم المعزز من خلال التغذية الراجعة لتقليل استهلاك الموارد (RLVR) الخالي من التفكير لتحقيق أداء رائد بين النماذج اللغوية الكبيرة متعددة الوسائط مفتوحة المصدر.

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang2026-03-27