💻 computer science

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

تُعد "الفرض المركّز" (Focused Forcing) طريقةً لا تتطلب تدريباً لعمليات الانتشار بالفيديو ذات التوليد الذاتي الفعال، حيث تعمل على تحسين الجودة البصرية وتحقيق تسارع يصل إلى 1.48 ضعفاً من خلال الاختيار الديناميكي لإطارات تاريخية متميزة وتخصيص ميزانيات ذاكرة التخزين المؤقت (KV cache) بناءً على أهمية كل إطار وأهمية كل رأس.

Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui (…)2026-05-19
💻 computer science

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

تُعد RAVE آلية خفيفة الوزن ومتوافقة مع التدريب، تعمل على إعادة تخصيص الانتباه البصري في النماذج متعددة الوسائط الضخمة من خلال إدخال انحياز استعلام-مفتاح مُتعلم، مما يحسن الأداء بشكل كبير في المهام كثيفة الإدراك مثل التعرف الضوئي على الحروف (OCR) وفهم المخططات دون الحاجة إلى تغييرات هيكلية.

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang2026-05-19
💻 computer science

Vision Foundation Models as Generalist Tokenizers for Image Generation

تقدم هذه الورقة VFMTok، وهو مُجزئ صور عام مبني على نماذج رؤية تأسيسية مجمدة يستفيد من التكميم المتكيف مع المناطق وإعادة البناء الدلالي لتحقيق جودة توليد وكفاءة تبلغ أحدث ما توصل إليه العلم مع إلغاء الحاجة إلى التوجيه الخالي من التصنيف.

Anlin Zheng, Qi Han, Xin Wen, Chuofan Ma, Lanxi Gong, Gang Yu, Xiangyu Zhang, Xiaojuan Qi2026-05-19
💻 computer science

Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models

تقدم هذه الورقة البحثية "تصدعات في الأساس" (CiF)، وهي مجموعة بيانات للبنية التحتية المدنية واسعة النطاق تضم حوالي 150,000 صورة عالية الدقة، لتوضيح أن نماذج الرؤية التأسيسية الحالية وخوارزميات التجزئة المتخصصة تعاني بشكل كبير في الكشف عن العيوب في العالم الحقيقي، مما يكشف عن قيود جوهرية في تطبيق الذكاء الاصطناعي المدرب على شبكة الإنترنت على البيئة العمرانية.

Nicola Farronato, Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Rizwan Ullah Khan, Michele Magno, Konrad Schindler, Cri (…)2026-05-19
💻 computer science

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

تقدم هذه الورقة البحثية GAUC، وهي طريقة لاختيار النواة الأساسية (coreset) خالية من التدريب، تستفيد من التباين الأقصى بين المتوسطات (Maximum Mean Discrepancy)، والمعلومات المتبادلة الفعالة، والتباين التنبؤي لتعزيز الدقة، والمعايرة، ومتانة التلقين في نماذج الرؤية واللغة في مجال علم الأمراض النسجي دون الحاجة إلى تحديثات للمعلمات.

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz2026-05-19
💻 computer science

TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

تقترح الورقة البحثية TIGER-FG، وهو إطار عمل ضمني للتوجيه الدقيق الموجه بالنصوص يستفيد من نص العنصر لتوليد تمثيلات تركز على الهدف دون الحاجة إلى كشف الكائنات، مما يحسن بشكل كبير أداء استرجاع الصور متعدد الوسائط في التجارة الإلكترونية على معيار مرجعي واقعي تم إنشاؤه حديثاً.

Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou2026-05-19
💬 NLP

What is Holding Back Latent Visual Reasoning?

تكشف هذه الورقة أن نماذج الاستدلال البصري الكامنة الحالية تفشل في استخدام الرموز البصرية الوسيطة لأن مجموعات البيانات الحالية لا توفر معلومات كافية لجعلها ضرورية، كما أن التنبؤات أثناء الاستدلال غير دقيقة، مما يشير إلى أن التقدم المستقبلي يتطلب كلاً من مجموعات بيانات أكثر إفادة وتوليدًا أفضل للرموز.

André G. Viveiros, Nuno Gonçalves, André F. T. Martins, Matthias Lindemann2026-05-19
💻 computer science

Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis

تقترح الورقة البحثية "Code-as-Room"، وهو إطار عمل وكيل يعتمد على النماذج اللغوية الكبيرة متعددة الوسائط (MLLM)، يقوم بتوليد غرف داخلية ثلاثية الأبعاد واقعية من صور علوية عبر تخليق كود "Blender" قابل للتنفيذ من خلال مسار متعدد المراحل ومنظم مع ذاكرة عابرة للمراحل للتغلب على قيود الدقة المكانية والاستقرار التي تعاني منها الطرق الحالية.

Yixuan Yang, Zhen Luo, Wanshui Gan, Jinkun Hao, Junru Lu, Jinghao Yan, Zhaoyang Lyu, Xudong Xu2026-05-19
💻 computer science

PERL: Parameter Efficient Reasoning in CLIP Latent Space

تقدم الورقة البحثية PERL، وهو إطار عمل للتكيف خفيف الوزن يعزز أداء نماذج CLIP المجمدة في التعلم من أمثلة قليلة عبر معايم قياسية متنوعة من خلال تحسين التمثيلات الكامنة بشكل تكراري عبر وحدة استدلال مدمجة، محققاً كفاءة فائقة في عدد المعلمات مقارنة بالطرق الحالية.

Simone Carnemolla, Salvatore Calcagno, Daniela Giordano, Concetto Spampinato, Matteo Pennisi2026-05-19
💻 computer science

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

تقدم هذه الورقة البحثية InstructAV2AV، وهو أول إطار عمل متكامل (end-to-end) للتحرير المشترك للصوت والفيديو الموجه بالتعليمات، والذي يستفيد من مجموعة بيانات ضخمة تم إنشاؤها حديثاً (InsAVE-80K) واستراتيجية تدريب متخصصة مكونة من مرحلتين للتفوق على الأساليب الحالية في إنشاء محتوى مُحرر عالي الجودة ومتزامن.

Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi2026-05-19