🤖 AI

LVLM-Aided Alignment of Task-Specific Vision Models

تقدم هذه الورقة LVLM-VA، وهي طريقة مبتكرة تسخر نموذج لغة رؤية لغوي كبير لمحاذاة نماذج رؤية صغيرة متخصصة في مهام معينة مع المعرفة البشرية في المجال عبر ترجمة سلوك النموذج إلى لغة طبيعية ورسم خرائط للمواصفات البشرية إلى انتقادات على مستوى الصورة، مما يقلل الاعتماد على الارتباطات الزائفة دون الحاجة إلى تعليقات دقيقة التفاصيل.

Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner2026-05-06
🤖 machine learning

LangPrecip: Language-Aware Multimodal Precipitation Nowcasting

تقدم الورقة البحثية LangPrecip، وهو إطار عمل متعدد الوسائط مدرك للغة يستفيد من النصوص الأرصادية كقيود حركة دلالية ضمن نموذج التدفق المصحح (Rectified Flow) لتحسين التنبؤ قصير المدى بهطول الأمطار، مدعوماً بمجموعة بيانات جديدة بمقياس 160 ألف، ويُظهر مكاسب أداء كبيرة مقارنة بأحدث الأساليب المتبعة.

Xudong Ling, Chaorong Li, Tianxi Huang, Qian Dong, Guiduo Duan2026-05-06
🤖 AI

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

تقترح الورقة البحثية إطار عمل GRACE، وهو إطار عمل مبتكر يوحد بين تقطير المعرفة والتدريب الواعي بالكمية تحت مبدأ عنق الزجاجة المعلوماتي لتمكين نماذج الرؤية واللغة من فئة INT4 عالية الأداء والفعالية، والتي تتفوق بشكل كبير على طرق الكمّنة الحالية مع مضاهاة أداء المعلم كامل الدقة تقريباً.

Yanlong Chen, Amirhossein Habibian, Luca Benini, Yawei Li2026-05-06
🤖 AI

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

يقدم VideoGPA إطار عمل ذاتي الإشراف وكفؤ في استهلاك البيانات، يقوم بتقطير الأولويات الهندسية من النماذج التأسيسية إلى إشارات تفضيل كثيفة لتوجيه نماذج الانتشار بالفيديو عبر تحسين التفضيل المباشر، مما يعزز بشكل كبير الاتساق الهيكلي ثلاثي الأبعاد، والاستقرار الزمني، وتماسك الحركة دون الحاجة إلى تعليقات توضيحية بشرية.

Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, Y (…)2026-05-06
💻 computer science

4RC: 4D Reconstruction via Conditional Querying Anytime and Anywhere

تقدم الورقة البحثية 4RC، وهو إطار عمل موحد يعمل بالتغذية الأمامية ويعتمد نموذج "التشفير لمرة واحدة، والاستعلام في أي وقت وفي أي مكان" لإعادة بناء الهندسة والحركة رباعية الأبعاد الكثيفة من فيديوهات أحادية العدسة، متفوقاً بذلك على الأساليب الحالية عبر مهام متنوعة.

Yihang Luo, Shangchen Zhou, Yushi Lan, Xingang Pan, Chen Change Loy2026-05-06
💻 computer science

IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models

تقدم الورقة البحثية IRIS، وهي طريقة مبتكرة لا تتطلب تدريباً تستفيد من بيانات تتبع حركة العين في الوقت الفعلي لحل حالات الغموض في الأسئلة والأجوبة البصرية مفتوحة النهايات، مما يحسن بشكل كبير دقة نماذج اللغة والرؤية الكبيرة في الاستعلامات الغامضة مع الحفاظ على الأداء في الاستعلامات غير الغامضة.

Parsa Madinei, Srijita Karmakar, Russell Cohen Hoffing, Felix Gervitz, Miguel P. Eckstein2026-05-06
💻 computer science

ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text

تقدم هذه الورقة البحثية ScribbleEdit، وهي مجموعة بيانات اصطناعية واسعة النطاق تجمع بين التعليمات باللغة الطبيعية والرسومات الحرة (scribbles) لتدريب وتحسين نماذج تحرير الصور متعددة الوسائط، مما يمكنها من تحقيق تحكم مكاني ودلالي دقيق تعجز النماذج الجاهزة الحالية عن بلوغه.

Anya Ji, George Ma, Téa Wright, Yiming Zhang, David M. Chan, Alane Suhr, Somayeh Sojoudi2026-05-06
🤖 AI

Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation

تقدم الورقة البحثية SCOUT، وهو محول متعدد الوسائط مدرك للسياق الدلالي يدمج الأنماط النسيجية المحلية، وسياق الشريحة الكاملة، والمفاهيم التشخيصية التي أعدها الخبراء لإنشاء تقارير باثولوجية متماسكة وذات أساس سريري، محققاً أداءً هو الأفضل في فئته عبر مجموعات بيانات متعددة.

Suryakant Singh, Saarthak Kapse, Joel Saltz, Prateek Prasanna2026-05-06
💬 NLP

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

تقدم الورقة البحثية "سلسلة الأدلة" (Chain of Evidence - CoE)، وهو إطار عمل غير مرتبط بنوع محدد من أدوات الاسترجاع، يستفيد من نماذج الرؤية واللغة لتمكين الإسناد البصري على مستوى البكسل في عملية التوليد المعزز بالاسترجاع التكراري، مما يتغلب على قيود التحليل النصي فقط عبر التفكير المباشر في لقطات الشاشة للمستندات لتوفير استشهادات دقيقة لمربعات الإحاطة والحفاظ على معلومات التخطيط البصري الأساسية.

Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye2026-05-06
🤖 AI

Active Reasoning Vision-Language Models via Sequential Experimental Design

تتناول هذه الورقة البحثية عنق الزجاجة في عرض النطاق الترددي الإدراكي لنماذج الرؤية واللغة من خلال صياغة الاستدلال البصري النشط كمسألة تصميم تجريبي أمثل بايزي متسلسل، مقترحةً استراتيجية استدلال مرنة وخالية من التدريب توازن ديناميكيًا بين التغطية المكانية والدقة لتعزيز الأداء بشكل كبير في اختبارات القياس ذات مستوى الجيجابكسل.

Anjie Liu, Ziqin Gong, Yan Song, Yuxiang Chen, Xiaolong Liu, Hengtong Lu, Kaike Zhang, Chen Wei2026-05-06