💻 computer science

Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance

تقدم هذه الورقة Molmo2Fish، وهو سير عمل تفاعلي يستفيد من نموذج لغوي كبير متعدد الوسائط لتمكين التصحيح والتتبع الموجه باللغة الطبيعية للأسماك في مجموعات بيانات السونار، مما يظهر أداءً عاليًا مع تسليط الضوء على فرص التحسين الإضافي في التكامل اللغوي.

Kai Van Brunt (Massachusetts Institute of Technology), Justin Kay (Massachusetts Institute of Technology), Sara Beery (M (…)2026-08-20✓ Author reviewed
💻 computer science

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

تقدم هذه الورقة البحثية VA-Judger، وهو نموذج مكافأة قائم على تسلسل الأفكار تم تدريبه على مجموعة بيانات تفضيلات بشرية جديدة واسعة النطاق (VAPref-10K) ومعيار مرجعي مبتكر (VA-Judger-Bench) للتغلب على قيود مقاييس الجودة المنفصلة الحالية، مما يوفر مكافآت أكثر تماسكاً وتوافقاً مع البشر تعمل على تحسين توليد الفيديو والصوت المشترك بشكل كبير من خلال التعلم التعزيزي.

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu2026-08-20
💻 computer science

CDGP: Contrastive Dual Gaussian Processes for Weakly Supervised Anomaly Segmentation

تقترح الورقة البحثية عملية "العمليات الغاوسية المزدوجة التباينية" (CDGP)، وهي إطار عمل تحت إشراف ضعيف يجمع بين إحصائية هيمنة اللاحقة المستمدة من العمليات الغاوسية المزدوجة وبين بقايا إعادة البناء الهرمية لتحقيق أفضل النتائج في تقسيم الشذوذ دون الحاجة إلى تعليقات توضيحية على مستوى البكسل.

Seungjun Chu, Seokhee Han, Mateusz Nowak, Peter Chin2026-08-20
💬 NLP

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

تكشف هذه الورقة أنه بينما ترفض النماذج اللغوية البصرية المتوافقة مع معايير السلامة الإجابة على الأسئلة المرتبطة بصرياً، فإن فهمها الإدراكي الداخلي يظل سليماً، ويمكن للتدخلات المستهدفة على مستوى التنشيط أن تقمع آليات الرفض لاستعادة الإجابة القائمة على التأسيس دون الحاجة لإعادة التدريب.

Mehak Gupta, Tanmoy Chakraborty2026-08-20
💻 computer science

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

تراجع هذه الدراسة النقدية تطبيق نماذج الرؤية واللغة في فهم الفيديو من منظور الشخص الأول، متتبعةً تطورها من التعرف التقليدي إلى الذكاء الاصطناعي المتجسد، مع تسليط الضوء على القيود الحالية في نمذجة التفاعلات طويلة المدى وتحديد الأولويات الرئيسية للأنظمة القابلة للنشر في المستقبل.

Mohammad Zamani, Fatemeh Ziaeetabar2026-08-20
💻 computer science

DocClaw: A Unified Agentic System for Intelligent Document Processing

يُعد DocClaw نظاماً وكيلياً موحداً يعيد صياغة مهام معالجة المستندات الذكية المتنوعة كعملية تفاعل تكرارية مشتركة بين وكيل ومستند، وذلك عبر الاستفادة من حالة مستند مهيكلة وأدوات قابلة لإعادة الاستخدام لتحقيق أداء تنافسي عبر معايير التعرف الضوئي على الحروف (OCR)، والأسئلة والأجوبة على المستندات (DocQA)، واستخراج المعلومات الرئيسية (KIE).

Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu2026-08-20
🤖 AI

A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

تقدم هذه الورقة أول تقييم منهجي لأربع طرق لتقدير عدم اليقين مدمجة مع نموذج تأسيسي للتجزئة الدلالية، مما يكشف عن مقايضات حرجة بين الأداء التنبؤي، والموثوقية، والتكلفة الحسابية عبر إعدادات النطاق الداخلي والنطاق الخارجي.

Steven Landgraf, Joceline Hinz, Markus Ulrich2026-08-20
🤖 AI

The Impact of CutMix on Reliability and Robustness in Semantic Segmentation

تُظهر هذه الدراسة أنه بينما يكون لتقنية CutMix تأثير ضئيل على الدقة الخام لنماذج التجزئة الدلالية، إلا أنها تعزز باستمرار موثوقيتها، ومعايرتها، وتقدير عدم اليقين لديها، لا سيما في ظل تحولات التوزيع، مما يجعلها أداة حاسمة لعمليات النشر في البيئات الحرجة التي تتطلب معايير سلامة عالية.

Steven Landgraf, Markus Ulrich2026-08-20
🤖 AI

A Few Cases Are All You Need: An Empirical Study of Annotation-Efficient LoRA Fine-Tuning of MedSAM3

تُثبت هذه الدراسة التجريبية أن تكييف نموذج MedSAM3 باستخدام تقنية التكيف منخفض الرتبة (LoRA) بالاعتماد على عشر حالات فقط من تعليقات الخبراء يحقق أداءً تنافسياً سريرياً في تقسيم الأعضاء البطنية والقلبية، مما يقلل بشكل كبير من متطلبات البيانات والوقت مقارنة بالنماذج المتخصصة التقليدية.

Sachin Dudda Nagaraju, Bendik Skarre Abrahamsen, Ashkan Moradi, Mattijs Elschot2026-08-20
💻 computer science

Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning

تقدم هذه الورقة البحثية "محاذاة مقياس القرار" كخاصية حرجة لنماذج العالم الكامنة في التحكم التنبئي بالنماذج (MPC)، وتقترح مقاييس تشخيصية لتقدير الفجوة بين ترتيب المهام في الفضاء الكامن والواقعي، وتقدم نموذج DA-LeWM، وهو نموذج مُعزز بأهداف مشروطة بالأفعال يحسن بشكل كبير من تقارب التخطيط والنجاح عبر الإنترنت مقارنة بالنهج القياسية القائمة على المسافة الإقليدية.

Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li2026-08-20