💻 computer science

Test-Time Computing for Referring Multimodal Large Language Models

تقدم الورقة البحثية ControlMLLM++، وهو إطار عمل للتكيف في وقت الاختبار يتيح الاستدلال البصري القائم على المناطق بدقة عالية في النماذج اللغوية الكبيرة متعددة الوسائط المجمدة من خلال تحسين المطالبات البصرية القابلة للتعلم أثناء الاستدلال دون الحاجة إلى إعادة تدريب النموذج أو ضبطه الدقيق.

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji2026-02-24
💻 computer science

Vinedresser3D: Agentic Text-guided 3D Editing

إن Vinedresser3D هو إطار عمل وكيل يستفيد من نموذج لغوي كبير متعدد الوسائط ونموذج لتحرير الصور لتفكيك النصوص المعقدة وإجراء تحرير ثلاثي الأبعاد دقيق وخالٍ من الأقنعة مباشرة في الفضاء الكامن لنموذج توليد ثلاثي الأبعاد أصلي، مما يضمن توافقاً عالياً مع المطالبات مع الحفاظ على تماسك المناطق غير المحررة.

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg2026-02-24
🤖 AI

A Multimodal Framework for Aligning Human Linguistic Descriptions with Visual Perceptual Data

تقدم هذه الورقة إطاراً حوسبياً متعدد الوسائط يدمج المحاذاة البصرية القائمة على SIFT مع مقاييس مؤشر الجودة الشامل (Universal Quality Index) والمعالجة اللغوية المسبقة لنمذجة التفسير المرجعي البشري، مما يظهر كفاءة ودقة متفوقتين مقارنة بالبشر في تحديد الأهداف ضمن مجموعة بيانات لعبة المرجع المتكرر من ستانفورد (Stanford Repeated Reference Game).

Joseph Bingham2026-02-24
🤖 AI

Satellite-Based Detection of Looted Archaeological Sites Using Machine Learning

تقدم هذه الورقة مساراً معالجياً يعتمد على الأقمار الصناعية وقابلاً للتوسع باستخدام صور "PlanetScope" والتعلم الآلي للكشف عن المواقع الأثرية المنهوبة في أفغانستان، مما يثبت أن الشبكات العصبية التلافيفية (CNNs) المدربة مسبقاً على "ImageNet" مع استخدام القناع المكاني تتفوق بشكل كبير على التعلم الآلي التقليدي والنماذج الجيومكانية التأسيسية في تحديد بصمات النهب الموضعية.

Girmaw Abebe Tadesse, Titien Bartette, Andrew Hassanali, Allen Kim, Jonathan Chemla, Andrew Zolli, Yves Ubelmann, Caleb (…)2026-02-24
💻 computer science

Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

تقترح هذه الورقة وحدة برمجية فعالة حاسوبياً وقابلة للتشغيل المباشر تعزز قدرة نماذج الرؤية واللغة على الاستنتاج بشأن الأجسام النادرة دون الحاجة إلى ضبط دقيق، وذلك عبر الاستفادة من نماذج الرؤية التأسيسية والنصوص المعززة بالمرادفات لتنقية الرموز البصرية وحقن تلميحات مدركة للأجسام في المطالبات المدخلة.

Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding2026-02-24
🤖 AI

Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection

تقترح هذه الورقة تقنية "تضليل التمثيل عالي المستوى" (HiRM)، وهي مفهوم جديد لمحو المفاهيم يعمل على تضليل التمثيلات الدلالية عالية المستوى للمفاهيم المستهدفة بشكل انتقائي داخل الطبقات المبكرة لمشفر النصوص، وذلك بهدف كبح المحتوى الضار أو المحمي بحقوق الطبع والنشر بفعالية مع الحفاظ على الجودة التوليدية للمفاهيم غير ذات الصلة وضمان التوافق مع بنيات النماذج المتنوعة.

Uichan Lee, Jeonghyeon Kim, Sangheum Hwang2026-02-24
💻 computer science

HDR Reconstruction Boosting with Training-Free and Exposure-Consistent Diffusion

تقترح هذه الورقة طريقة قائمة على الانتشار، خالية من التدريب ومتسقة مع التعرض، تعزز تقنيات إعادة بناء النطاق الديناميكي العالي (HDR) الحالية باستخدام الملء النصي الموجه وRefinement عبر تقنية SDEdit لاستعادة التفاصيل المعقولة في المناطق شديدة التعرض مع الحفاظ على تماسك السطوع عبر الصور متعددة التعرض.

Yo-Tin Lin, Su-Kai Chen, Hou-Ning Hu, Yen-Yu Lin, Yu-Lun Liu2026-02-24
💻 computer science

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

تقدم الورقة البحثية DeepfakeJudge، وهو إطار عمل يعتمد على التمهيد (bootstrapped) يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) لتوليد وتقييم استدلال مخلص ومستند إلى الرؤية البصرية للكشف عن التزييف العميق، محققاً دقة عالية وتوافقاً مع البشر مع التفوق على نماذج مرجعية أكبر بكثير دون الحاجة إلى تسميات استدلال صريحة للحقيقة الأرضية.

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall2026-02-24
💻 computer science

Generative 6D Pose Estimation via Conditional Flow Matching

تقدم الورقة البحثية Flose، وهو أسلوب توليدي لتقدير الوضعية سداسية الأبعاد (6D pose estimation) يصيغ المهمة كنموذج مطابقة تدفق شرطي في R3\mathbb{R}^3 من خلال دمج الميزات الدلالية القائمة على المظهر مع التوجيه الهندسي لحل تناظر الكائنات بفعالية والتفوق على الأساليب الحالية في معيار BOP.

Amir Hamza, Davide Boscaini, Weihang Li, Benjamin Busam, Fabio Poiesi2026-02-24
💻 computer science

RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

تقدم هذه الورقة البحثية RAP، وهي طريقة سريعة، وتغذية أمامية، وخالية من عملية التصيير، تتنبأ بدرجات أهمية عناصر غاوس ثلاثية الأبعاد الأولية مباشرة من السمات الجوهرية والإحصاءات المحلية، متجاوزةً بذلك قيود القابلية للتوسع والتعميم التي تعاني منها النهج الحالية المعتمدة على الرؤية والتصيير.

Kaifa Yang, Qi Yang, Yiling Xu, Zhu Li2026-02-24