💻 computer science

Fast-SAM3D: 3Dfy Anything in Images but Faster

يُعد Fast-SAM3D إطار عمل لا يتطلب تدريباً يحقق سرعة تصل إلى 2.67 ضعفاً في إعادة البناء ثلاثي الأبعاد من الصور الفردية عبر معالجة التباين المتعدد المستويات المتأصل في خط الإنتاج من خلال ثلاث آليات مبتكرة هي: التخزين المؤقت للخطوات المدرك للنمط، والنحت الزمكاني المشترك للرموز، والتجميع الطيفي للرموز.

Weilun Feng, Mingqiang Wu, Zhiliang Chen, Chuanguang Yang, Haotong Qin, Yuqi Li, Xiaokun Liu, Guoxin Fan, Zhulin An, Lib (…)2026-02-06
🤖 machine learning

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

يكشف معيار VRIQ أن نماذج الرؤية واللغة الحالية تؤدي أداءً ضعيفًا في مهام الاستدلال البصري، ويرجع ذلك أساسًا إلى قيود الإدراك لا إلى عجز في الاستدلال، حيث تتراوح الدقة بين 28% في الألغاز التجريدية و45% في الصور الطبيعية.

Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis2026-02-06
🤖 AI

Disco: Densely-overlapping Cell Instance Segmentation via Adjacency-aware Collaborative Coloring

لمعالجة تحديات تقسيم الخلايا المتداخلة بكثافة في علم الأمراض الرقمي، قدم المؤلفون "ديسكو" (Disco)، وهو إطار عمل مدرك للتجاور يجمع بين التوسيم الطوبولوجي الصريح وفك التباس الميزات الضمني لحل صراعات الرسوم البيانية المعقدة، مدعوماً بإصدار مجموعة بيانات GBC-FS 2025 واسعة النطاق وتحليل منهجي يكشف عن انتشار الهياكل غير الثنائية في رسوم الخلايا البيانية الواقعية.

Rui Sun, Yiwen Yang, Kaiyu Guo, Chen Jiang, Dongli Xu, Zhaonan Liu, Tan Pan, Limei Han, Xue Jiang, Wu Wei, Yuan Cheng2026-02-06
💻 computer science

Multi-AD: Cross-Domain Unsupervised Anomaly Detection for Medical and Industrial Applications

تقترح الورقة البحثية Multi-AD، وهو إطار عمل للكشف عن الشذوذ غير الخاضع للإشراف عبر المجالات، يدمج كتل الضغط والإثارة (squeeze-and-excitation)، وتقطير المعرفة، وشبكة تمييز لتحقيق أداء رائد في اكتشاف الشذوذ الدقيق عبر مجموعات متنوعة من بيانات التصوير الطبي والصناعي.

Wahyu Rahmaniar, Kenji Suzuki2026-02-06
💻 computer science

Stable Velocity: A Variance Perspective on Flow Matching

تقترح هذه الورقة البحثية "السرعة المستقرة" (Stable Velocity)، وهو إطار عمل موحد يخفف من تباين أهداف التدريب المرتفع المتأصل في مطابقة التدفق عبر إدخال أهداف مخفضة التباين وإشراف تكيفي للتدريب، إلى جانب تسريع أخذ العينات بصيغة مغلقة للاستدلال، مما يحسن بشكل كبير كلاً من كفاءة التدريب وسرعة أخذ العينات دون المساس بجودة العينات.

Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao2026-02-06
🤖 AI

Attention Retention for Continual Learning with Vision Transformers

تقترح هذه الورقة إطار عمل جديداً للحفاظ على الانتباه في التعلم المستمر لنماذج "محولات الرؤية" (Vision Transformers)، والذي يخفف من حدة النسيان الكارثي عبر تحديد انحراف الانتباه وتطبيق قناع تدرج متكيف مع الحالة للحفاظ على المفاهيم البصرية المتعلمة سابقاً، محققاً أداءً هو الأفضل في فئته عبر سيناريوهات متنوعة.

Yue Lu, Xiangyu Zhou, Shizhou Zhang, Yinghui Xing, Guoqiang Liang, Wencong Zhang2026-02-06
💻 computer science

VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency

يُعد نظام VGGT-Motion نظاماً للملاحة ورسم الخرائط المتزامن أحادي العدسة (monocular SLAM) خالياً من المعايرة، ويحقق اتساقاً عالمياً قوياً بعيد المدى عبر دمج بناء الخرائط الفرعية المدركة للحركة، والتسجيل الكثيف القائم على الارتكاز بنموذج Sim(3)، وتحسين مخطط الرسم البيكي للوضعية خفيف الوزن للتغلب على انزياح المقياس والاختناقات الحسابية.

Zhuang Xiong, Chen Zhang, Qingshan Xu, Wenbing Tao2026-02-06
💻 computer science

VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator

تقدم هذه الورقة VLN-Pilot، وهو إطار عمل مبتكر يستفيد من النماذج اللغوية البصرية الكبيرة لتمكين الملاحة الذاتية للطائرات بدون طيار في الأماكن المغلقة من خلال تفسير التعليمات باللغة الطبيعية والاستدلال حول البيئات المرئية لمهام الطيران المعقدة والواعية بالسياق.

Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla2026-02-06
💻 computer science

IndustryShapes: An RGB-D Benchmark dataset for 6D object pose estimation of industrial assembly components and tools

تقدم هذه الورقة IndustryShapes، وهو مجموعة بيانات مرجعية جديدة من نوع RGB-D تتميز بأدوات ومكونات صناعية تم التقاطها في بيئات تجميع واقعية لسد الفجوة بين الأبحاث المختبرية والنشر في العالم الحقيقي لكل من تقدير الوضعية سداسية الأبعاد على مستوى المثيل والوضعيات للأجسام الجديدة.

Panagiotis Sapoutzoglou, Orestis Vaggelis, Athina Zacharia, Evangelos Sartinas, Maria Pateraki2026-02-06
💻 computer science

ShapeGaussian: High-Fidelity 4D Human Reconstruction in Monocular Videos via Vision Priors

تُعد ShapeGaussian طريقة خالية من القوالب لإعادة بناء البشر رباعي الأبعاد عالي الدقة من فيديوهات أحادية العدسة، حيث تستفيد من المعارف الرؤيوية المسبقة المدربة مسبقاً ومسار تنقيح يتكون من خطوتين للتغلب على قيود كل من النهج العام الخالي من تعدد المشاهد والأساليب القائمة على القوالب المعرضة للخطأ.

Zhenxiao Liang, Ning Zhang, Youbao Tang, Ruei-Sung Lin, Qixing Huang, Peng Chang, Jing Xiao2026-02-06