💻 computer science

Temporal Slowness in Central Vision Drives Semantic Object Learning

تُظهر هذه الدراسة أن محاكاة التجربة البصرية الشبيهة بالبشر عبر الجمع بين الرؤية المركزية والتعلم القائم على البطء الزمني تعزز بشكل كبير تكوين التمثيلات الدلالية للأجسام، مما يكشف كيف يساعد التركيز على المعلومات المتغيرة ببطء والمتمحورة حول نظرة العين في استخراج سمات المقدمة والدلالات الأوسع للأجسام.

Timothy Schaumlöffel, Arthur Aubret, Gemma Roig, Jochen Triesch2026-03-25
💻 computer science

SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

يُعد SurgMotion نموذجاً تأسيسياً يعتمد على الفيديو، حيث يستفيد من التنبؤ بالحركة الكامنة وقاعدة بيانات ضخمة تبلغ 15 مليون ساعة للتغلب على قيود إعادة البناء على مستوى البكسل، محققاً أداءً هو الأفضل في فئته عبر مهام متنوعة لفهم الفيديو الجراحي بما في ذلك التعرف على سير العمل، وكشف الإجراءات، وتقييم المهارات.

Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M (…)2026-03-25
🤖 machine learning

Refine Now, Query Fast: A Decoupled Refinement Paradigm for Implicit Neural Fields

تقدم هذه الورقة نموذج "تحسين التمثيل المنفصل" (DRR)، الذي يحل معضلة المقايضة بين الدقة والسرعة في التمثيلات العصبية الضمنية من خلال استخدام عملية غير متصلة بالإنترنت لترميز الحقول المعقدة في تضمينات مدمجة، مما يمكّن شبكة خفيفة الوزن من تحقيق دقة تضاهي أفضل النتائج الحالية مع سرعات استدلال تصل إلى 27 ضعفاً مقارنة بالنماذج المرجعية عالية الدقة.

Tianyu Xiong, Skylar Wurster, Han-Wei Shen2026-03-25
💻 computer science

CAD-Prompted SAM3: Geometry-Conditioned Instance Segmentation for Industrial Objects

تقترح هذه الورقة البحثية إطار عمل CAD-Prompted SAM3، وهو إطار لتقسيم المثيلات مشروط بالهندسة يستفيد من عمليات رندر نماذج CAD متعددة الزوايا كـ "محفزات" للتغلب على قيود الطرق القائمة على اللغة والمظهر في البيئات الصناعية حيث تختلف الأجسام في المادة واللمسات النهائية ولكنها تشترك في هندسة معيارية.

Zhenran Tang, Rohan Nagabhirava, Changliu Liu2026-03-25
💬 NLP

Efficient and High-Fidelity Omni Modality Retrieval

تقدم الورقة البحثية OmniRet، وهو أول نموذج استرجاع قادر على التعامل مع الاستعلامات المعقدة عبر الوسائط النصية والبصرية والسمعية، والذي يحقق أداءً عالي الدقة وفعالاً من خلال آليات إعادة أخذ العينات القائمة على الانتباه وآليات تجميع "واسرشتاين" المقطعة بالانتباه (Attention Sliced Wasserstein Pooling) المبتكرة، مع إنشاء معيار مرجعي جديد متمحور حول الصوت متعدد الوسائط لتقييم القدرات الشاملة للوسائط.

Chuong Huynh, Manh Luong, Abhinav Shrivastava2026-03-25
💻 computer science

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

تحلل هذه الورقة أكثر من 1.8 مليون نموذج لتكشف أن تعدد الوسائط في عائلات النماذج اللغوية الكبيرة المفتوحة ينبثق من خلال "أحداث مؤسِّسة" نادرة بدلاً من الانتقال التدريجي عبر الوسائط، ليتوسع لاحقاً وبسرعة ضمن سلالات محددة من الأحفاد لخلق نمط تبنٍّ متقطع يهيمن عليه مهام الصور والنصوص.

Manuel Cebrian2026-03-25
🧬 biology

Ca2+ transient detection and segmentation with the Astronomically motivated algorithm for Background Estimation And Transient Segmentation (Astro-BEATS)

تقدم الورقة البحثية Astro-BEATS، وهو خوارزمية مقتبسة من طرق الكشف عن الظواهر الفلكية العابرة تتفوق على النهج الحالية القائمة على العتبات في التجزئة التلقائية لتدفقات الكالسيوم المشبكية المصغرة واللطيفة في المجهر الفلوري، مما يسهل إنشاء مجموعات بيانات تدريب لنماذج التعلم العميق.

Bolin Fan, Anthony Bilodeau, Frederic Beaupre, Theresa Wiesner, Christian Gagne, Flavie Lavoie-Cardinal, Renee Hlozek2026-03-25
💻 computer science

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

تقدم هذه الورقة مجموعة بيانات "من الدليل إلى التنفيذ" (M2AD)، التي تربط فيديوهات تجميع الأثاث مع أدلة التعليمات، لتقييم قدرات وحدود النماذج اللغوية الكبيرة متعددة الوسائط الحالية في تقديم المساعدة متعددة الوسائط في الوقت الفعلي للمهام الإجرائية.

Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman2026-03-25
💻 computer science

Efficient Universal Perception Encoder

تقدم الورقة البحثية مشفر الإدراك العالمي الفعال (EUPE)، وهو نموذج رؤية مدمج للأجهزة الطرفية يحقق تمثيلات متعددة الاستخدامات وعالية الأداء عبر مهام متنوعة من خلال استخلاص المعرفة من معلم وسيط ضخم، يتم إنشاؤه عن طريق تجميع نماذج تأسيسية متعددة خبيرة في مجالاتها، بدلاً من تقليص حجمها مباشرة منها.

Chenchen Zhu, Saksham Suri, Cijo Jose, Maxime Oquab, Marc Szafraniec, Wei Wen, Yunyang Xiong, Patrick Labatut, Piotr Boj (…)2026-03-25
💻 computer science

Learning Sidewalk Autopilot from Multi-Scale Imitation with Corrective Behavior Expansion

تقترح هذه الورقة إطار عمل قوي للتحكم في التنقل الدقيق على الأرصفة، يعزز التعلم بالتقليد من خلال تدعيم مجموعات بيانات التشغيل عن بُعد بسلوكيات تصحيحية واستخدام بنية متعددة المقاييس للتعافي بفعالية من الأخطاء والتعميم عبر البيئات الحضرية المعقدة.

Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou2026-03-25