💻 computer science

GeoSANE: Learning Geospatial Representations from Models, Not Data

تُعد GeoSANE مسبكاً للنماذج الجيومكانية يوحد المعرفة من نماذج التأسيس المتنوعة للاستشعار عن بُعد عبر تعلم توليد أوزان الشبكات العصبية الخاصة بمهام محددة عند الطلب، متفوقاً باستمرار على النماذج المدربة من الصفر أو عبر التقطير التقليدي مع تمكين تعميم قوي عبر مختلف الأنماط والبيانات.

Joelle Hanna, Damian Falk, Stella X. Yu, Damian Borth2026-03-25
💻 computer science

SIGMA: A Physics-Based Benchmark for Gas Chimney Understanding in Seismic Images

تقدم هذه الورقة SIGMA، وهي مجموعة بيانات مرجعية جديدة قائمة على الفيزياء تتميز بأقنعة على مستوى البكسل وبيانات صور مزدوجة لمعالجة تحديات اكتشاف وتعزيز شذوذات المداخن الغازية في الصور السيزمية من أجل تحسين استكشاف الهيدروكربونات وتجنب المخاطر.

Bao Truong, Quang Nguyen, Baoru Huang, Jinpei Han, Van Nguyen, Ngan Le, Minh-Tan Pham, Doan Huy Hien, Anh Nguyen2026-03-25
🤖 AI

3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding

تقدم هذه الورقة البحثية 3DCity-LLM، وهو إطار عمل موحد يتميز باستراتيجية ترميز ميزات من الخشن إلى الناعم ومجموعة بيانات جديدة تضم 1.2 مليون عينة، مما يعزز بشكل كبير قدرات نماذج اللغات الكبيرة متعددة الوسائط في الإدراك والفهم على نطاق المدن ثلاثية الأبعاد من خلال التفوق على الأساليب الحالية الرائدة.

Yiping Chen, Jinpeng Li, Wenyu Ke, Yang Luo, Jie Ouyang, Zhongjie He, Li Liu, Hongchao Fan, Hao Wu2026-03-25
💻 computer science

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

تقترح الورقة البحثية DetPO، وهي طريقة تحسين وقت الاختبار تعتمد على الصندوق الأسود وخالية من التدرج، تعمل على صقل المطالبات النصية فقط لتحسين أداء اكتشاف الأشياء بأسلوب التعلم من أمثلة قليلة في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير، وذلك عبر الاستفادة من الأمثلة التدريبية المرئية للتغلب على قيود التعميم.

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan2026-03-25
💻 computer science

RealMaster: Lifting Rendered Scenes into Photorealistic Video

تُعد RealMaster طريقة مبتكرة تسخر نماذج انتشار الفيديو وIC-LoRA لتحويل مخرجات محركات الثلاثية الأبعاد المُصيرة إلى فيديوهات واقعية للغاية مع الحفاظ بدقة على هندسة المشهد الأصلي، وديناميكياته، واتساقه ثلاثي الأبعاد.

Dana Cohen-Bar, Ido Sobol, Raphael Bensadoun, Shelly Sheynin, Oran Gafni, Or Patashnik, Daniel Cohen-Or, Amit Zohar2026-03-25
🤖 AI

InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

تُعد InverFill طريقة عكوسية أحادية الخطوة تقوم بحقن المعلومات الدلالية من الصور المحجوبة في الضجيج الأولي لنماذج الانتشار متعددة الخطوات، مما يتيح عملية ترميم صور (inpainting) عالية الدقة وخالية من العيوب دون الحاجة إلى إعادة تدريب النموذج أو إشراف من صور حقيقية.

Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran2026-03-25
💻 computer science

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

يُعد UniFunc3D إطار عمل موحداً لا يتطلب تدريباً، يستفيد من نموذج لغوي كبير متعدد الوسائط كراصد نشط للقيام بالاستدلال المكاني-الزماني المشترك والاختيار التدريجي للإطر من المستوى العام إلى الدقيق، محققاً أداءً رائدًا في تقسيم الوظائف ثلاثية الأبعاد دون الحاجة إلى تدريب خاص بالمهمة.

Jiaying Lin, Dan Xu2026-03-25
💬 NLP

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

تُعد SpecEyes إطار عمل للتسريع التخميني بمستوى وكيل، يستخدم نموذجاً خفيف الوزن كمخطط تخميني مع آلية بوابات معرفية وقمع متوازي غير متجانس لتقليل زمن الاستجابة بشكل كبير وتحسين إنتاجية النماذج اللغوية الكبيرة متعددة الوسائط مع الحفاظ على الدقة أو تعزيزها.

Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo2026-03-25
💻 computer science

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

تقترح الورقة البحثية إطار عمل TETO، وهو إطار عمل قائم على نموذج المعلم والطالب يحقق أداءً هو الأفضل في مجاله لتقدير الحركة القائم على الأحداث واستكمال الإطارات باستخدام حوالي 25 دقيقة فقط من البيانات الواقعية غير الموسومة عبر استخلاص المعرفة من متتبع صور RGB مُدرب مسبقاً والاستفادة من أولويات الحركة الناتجة لتهيئة محول انتشار الفيديو.

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim2026-03-25
💻 computer science

One View Is Enough! Monocular Training for In-the-Wild Novel View Generation

تقدم الورقة البحثية OVIE، وهو إطار عمل تدريب أحادي العدسة مبتكر يقوم بتخليق مناظر جديدة من صور إنترنت غير مقترنة عبر الاستفادة من سقالة هندسية قائمة على العمق مع خسائر مقنعة أثناء التدريب، مما ينتج نموذج استدلال خالٍ من الهندسة يحقق أداءً رائدًا في مستوى الصفر (zero-shot) بسرعة أكبر بكثير.

Adrien Ramanana Rahary, Nicolas Dufour, Patrick Perez, David Picard2026-03-25