💻 computer science

Improving Visual Object Tracking through Visual Prompting

تقترح الورقة البحثية PiVOT، وهي آلية توجيه بصري تستفيد من نموذج تأسيسي مدرب مسبقًا من نوع CLIP لإنشاء وتحسين التوجيهات البصرية عبر الإنترنت تلقائيًا، مما يعزز تتبع الكائنات العام من خلال كبح المشتتات بفعالية عبر التوجيه التبايني.

Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin2026-03-10
💻 computer science

ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance

يُعد ExpGest إطار عمل جديداً قائماً على الانتشار، يقوم بتوليد إيماءات جسدية كاملة تعبيرية وقابلة للتحكم من خلال الاستفادة من التوجيه المتزامن للصوت والنص، جنباً إلى جنب مع مصنف ضوضاء متخصص للمشاعر، للتغلب على قيود الطرق الحالية التي غالباً ما تنتج حركات صلبة تقتصر على الجزء العلوي من الجسم.

Yongkang Cheng, Mingjiang Liang, Shaoli Huang, Gaoge Han, Jifeng Ning, Wei Liu2026-03-10
💻 computer science

Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation Applications

يُعد Prithvi-EO-2.0 نموذجاً تأسيسياً مفتوح المصدر للمعلومات الجيومكانية متعدد الفترات الزمنية، تم تدريبه على 4.2 مليون عينة من السلاسل الزمنية العالمية، وهو يتفوق بشكل كبير على سلفه والنماذج الحالية الأخرى عبر مختلف مهام مراقبة الأرض، من الاستجابة للكوارث إلى مراقبة النظم البيئية، وذلك من خلال دمج تضمينات الموقع والزمن ومنهج تطوير العلوم المفتوحة الموثوقة.

Daniela Szwarcman, Sujit Roy, Paolo Fraccaro, {\TH}orsteinn Elí Gíslason, Benedikt Blumenstiel, Rinki Ghosal, Pedro Henr (…)2026-03-10
🤖 machine learning

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

تقترح هذه الورقة طريقة تستفيد من نماذج الرؤية واللغة سابقة التدريب لتعلم نماذج عالم رمزية، مدمجة ومجردة، من عروض بصرية محدودة، مما يتيح التعميم الصفري والتخطيط طويل المدى لمهام روبوتية معقدة عبر أجسام وبيئات وأهداف جديدة.

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling2026-03-10
💻 computer science

Prompt-SID: Learning Structural Representation Prompt via Latent Diffusion for Single-Image Denoising

يُعد Prompt-SID إطار عمل لتقليل الضوضاء في الصور الفردية يعتمد على التعلم الذاتي، وهو يستفيد من مولد تمثيل هيكلي قائم على الانتشار الكامن وآلية تدريب إعادة تشغيل المقياس للحفاظ على المعلومات الهيكلية التفصيلية دون الاعتماد على مجموعات بيانات مقترنة مكلفة.

Huaqiu Li, Wang Zhang, Xiaowan Hu, Tao Jiang, Zikang Chen, Haoqian Wang2026-03-10
🤖 machine learning

LaVCa: LLM-assisted Visual Cortex Captioning

تقترح الورقة البحثية LaVCa، وهو نهج جديد قائم على البيانات يستفيد من النماذج اللغوية الكبيرة لتوليد أوصاف باللغة الطبيعية للصور، مما يوفر تفسيرات أكثر دقة وتفصيلاً لانتقائية الفوكسل في القشرة البصرية البشرية ويكشف عن تمايز وظيفي دقيق داخل القشرة البصرية مقارنة بالطرق الحالية القائمة على الشبكات العصبية العميقة.

Takuya Matsuyama, Shinji Nishimoto, Yu Takagi2026-03-10
🤖 AI

A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning

تقترح هذه الورقة البحثية طريقة "Leave-One-Out PPO" (المعروفة اختصاراً بـ LOOP)، وهي طريقة جديدة للتعلم التعزيزي تجمع بين تقنيات تقليل التباين من خوارزمية REINFORCE ومتانة خوارزمية PPO لتحقيق توازن متفوق بين كفاءة العينات والأداء في عملية الضبط الدقيق لنماذج الانتشار من النص إلى الصورة.

Shashank Gupta, Chaitanya Ahuja, Tsung-Yu Lin, Sreya Dutta Roy, Harrie Oosterhuis, Maarten de Rijke, Satya Narayan Shukl (…)2026-03-10
💻 computer science

Enhancing Alzheimer's Diagnosis: Leveraging Anatomical Landmarks in Graph Convolutional Neural Networks on Tetrahedral Meshes

تقترح هذه الورقة نموذجاً جديداً للتعلم العميق الهندسي القائم على المحولات (transformer) يقوم بترميز الشبكات رباعية الأوجه مع معالم تشريحية لتصنيف مرض الزهايمر بدقة والتنبؤ بإيجابية أميلويد الدماغ لدى الأفراد متوسطي الخطورة، مما يوفر بديلاً قوياً لفحوصات التصوير المقطعي بالإصدار البوزيتروني (PET) المكلفة والتدخلية.

Yanxi Chen, Mohammad Farazi, Zhangsihao Yang, Yonghui Fan, Nicholas Ashton, Eric M Reiman, Yi Su, Yalin Wang2026-03-10
💻 computer science

Climplicit: Climatic Implicit Embeddings for Global Ecological Tasks

تقدم الورقة البحثية Climplicit، وهو مشفر جغرافي مكاني-زماني مدرب مسبقاً يولد تمثيلات مناخية ضمنية لتقليل الحواجز التخزينية والحسابية بشكل كبير للمهام البيئية العالمية، مُظهراً أداءً يطابق أو يتجاوز النماذج المدربة من الصفر عبر تطبيقات متنوعة مثل نمذجة توزيع الأنواع وتصنيف المناطق الحيوية.

Johannes Dollinger, Damien Robert, Elena Plekhanova, Lukas Drees, Jan Dirk Wegner2026-03-10
💻 computer science

Task-Oriented Semantic Compression for Localization at the Network Edge

تقترح هذه الورقة إطار عمل "عنق الزجاجة المعلوماتية المتغيرة المتعامد" (O-VIB)، الذي يستفيد من التحديد التلقائي للأهمية وقيود التعامد لضغط الميزات البصرية متعددة الرؤى من أجل تحديد المواقع بدقة وكفاءة في عرض النطاق الترددي على المنصات المحمولة محدودة الموارد عند حافة الشبكة.

Zhengru Fang, Senkang Hu, Yu Guo, Yiqin Deng, Yuguang Fang2026-03-10