💻 computer science

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

تقترح الورقة البحثية إطار عمل FiRE، وهو إطار عمل مبتكر يعزز النماذج اللغوية الكبيرة متعددة الوسائط لاسترجاع الصور المعقد، وذلك من خلال تقديم مسار مؤتمت لبناء مجموعة بيانات دقيقة للغاية واستراتيجية ضبط دقيق ثنائية المراحل تفصل بين الاستدلال السياقي ومحاذاة الاسترجاع لتحقيق أداء فائق في مرحلة الصفر (zero-shot).

Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao2026-07-31
💻 computer science

Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting

تقدم هذه الورقة نموذج انحدار حتمي يعتمد على بنية U-DiT لإكمال صور الرنين المغناطيسي للدماغ، والذي يستفيد من الانتباه الذاتي المقيد وأولوية التماثل مع الجانب المقابل لتحقيق أفضل النتائج في مقاييس التشابه الهيكلي والتشويه في مهمة التخليق المحلي (Local Synthesis) الخاصة بـ ASNR-MICCAI BraTS.

Danilo Danese, Angela Lombardi, Tommaso Di Noia2026-07-31
💻 computer science

Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic Figures

تُظهر هذه الدراسة أن نماذج التأسيس المرضية، ولا سيما H-optimus-0 وVirchow، يمكنها أن تعمل بفعالية كعمود فقري للكشف الكثيف عن الأجسام الخاصة بالأشكال الانقسامية، محققةً أداءً تنافسياً وتحسناً في المتانة خارج النطاق مقارنة بالنماذج المرجعية التقليدية المدربة من البداية إلى النهاية.

Sweta Banerjee, Alireza Teimoury, Nils Porsche, Alexandra K. Stoll, Viktoria Weiss, Niklas Hargarter, Jonas Ammeling, Th (…)2026-07-31
💻 computer science

ENCORE: Event-Assisted Complementary Motion Refinement for Learned Video Compression

تقترح الورقة البحثية ENCORE، وهو إطار عمل لضغط الفيديو يتم تعلمه ويستفيد من بيانات الكاميرا الحدثية (event camera) لتحسين تقدير الحركة القائم على RGB من خلال تفكيك التمثيل المتكامل، والمعايرة الواعية بالزيادة، والتوجيه الواعي بالطاقة، محققاً وفورات كبيرة في معدل البت وتحسينات في الجودة عبر مجموعات بيانات متنوعة.

Shuhan Ye, Hongbin Yu, Chenqi Kong, Pingchuan Ma, Chong Wang, Jun Wan, Qixin Zhang2026-07-31
💻 computer science

Face and Voice Cross-modal Association with Learning Convex Feature Embedding

تقترح هذه الورقة طريقة مبتكرة لتمثيل الميزات عبر الأنماط (cross-modal feature embedding) تستخدم قيد الغلاف المحدب (convex hull constraint) وآليات الانتباه لمعالجة التباين بين الأنماط بفعالية، مما يقلل بشكل كبير من الإيجابيات والسلبيات الكاذبة في مهام الربط بين الوجه والصوت على مجموعة بيانات VoxCeleb.

Taewan Kim, Jiwoo Kang2026-07-31
💻 computer science

Collaborative Feature Aggregation for Face Super-Resolution and Robust Re-Identification

تقترح هذه الورقة طريقة مبتكرة لتجميع الميزات التعاونية قائمة على المحولات (transformer) مدمجة مع شبكة تعزيز دقة (SR) متتالية للقيام بزيادة دقة الوجه وإعادة تحديد هوية الأشخاص بشكل قوي بشكل مشترك، وذلك من خلال توحيد ميزات الهوية من ملاحظات متعددة متسلسلة أو متعددة المشاهد، مما يتفوق بذلك على الأساليب الرائدة في التعامل مع تدهور الصور الشديد.

Juheon Hwang, Taewan Kim, Jiwoo Kang2026-07-31
💻 computer science

Convolutional Neural Shading for High-Quality 3D Reconstruction from Multi-View Images

تقترح هذه الورقة البحثية "التظليل العصبي الالتفافي" (CNS)، وهو مسار عمل مبتكر يستفيد من مُظلل عصبي وشبكة إزاحة دقيقة التفاصيل للتغلب على قيود المعلومات الهندسية أحادية النقطة في الطرق الحالية، مما يحقق إعادة بناء ثلاثية الأبعاد ذات جودة أعلى بكثير من الصور متعددة المشاهد، لا سيالما في المناطق المظلمة والخالية من الأنسجة.

Juheon Hwang, Taewan Kim, Heeseok Oh, Jiwoo Kang2026-07-31
💻 computer science

Think with Extra-Image: A Farmland Segmentation Agent Driven by Spatio-Temporal Information Gain

تقدم هذه الورقة FarmSeeker، وهو وكيل مبتكر لتجزئة الأراضي الزراعية يتغلب على قيود تحليل الصورة الواحدة من خلال الاستعلام الديناميكي عن المعلومات المكانية والزمانية ذات الصلة بالمهمة لفك الغموض، وقد تم التحقق من صحته باستخدام مقيء GSFS-Bench المقترح حديثاً على النطاق العالمي.

Haiyang Wu, Weiliang Mu, Zhuofei Du, Dandan Zhong, Kaijie Shi, Haifeng Li, Chao Tao2026-07-31
💻 computer science

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

يُعد Qwen-UI-Agent وكيل واجهة مستخدم رسومية (GUI) تأسيسيًا متمحورًا حول العالم الحقيقي، يوحّد بيئات الهاتف المحمول، والكمبيوتر، والويب، والبحث العميق (DeepSearch) مع مساحة عمل هجينة وحلقة بيانات طيار (data flywheel) بأسلوب AutoResearch لتحقيق أداء رائد في اختبارات قياس الأداء للهواتف المحمولة مع تقديم نتائج تنافسية عبر المهام الرقمية الأوسع نطاقًا.

Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long C (…)2026-07-31
💻 computer science

Space2Ground 2.0: A Multi-Source Dataset and Framework for Agricultural Monitoring through Fusion of Street-Level and Satellite Imagery

تقدم هذه الورقة Space2Ground 2.0، وهو إطار عمل وقاعدة بيانات متعددة المصادر تدمج صور الأقمار الصناعية مع الصور الملتقطة على مستوى الشارع والموسومة جغرافياً لتعزيز المراقبة الزراعية الدقيقة والقابلة للتوسع والمقاومة للسحب من خلال تحسين تصنيف المحاصيل على مستوى القطع الأرضية.

Iason Tsardanidis, Alkiviadis Koukos, George Choumos, Vasileios Sitokontantinou, Charalampos Kontoes2026-07-31