💻 computer science

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

يُعد Oxygen-TryOn نموذجاً تأسيسياً موحداً ومتخصصاً في مجال الموضة، يحقق أفضل النتائج في تجربة القياس الافتراضي الواقعية للغاية لمختلف القطع والسيناريوهات من خلال الاستفيد من محرك بيانات مخصص ومسار تدريب ثلاثي المراحل يتضمن التعلم المعزز، متفوقاً بذلك على كل الأنظمة الرائدة المملوكة والمفتوحة المصدر.

Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipe (…)2026-07-27
💬 NLP

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

تقدم الورقة البحثية "خوندو" (Khondo)، وهو أول معيار مرئي ثنائي اللغة لتقسيم وإعادة ترتيب النماذج الحكومية البنغالية المتصلة، والذي كشف أنه في حين يمكن للنماذج اللغوية الكبيرة متعددة الوسائط تجميع الصفحات بفعالية حسب المستند، إلا أنها تعاني بشكل كبير في إعادة بناء الترتيب الأصلي للصفحات، لا سيما في اللغات ذات الموارد المحدودة.

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Ch (…)2026-07-27
🤖 AI

SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes

تقترح الورقة البحثية إطار عمل SCALE، وهو إطار عمل ذاتي الإشراف يستفيد من نموذج لغوي توليدي لإنشاء بيانات اصطناعية لانتهاكات قواعد تصميم الدوائر المتكاملة (DRC)، وضبط نموذج رؤية-لغة متكيف مع المجال، مما يؤدي إلى تحسين معدل نجاح إصلاح انتهاكات قواعد التصميم الموضعية في عمليات تصميم التوصيل والوضع عند عقد أشباه الموصلات المتقدمة التي تقل عن 2 نانومتر بشكل كبير.

Chia-Tung Ho, Haoyu Yang, Guanglei Zhou, Yoshi Nishi, Yaguang Li, Walker Turner, Cunxi Yu, Yiran Chen, Brucek Khailany2026-07-27
💻 computer science

Learning Adaptive Semantic Gaussian Allocation for 3D Occupancy

تقدم هذه الورقة البحثية SAGFormer، وهو إطار عمل قائم على تقنية Transformer يعالج عقبة التخصيص في تمثيلات غاوس ثلاثية الأبعاد الدلالية من خلال الاختيار الصريح لأكثر عناصر غاوس فائدة لتحسين كفاءة الذاكرة والاتساق الدلالي في التنبؤ بالإشغال ثلاثي الأبعاد.

Kanglin Ning, Yiran Zhao, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan2026-07-27
🤖 AI

ISPCloak: Weaponizing ISP for Optimization-Free Physical Camouflage against Deepfake Detectors

تقترح الورقة البحثية ISPCloak، وهو إطار عمل عدائي غير قائم على التحسين يتملص من كواشف التزييف العميق عبر إسقاط الصور المولدة بالذكاء الاصطناعي في نطاق RAW وإعادة حقن بصمات إحصائية حقيقية خاصة بالكاميرا من مسار معالجة الصور (ISP)، مما يخلق تمويهاً فيزيائياً غير محسوس يستغل عدم قدرة الكواشف على التعرف على الآثار الجوهرية الأصلية للأجهزة.

Jiale Zhao, Jiajun Wan, Lei Tang, Ye Qin, Kebing Jin, Jinghui Qin2026-07-27
💻 computer science

Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation

تقدم هذه الورقة البحثية "عنق زجاجة المعلومات المحفز" (PIB)، وهو إطار عمل للتكيف بكفاءة في المعلمات للنماذج الرؤيوية التأسيسية المجمدة، والذي يستفيد من مبدأ "عنق زجاجة المعلومات" لتحسين تخصيص المعلومات على مستوى الطبقات، مما يحقق تعميماً ومتانة فائقين عبر 34 مجموعة بيانات متنوعة مع ضبط 0.35% فقط من المعلمات.

Yuqi Li, Xi Xiao, Yunbei Zhang, Lin Zhao, Yu Li, Aiden Zhao, Tianyang Wang, Hao Xu, Yingli Tian2026-07-27
🤖 AI

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

تقترح هذه الورقة البحثية تقنية "توجيه تقطير البروز البصري" (VSSD)، وهي طريقة تستفيد من خرائط الانتباه وتفكيك القيم المفردة لتوليد ناقلات توجيه تُرشد عملية التقطير بين الطبقات، مما يعزز استدلال سلسلة الأفكار متعدد الوسائط في النماذج الصغيرة من خلال الحفاظ على الفروق الدقيقة بين الوسائط المتعددة.

Hao Yang, Jin Wang, Xuejie Zhang2026-07-27
🤖 AI

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

تقدم هذه الورقة MissionBench، وهو معيار لتقييم قدرات المهام على مستوى المهمة (zero-shot) للنماذج اللغوية الكبيرة متعددة الوسائط في البيئات الجوية ثلاثية الأبعاد، كاشفةً أنه بينما يؤدي التوسع إلى تحسين الأداء، لا تزال النماذج الحالية تتخلف بشكل كبير عن البشر في المهام المتجسدة المعقدة وطويلة الأمد التي تتطلب تخطيطاً متعدد الخطوات واستدلالاً تكيفياً.

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki (…)2026-07-27
🤖 AI

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

تقترح هذه الورقة إطار عمل EVL-MCoT، وهو إطار عمل معزز للرؤية واللغة يستفيد من تسلسل الأفكى متعدد المنظور (multi-perspective Chain-of-Thought) وآلية فك ترميز موجهة بالنماذج الأولية (prototype-guided decoding) لتحسين الكشف عن الميمات الضارة من خلال معالجة القيود في دمج المعرفة الخلفية والمحاذاة البصرية-النصية دقيقة التفاصيل.

Hao Yang, Jin Wang, Xuejie Zhang2026-07-27
💬 NLP

Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation

تكشف هذه الدراسة أنه بينما تمتلك نماذج الرؤية واللغة الصغيرة معرفة ذاتية داخلية دقيقة حول أخطائها في ظل ظروف تدهور الصور الواقعية، إلا أنها تفشل في التعبير لفظياً عن هذا اليقين، مما يجعل احتمالية الرمز (token probability) الداخلية إشارةً متفوقة للتأجيل مقارنة بالثقة المعلنة، رغم أن كلتا الإشارتين تصبحان غير موثوقتين في ظل ظروف الإضاءة المنخفضة الشديدة.

M M Asif Ferdous2026-07-27