💻 computer science

VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion

يُعد VSDiffusion إطار عمل انتشار ثنائي المراحل مقيد بالرؤية، يعالج الطبيعة غير محددة الحل لتوليد الظلال من خلال دمج أولويات الرؤية عبر فرع انتباه متقاطع محكوم بالظل وخريطة أولية ناعمة متعلمة لإنتاج ظلال مسقطة واقعية ومتسقة هندسياً.

Jing Li, Jing Zhang2026-03-10
💻 computer science

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

يُعد AffordGrasp إطار عمل قائمًا على الانتشار يعمل على توليد قبضات بشرية مستقرة فيزيائيًا ودقيقة دلاليًا من خلال دمج تمثيلات كامنة مدركة للإمكانيات مع عملية تكييف مزدوجة لسد الفجوة النمطية بين هندسة الأجسام ثلاثية الأبعاد وتعليمات التفاعل النصية.

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He2026-03-10
💻 computer science

See and Switch: Vision-Based Branching for Interactive Robot-Skill Programming

تقدم هذه الورقة "See & Switch"، وهو إطار عمل تفاعلي قائم على الرؤية للبرمجة عن طريق التوضيح، يستخدم صور "العين في اليد" لتمكين التفرع الشرطي الموثوق به وكشف الشذوذ عبر الإنترنت في مهام الروبوتات الماهرة، محققاً دقة عالية عبر ظروف متنوعة ومستخدمين مبتدئين.

Petr Vanc, Jan Kristof Behrens, Václav Hlaváč, Karla Stepanova2026-03-10
💻 computer science

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

يُعد ImageEdit-R1 إطار عمل جديداً متعدد الوكلاء يستخدم التعلم التعزيزي لتنسيق وكلاء متخصصين في الرؤية واللغة والنماذج التوليدية، مما يتيح تحريراً ديناميكياً للصور يعتمد على السياق ويتفوق على النماذج أحادية البنية والنماذج المرجعية الحالية في التعامل مع تعليمات المستخدم المعقدة ومتعددة الخطوات.

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui2026-03-10
💻 computer science

Evaluating Generative Models via One-Dimensional Code Distributions

تقترح هذه الورقة إطار تقييم مبتكر للنماذج التوليدية يستبدل المقاييس التقليدية القائمة على الميزات المستمرة بمقاييس خالية من التدريب ولا تعتمد على مرجع وتعمل في فضاء الرموز البصرية المنفصلة، مما يظهر ارتباطاً فائقاً مع الأحكام البشرية عبر معيار قياس جديد واسع النطاق يسمى VisForm.

Zexi Jia, Pengcheng Luo, Yijia Zhong, Jinchao Zhang, Jie Zhou2026-03-10
💻 computer science

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

تقترح هذه الورقة مسار عمل لا يتطلب تدريباً باستخدام نماذج لغوية كبيرة متعددة الوسائط لتوليد صور عيوب اصطناعية متنوعة وعالية الدقة لعوازل خطوط الطاقة، مما يحسن بشكل كبير أداء التصنيف وكفاءة البيانات في ظل ظروف ندرة البيانات من خلال تعزيز مجموعات البيانات الواقعية المحدودة.

Xuesong Wang, Caisheng Wang2026-03-10
💻 computer science

TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery

تقترح الورقة البحثية TALON، وهو إطار عمل للتعلم التكيفي في وقت الاختبار لاكتشاف الفئات آنياً يتغلب على قيود الطرق القائمة على التجزئة (hash) الثابتة من خلال التحديث الديناميكي للنماذج الأولية الدلالية ومشفر الميزات لدمج المعرفة الجديدة باستمرار، مع استخدام معايرة لوجيت (logit) مدركة للهامش لمنع انفجار الفئات وتحسين دقة الفئات الجديدة بشكل كبير.

Yanan Wu, Yuhan Yan, Tailai Chen, Zhixiang Chi, ZiZhang Wu, Yi Jin, Yang Wang, Zhenbo Li2026-03-10
💻 computer science

DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation

تقدم هذه الورقة البحثية DSH-Bench، وهو معيار شامل يتميز بتصنيف هرمي للمواضيع، وتصنيف دقيق للصعوبة والسيناريوهات، ومقياس مبتكر لدرجة اتساق هوية الموضوع (SICS) لتقييم وتشخيص نماذج توليد الصور من النصوص الموجهة بالمواضيع بشكل منهجي.

Zhenyu Hu, Qing Wang, Te Cao, Luo Liao, Longfei Lu, Liqun Liu, Shuang Li, Hang Chen, Mengge Xue, Yuan Chen, Chao Deng, P (…)2026-03-10
💻 computer science

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

يقدم UniGround إطار عمل جديدًا، لا يعتمد على التدريب، للتوطين البصري ثلاثي الأبعاد الشامل، والذي يستفيد من التصفية العالمية للمرشحين والاستدلال المحلي الدقيق لتحقيق أداء رائد في مستوى الصفر (zero-shot) لتحديد مواقع أي كائنات داخل بيئات ثلاثية الأبعاد معقدة دون الاعتماد على نماذج مدربة مسبقًا أو إشراف ثلاثي الأبعاد.

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Weisheng Xu, Shuning Zhang, Yixiao Feng, Yuetong Fang, Renjing Xu2026-03-10
💻 computer science

Fast Low-light Enhancement and Deblurring for 3D Dark Scenes

يُعد FLED-GS إطار عمل سريع لتوليد مناظر من زوايا رؤية جديدة في المشاهد ثلاثية الأبعاد المظلمة، حيث يعالج تدهورات الإضاءة المنخفضة المركبة والضجيج وضبابية الحركة من خلال إعادة صياغة عملية الاستعادة كدورة متبادلة من إزالة الضبابية ثنائية الأبعاد وإعادة بناء "Gaussian Splatting" ثلاثية الأبعاد المدركة للضجيج، محققاً أداءً فائقاً مع سرعات تدريب ورندرة أسرع بكثير مقارنة بالأسالث المتقدمة.

Feng Zhang, Jinglong Wang, Ze Li, Yanghong Zhou, Yang Chen, Lei Chen, Xiatian Zhu2026-03-10