💻 computer science

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

تقدم الورقة البحثية AIDE، وهو إطار عمل مبتكر يستفيد من عروض الخبراء التوضيحية أثناء التدريب فقط لتقطير الخبرة في نموذج غير مرجعي قادر على توليد تعليقات توجيهية للمهارات الحركية بلغة طبيعية من تسلسل وضعية المتعلم وحده عند الاستنتاج.

Yoshiki Ito2026-08-05
💻 computer science

TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

تقدم الورقة البحثية تقنية TASQ، وهي طريقة لتكميم التناثر البتي المتكيف زمنياً تقوم باقتطاع البتات الأقل أهمية ديناميكياً عبر خطوات إزالة الضجيج لتقليل دورات الحوسبة بنسبة تتراوح بين 25 و50% مقارنة بالتكميم الثابت مع الحفاظ على جودة الصورة دون زيادة في عبء التخزين.

Seokho Han, Dongwei Wang, Jinhee Kim, Yiran Chen, Kang Eun Jeon, Huanrui Yang, Jong Hwan Ko2026-08-05
💻 computer science

DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers

تقدم هذه الورقة "درجة التنوع الموزون" (WDS) لقياس تنوع التمثيل على مستوى الكتل في نماذج محولات الانتشار (Diffusion Transformers)، مما يكشف عن ارتباطها القوي بجودة التوليف، وتقترح إطار عمل "DiverseDiT++"، الذي يعزز الأداء من خلال تعزيز تعلم التمثيل المتنوع صراحةً عبر اتصالات متبقية طويلة وفقدان التنوع.

Binglei Li, Mengping Yang, Zhiyu Tan, Xiaomeng Yang, Zhizhong Huang, Junping Zhang, Hao Li2026-08-05
💻 computer science

FakeI2V-Bench: Benchmarking the Applicability of Image-level Deepfake Detectors for Deepfake Video Detection

تقدم الورقة البحثية FakeI2V-Bench، وهو معيار شامل يتكون من ما يقرب من 100,000 فيديو تم إنشاؤها بواسطة نماذج متقدمة لتقييم كواشف التزييف العميق، كاشفةً أن الكواشف على مستوى الصورة يمكن أن تتفوق على تلك التي تعمل على مستوى الفيديو، ومقترحةً إطار عمل IV-Bridge لتعزيز قدرات الكشف عن الفيديو بشكل كبير.

Pei Li, Sihan Chen, Delong Ran, Tianshuo Cong2026-08-05
💻 computer science

Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining

تقدم الورقة البحثية DualShield، وهو آلية دفاع إضافية تعزز متانة البصمات الإدراكية العميقة الحالية ضد هجمات التهرب من خلال الجمع بين التنعيم العشوائي عند وقت المطابقة والتقوية عند وقت النشر، محققةً متانة معتمدة دون الحاجة إلى إعادة تدريب النموذج.

Bangjie Sun, Nayoung Kim, Mun Choon Chan, Jun Han2026-08-05
💻 computer science

A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion

تقدم هذه الورقة إطار عمل موحد للتعلم العميق قائم على شرط الدقة، يعتمد على الانتباه الخطي المعزز بالرتبة والتعديل الخطي المعتمد على الميزات، مما يمكّن نموذجاً واحداً من دمج المسوحات الخطية المتعامدة بفعالية لتحقيق تصوير شبه متماثل المناحي عبر تكوينات بصرية متباينة، متفوقاً بذلك على النماذج المتخصصة والنهج غير المشروطة في كل من الأداء والتعميم.

Yiming Gong, Kai Wang2026-08-05
💻 computer science

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models

تقترح هذه الورقة استراتيجية تقليم رموز تكيفية من مرحلتين، لا تتطلب تدريباً وتتم بعد التدريب، حيث تعمل أولاً على إزالة الإطارات الزائدة ثم تضبط ديناميكياً الاحتفاظ بالرموز بناءً على الارتباطات بين الإطارات، مما يحقق تقليلاً بنسبة 95% في العمليات الحسابية مع تحسين دقة وصف الفيديو بنسبة 7% عند الاحتفاظ بـ 10% فقط من الرموز.

Paribesh Regmi, Qingshuang Chen, Chi Zhang, Heba Aly, Yelin Kim, Hongda Mao2026-08-05
💻 computer science

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

يُعد SeCo-SBIR إطار عمل لتعلم التلقين المتسق دلالياً، وهو يحل التوتر بين التكيف مع النطاق والتعميم في حالة الصفر في استرجاع الصور القائم على الرسم من خلال حقن المعرفة الدلالية الموجهة بالنص في المشفر البصري وفرض الاتساق مع مرجع CLIP مجمد عبر قيود قائمة على الاضطراب، محققاً أداءً هو الأفضل في حالته عبر العديد من المعايير المرجعية.

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong2026-08-05
💻 computer science

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

تقترح الورقة البحثية Route2Step، وهو إطار عمل يفصل بين تتبع التقدم الدلالي وتوليد الإجراءات المحلية عبر واجهة صريحة على مستوى الخطوة وإجراء محاذاة مبتكر، مما يحل الغموض بين أخطاء التنفيذ وأخطاء التقدم لتحسين أداء الملاحة البصرية واللغوية بشكل كبير.

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong2026-08-05
💻 computer science

EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation

يُعد EditFlow3D إطار عمل لا يتطلب تدريباً يتيح التحرير المحلي الدقيق والآلي للأصول ثلاثية الأبعاد من خلال الاستفيد من سير عمل مدفوع بنماذج الرؤية واللغة الكبيرة (VLM) لتوليد الأقنعة والتوجيه البصري، مع توظيف التدفق التفاضلي الموجه بالقناع والحفاظ على المسار خطوة بخطوة لتحرير المناطق المستهدفة دون المساس ببنية ومظهر المناطق غير المستهدفة.

Rui Nie, Chuang Wang, Haitao Zhou, Jiahe Song, Buyu Li, Sheng Wang, Qian Yu2026-08-05