← أحدث الأبحاث
💻 computer science

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

تقدم هذه الورقة البحثية VDE، وهي طريقة تسريع خالية من التدريب لنماذج التدفق المصحح (rectified flow models) تعمل على تحسين سرعة الاستدلال من خلال تفكيك وتقدير مكونات السرعة بدلاً من إعادة استخدام الميزات المخزنة مؤقتاً والثابتة، مما يحقق تسريعاً كبيراً مع حد أدنى من الفقد في الجودة البصرية.

المؤلفون الأصليون: Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

نُشر 2026-05-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول رسم لوحة معقدة، مثل شارع مزدحم في مدينة، ولكن عليك القيام بذلك بضربات فرشاة صغيرة جدًا في كل مرة. للحصول على نتيجة مثالية، قد تحتاج إلى اتخاذ 50 خطوة، مع فحص عملك وتعديل الطلاء بعد كل ضربة فرشاة واحدة. هذا يستغرق وقتًا طويلاً.

هذا هو بالضبط كيف تعمل نماذج توليد الصور والفيديو بالذكاء الاصطناعي الحديثة (التي تسمى نماذج التدفق المصحح - Rectified Flow Models). إنهم فنانون موهوبون للغاية، لكنهم بطيئون لأنهم يستغرقون الكثير من الخطوات الصغيرة لإنشاء صورة.

يقدم البحث حيلة جديدة تسمى VDE (تقدير وتفكيك السرعة) تجعل هؤلاء الفنانين يعملون بشكل أسرع بكثير دون إفساد جودة لوحاتهم. إليك كيف يعمل ذلك، باستخدام تشبيهات بسيية:

الطريقة القديمة: "المخطط المجمد"

حاولت الطرق السابقة تسريع العملية عن طريق التخزين المؤقت (Caching) (حفظ) أجزاء من الرسم من الخطوة السابقة وإعادة استخدامها ببساطة.

  • التشبيه: تخيل أنك تسير في طريق. تقول الطريقة القديمة: "سأقوم فقط بنسخ الخريطة من حيث كنت قبل 10 ثوانٍ وأفترض أن الطريق لم يتغير".
  • المشكلة: العالم ديناميكي ومتغير. إذا انعطفت حول زاوية أو تغيرت المناظر الطبيعية، فإن تلك الخريطة القديمة ستصبح خاطئة الآن. يحاول الذكاء الاصطناعي إعادة استخدام ميزات قديمة لم تعد تناسب الصورة الحالية، مما يؤدي إلى أنسجة ضبابية أو تشوهات غريبة. إنه يشبه محاولة ارتداء معطف كان بمقاسك بالأمس؛ قد لا يناسبك اليوم.

الطريقة الجديدة (VDE): "الملاح الذكي"

أدرك المؤلفون أنه بدلاً من نسخ الخرائط القديمة، يمكن للذكاء الاصطناعي في الواقع التنبؤ بالمكان الذي سيذهب إليه بعد ذلك عن طريق تقسيم حركته إلى جزأين بسيطين.

فكر في حركة الذكاء الاصطناعي (سرعته) كسيارة تسير في طريق. يقوم VDE بتقسيم هذه الحركة إلى مكونين:

  1. "الدفع للأمام" (المكون الموازي): وهو مقدار تحرك السيارة للأمام مباشرة.

    • الاكتشاف: وجد البحث أن هذا "الدفع للأمام" يتغير بسلاسة وتوقع كبيرين. إنه يشبه تسارع السيارة؛ إذا كنت تعرف السرعة في آخر ثانيتين، يمكنك بسهما تخمين السرعة للثانية التالية باستخدام رياضيات بسيطة (مثل رسم خط مستقيم).
    • الحيلة: بدلاً من إعادة حساب المحرك بالكامل، يقوم VDE بمجرد تخمين رياضي سريع بناءً على الخطوات القليلة الماضية.
  2. "الانحراف الجانبي" (المكون المتعامد): وهي التعديلات الطفيفة من جانب إلى آخر التي تقوم بها السيارة للبقاء في المسار.

    • الاكتشاف: وجد البحث أنه لفترات قصيرة، لا يتغير هذا "الانحراف الجانبي" تقريبًا. إنه يشبه بقاء عجلة قيادة السيارة في نفس الوضع تمامًا لبضع ثوانٍ.
    • الحيلة: يقوم VDE ببساه بإعادة استخدام هذا الاتجاه "الجانبي" لعدة خطوات دون إعادة حسابه.

كيف يعمل VDE في الممارسة العملية

يستخدم VDE استراتيجية "التحقق والتقدير":

  1. المرساة (التحقق): كل بضع خطوات، يقوم الذكاء الاصطناعي بحساب كامل وبطيء للحصول على البيانات المثالية والحقيقية. هذا يشبه توقف السائق للتحقق من نظام تحديد المواقع (GPS) والتأكد من الطريق أمامه.
  2. التقدير (الطريق المختصر): في الخطوات التي بينهما، لا يقوم الذكاء الاصطناعي بالعمل الشاق. بدلاً من ذلك، يستخدم التخمين الرياضي لـ "الأمام" وإعادة استخدام "الجانب" لمعرفة الخطوة التالية فوراً.
  3. النتيجة: يتخطى الذكاء الاصطناعي العمل الشاق بمعدل 2 إلى 3 مرات أسرع من ذي قبل.

لماذا هو أفضل؟

اختبر البحث هذه الطريقة على ثلاثة نماذج مختلفة للذكاء الاصطناعي (Flux، وQwen-Image، وWan2.1) لإنشاء الصور والفيديوهات.

  • السرعة: جعل الذكاء الاصطناعي أسرع بمعدل 2 إلى 3 مرات. على سبيل المثال، الصورة التي كانت تستغرق 12 ثانية لصنعها تم إنجازها في حوالي 4 ثوانٍ.
  • الجودة: لأن VDE يحسب الحركة بناءً على المدخل الحالي (الطريق الفعلي الذي تسير عليه السيارة الآن) بدلاً من خريطة قديمة وثابتة، تبدو الصور متطابقة تقريبًا مع النسخة البطيئة وعالية الجودة.
  • المقارنة: الطرق الأخرى التي تعتمد فقط على "إعادة استخدام" الأجزاء القديمة غالبًا ما تؤدي إلى صور ضبابية أو تالفة (مثل وجه ممطوط أو نسيج ذائب). يحافظ VDE على التفاصيل حادة.

باختختصار

يدعي البحث أنه من خلال تقسيم حركة الذكاء الاصطناعي إلى "جزء أمامي يمكن التنبؤ به" و"جزء جانبي مستقر"، يمكننا إيقاف الذكاء الاصطناعي عن القيام بالحسابات الثقيلة غير الضرورية. بدلاً من نسخ العمل القد بطريقة عمياء، يستخدم الذكاء الاصطناعي رياضيات ذكية وخفيفة الوزن لتخمين الخطوة التالية، مما يسمح له بإنشاء صور وفيديوهات عالية الجودة في جزء بسيط من الوقت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →