HADIS: A Hybrid Architecture for Query-Aware Diffusion Model Serving
يُعد HADIS نظاماً هجيناً لخدمة نماذج الانتشار يجمع بين التوجيه قبل التوليد والتمييز بعد التوليد لتحسين اختيار النماذج وتخصيص وحدات معالجة الرسومات ديناميكياً، مما يحسن جودة الاستجابة بشكل كبير ويقلل من انتهاكات اتفاقية مستوى الخدمة (SLO) مقارنة بالنهج المتتالي الحالي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في العصر الرقمي، تعلمت الحواسيب كيف ترسم. فمن خلال دراسة ملايين الصور والكلمات التي يستخدمها الناس لوصفها، تستطيع أنظمة الذكاء الاصطناعي الآن توليد صور جديدة تماماً من مجرد وصف نصي بسيط. عندما يطلب مستخدم "مشهدًا لمدينة سريالية تمثل الزمن والذاكرة"، لا يقوم الحاسوب بمجرد استرجاع صورة فوتوغرافية؛ بل يبني صورة بكسل تلو الآخر، وهي عملية تتطلب قدرة حوسبة هائلة ووقتاً طويلاً. وقد انتقلت هذه القدرة من مختبرات الأبحاث إلى الأدوات اليومية التي يستخدمها الفنانون والمصممون، لكنها تواجه مشكلة لوجستية مستعصية: كيف يمكن تلبية هذه الطلبات بسرعة وبتكلفة منخفضة دون التضحية بجمال الصورة النهائية.
تكمن الصعوبة الجوهرية في عدم القدرة على التنبؤ بطبيعة المهمة. فبعض الطلبات بسيطة، مثل "موزة على طبق أبيض"، والتي يمكن للحاسوب حلها بسرعة. أما غيرها فمعقدة، وتتطلب من الآلة التعامل مع تفاصيل دقيقة ومفاهيم تجريدية، وهي عملية تستغرق وقتاً أطول بكثير. إن اتباع نهج يشغل كل طلب عبر النسخة الأكثر قوة وجودة من البرنامج سيضمن نتيجة جميلة، ولكنه سيكون بطيئاً للغاية ومكلفاً، مما يؤدي إلى إغراق النظام بأعمال غير ضرورية. وعلى العكس من ذلك، فإن استخدام نسخة أسرع وأبسط لكل شيء سيكون فعالاً، ولكنه غالباً ما سينتج صوراً ضبابية أو غير منطقية للطلبات الصعبة. ويتمثل التحدي الذي يواجه المهندسين في بناء نظام يمكنه التعرف فوراً على الطلبات السهلة والصعبة، وتوجيهها إلى الأداة المناسبة دون إضاعة الوقت أو المال.
لقد طور باحثون في جامعة ماساتشوستس أمهرست نظاماً جديداً يسمى HADIS لحل هذه المشكلة تحديداً. يعالج عملهم خللاً معيناً في كيفية تعامل الأنظمة الحالية مع هذه الطلبات. فالطرق الموجودة غالباً ما تجبر كل طلب على المرور عبر نسخة سريعة وخفيفة من البرنامج أولاً، ثم تتحقق من النتيجة لاحقاً لترى ما إذا كانت جيدة بما يكفي. وإذا كانت النتيجة رديئة، يقوم النظام بالتخلص منها ويبدأ من جديد باستخدام النسخة الأبطأ والأكثر قوة. هذا النهج يهدر قدراً كبيراً من قدرة الحوسبة على طلبات كان من المقدر لها دائماً أن تكون صعبة للغاية بالنسبة للنسخة السريعة. إن الأمر يشبه مطالبة فنان مبتدئ برسم لوحة فنية رائعة، ثم تدرك في منتصف الطريق أن المهمة تتطلب فناناً ماهراً، فتقوم بإلقاء المسودة للبدء من جديد.
ولإصلاح ذلك، صمم الفريق بنية هجينة تجمع بين استراتيجيتين مختلفتين. الجزء الأول هو "الموجه" (router) الذي ينظر إلى النص الوصفي قبل توليد أي صورة. وبناءً على الكلمات المستخدمة، يتنبأ ما إذا كان الطلب من المرجح أن يكون سهلاً أو صعباً. فإذا بدا الطلب معقداً للغاية، يتجاوز النظام النسخة السريعة والخفيفة تماماً ويرسل الطلب مباشرة إلى النموذج القوي وعالي الجودة. وهذا يوفر الوقت والموارد عبر تجنب المحاولة العبثية لحل مشكلة صعبة باستخدام أداة بسيطة. أما الجزء الثاني من النظام فهو "المميز" (discriminator) الذي يعمل كمفتش للجودة. فإذا مر طلب ما عبر النسخة السريعة، يقوم هذا المفتش بفحص الصورة النهائية. وإذا لم تكن الصورة بالمستوى المطلوب، يكتشف النظام الخطأ ويعيد توجيهه إلى النموذج القوي قبل أن يراها المستخدم. تضمن شبكة الأمان هذه ذات الخطوتين معالجة الطلبات السهلة بسرعة، بينما تحصل الطلبات الصعبة على الاهتمام الذي تحتاجه دون إضاعة الجهد في محاولات فاشلة.
اختبر الباحثون هذا النظام على مجموعة من ستة عشر معالج رسومات قوياً، باستخدام بيانات من العالم الحقيقي لآلاف طلبات الصور. وقارنوا HADIS بعدة طرق موجودة، بما في ذلك الأنظمة التي تستخدم نموذجاً سريعاً فقط، والأنظمة التي تستخدم نموذجاً بطيئاً فقط، والأنظمة التي تحاول التبديل بينهما دون موجه ذكي. كانت النتائج مذهلة؛ فمن خلال اتخاذ قرار ذكي بشأن النموذج الذي يجب استخدامه ومتى، حسن HADIS جودة الصور المولدة بنسبة تصل إلى 35% مقارنة بالأنظمة الأخرى. وفي الوقت نفسه، قلل من عدد الطلبات التي فشلت في الانتهاء في الوقت المحدد بمعامل يتراوح بين 27 إلى 45 مرة. وهذا يعني أن النظام لا ينتج صوراً أفضل فحسب، بل هو أيضاً أكثر موثوقية في تلبية توقعات السرعة لدى المستخدمين.
وكانت الرؤية الأساسية من الدراسة هي أن إضافة المزيد من طبقات التعقيد إلى النظام لم تكن ضرورية. فقد وجد الباحثون أن إعداداً بسيطاً من مرحلتين — نموذج سريع ونموذج بطيء، يديرهما موجههم الهجين والمفتش الخاص بهم — كان فعالاً تماماً مثل الترتيبات الأكثر تعقيداً التي تضم ثلاثة نماذج أو أكثر. سمح هذا الاكتشاف بتبسيط عملية صنع القرار في النظام، مما جعله أسرع في التكيف مع المتطلبات المتغيرة. يراقب النظام باستمرار تدفق الطلبات ويعدل إعداداته في الوقت الفعلي، مما يضمن استخدامه دائماً للتوازن الصحيح بين السرعة والجودة.
إن نجاح HADS يثبت أن مستقبل تقديم الذكاء الاصطناعي لا يكمن فقط في بناء نماذج أكبر، بل في بناء طرق أذكى لاستخدامها. فمن خلال فهم طبيعة الطلب قبل معالجته والتحقق من النتيجة بعد ذلك، يتجنب النظام الهدر الذي يعيب التقنيات الحالية. يسمح هذا النهج للحواسيب بخدمة المزيد من المستخدمين بنتائج عالية الجودة، باستخدام نفس القدر من الطاقة والأجهزة. ومع دمج الذكاء الاصطناعي التوليدي في الحياة اليومية، ستكون أنظمة مثل HADIS ضرورية لضمان بقاء هذه الأدوات القوية سريعة، وبأسعار معقولة، وموثوقة للجميع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.