FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
يُعد FreeFuse إطار عمل لا يتطلب تدريباً يُمكّن من توليد صور عالية الجودة متعددة المواضيع من النصوص عبر تنفيذ التوجيه التكيفي على مستوى الرموز (Adaptive Token-Level Routing) أثناء الاستدلال، والذي يستخدم آلية FreeFuseAttn مبتكرة لتعيين بقايا LoRA الخاصة بكل موضوع ديناميكياً وبدقة إلى مناطقها المكانية المقابلة دون الحاجة إلى أدوات تقسيم خارجية أو إعادة تدريب النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في السنوات القليلة الماضية، تعلمت الحواسيب كيفية رسم الصور من الكلمات. تكتب وصفاً مثل "قطة تجلس على سجادة"، فيقوم الجهاز بإنشاء صورة جديدة تماماً لم تكن موجودة من قبل. تعتمد هذه التكنولوجيا على نماذج رقمية ضخمة درست ملايين الصور لفهم كيفية ترابط الضوء والملمس والأشياء معاً. ولجعل هذه الآلات ترسم أشياء محددة تريدها — مثل وجهك أو لعبة فريدة — يمكنك تعليمها درساً صغيراً باستخدام تقنية تسمى "التكيف منخفض الرتبة" (Low-Rank Adaptation). فكر في هذا الأمر كبطاقة ملاحظات صغيرة ومتخصصة تخبر الكمبيوتر: "عندما ترى كلمة 'كلبي'، تذكر هذا الكلب تحديداً". هذه البطاقات فعالة وسهلة الإنشاء، مما يسمح للمستخدمين بتخصيص مخرجات الآلة دون إعادة بناء النظام بأكمله.
ومع ذلك، تظهر مشكلة عندما تحاول استخدام عدة بطاقات ملاحظات هذه في وقت واحد. فإذا طلبت من الكمبيوتر رسم مشهد يضم ثلاثة أشخاص مختلفين، لكل منهم بطاقة ملاحظات مخصصة، فإن التعليمات غالباً ما تتصادم. يصاب الجهاز بالارتباك، فيخلط ملامح شخص ما مع شخص آخر، أو ينشئ فوضى ضبابية حيث تندمج الهويات المتميزة مع بعضها البعض. يبدو الأمر كما لو أن الكمبيوتر لا يستطيع أن يقرر أي بطاقة ملاحظات يستمع إليها لأي جزء من الصورة. هذا القصور جعل من الصعب إنشاء مشاهد معقدة تضم شخصيات محددة متعددة باستخدام هذه الأدوات القوية.
قام فريق من الباحثين في جامعة تشجيانغ بتطوير طريقة جديدة تسمى "FreeFuse" لحل هذه المشكلة دون الحاجة إلى إعادة تدريب الكمبيوتر أو إضافة معدات ثقيلة إضافية. يعتمد نهجهم على ملاحظة بسيطة ولكنها قوية: الكمبيوتر يعرف بالفعل أين يضع الأشياء إذا طلبت منه ذلك في اللحظة المناسبة. وبدلاً من إجبار بطاقات الملاحظات المختلفة على التنافس على الصورة بأكملها، يعمل النظام الجديد مثل مراقب حركة المرور؛ فهو ينظر إلى الصورة أثناء رسمها ويقرر: "هذا الجزء من الصورة ينتمي للشخص الأول، وهذا الجزء ينتمي للشخص الثاني". ثم يوجه التعليمات المحددة لكل شخص بهدوء فقط إلى المنطقة التي ينتمي إليها، مما يحافظ على الميزات منفصلة وواضحة.
وجد الباحثون أن هذا الفصل يعمل بشكل أفضل خلال المراحل الأولى من الرسم، عندما يكون الكمبيوتر لا يزال في مرحلة تحديد المخطط الأساسي للمشهد. لقد ابتكروا أداة تراقب عملية التفكير الداخلي للكمبيوتر في هذه اللحظة المحددة. ومن خلال تحليل كيفية ربط الكمبيوتر بين الكلمات وأجزاء الصورة، يمكن للأداة تحديد مكان ظهور كل شخصية بدقة، حتى لو كانت الشخصيات تبدو متشابهة جداً، مثل رجلين يقفان بجانب بعضهما البعض. لا تحتاج هذه الأداة إلى أن تُعلم كيفية التعرف على الوجوه أو الأشياء مسبقاً؛ فهي ببساب تستخدم قدرة الكمبيوتر الطبيعية على فهم العلاقة بين الكلمات والأشكال.
بمجرد أن تعرف المنظومة مكان كل شخصية، فإنها تطبق قاعدة صارمة: التعليمات الخاصة بالشخصية الأولى مسموح لها فقط بالتأثير على البكسلات في منطقة الشخصية الأولى، والتعليمات الخاصة بالشخصية الثانية تظل محصورة في مساحتها الخاصة. هذا يمنع اختلاط الملامح. وقد اختبر الباحثون هذه الطريقة بطلب رسم مشاهد تضم ما يصل إلى ست شخصيات مخصصة في آن واحد. في المحاولات السابقة، كان إضافة هذا العدد الكبير من التعليمات المخصصة سيؤدي إلى انهيار الصورة وتحولها إلى فوضى مشوهة. ومع هذه الطريقة الجديدة، نجح الكمبيوتر في توليد صور واضحة ومتماسكة حيث بدا كل شخص تماماً مثل الشخص أو الشيء المحدد الذي كان من المفترض أن يكون عليه، دون أي اختلاط غير مرغوب فيه للملامح.
كما أظهرت الدراسة أن هذه الطريقة سريعة وعملية؛ فهي لا تتطلب من المستخدم رسم أقنعة أو خطوط خارجية يدوياً، ولا تتطلب إعادة تدريب الكمبيوتر ببيانات جديدة. إنها تعمل تلقائياً مع الأدوات القياسية التي يستخدمها الناس بالفعل. وعند مقارنتها بالطرق الأخرى التي تحاول حل نفس المشكلة، أنتج هذا النهج الجديد صوراً أفضل بكثير في الحفاظ على هويات الشخصيات سليمة. كما تمكن من الحفاظ على المظهر الطبيعي والجمالي العام للصورة، متجنباً العيوب الغريبة أو الفجوات التي تظهر غالباً عند دمج تعليمات متعددة. وقد أثبت الباحثون أن نظامهم يعمل جيداً مع أنواع مختلفة من الشخصيات، من البشر الواقعيين إلى الشخصيات الكرتونية وحتى أشياء محددة مثل الأحذية أو المركبات.
من خلال السماح للكمبيوتر باستخدام معرفته الداخلية لفرز التعليمات، يجعل هذا الإطار الجديد من الممكن إنشاء مشاهد معقدة متعددة الشخصيات بمستوى من التفصيل والدقة كان من الصعب تحقيقه سابقاً. إنه يلغي الحاجة إلى الإعداد اليدوي المعقد أو إعادة التدريب المكلفة، مما يوفر طريقة مباشرة لأي شخص لدمج أفكار مخصصة متعددة في صورة واحدة عالية الجودة. ويشير هذا العمل إلى أن مفتاح حل هذه النزاعات لا يكمن في تغيير عقل الكمبيوتر، بل في توجيه انتباهه بعناية أكبر خلال العملية الإبداعية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.