← أحدث الأبحاث
🤖 AI

TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models

يُعد TP-Blend إطار عمل خفيف الوزن ولا يتطلب تدريباً، يحقق دمجاً دقيقاً لأسلوب الكائنات في نماذج الانتشار من خلال الجمع بين دمج كائن الانتباه المتقاطع لإعادة تعيين الميزات المدركة مكانياً، ودمج أسلوب الانتباه الذاتي لتعديل التفاصيل الحساسة للقوام، مما يتيح استبدال الكائنات ونقل الأسلوب بدقة عالية في آن واحد.

المؤلفون الأصليون: Xin Jin, Yichuan Zhong, Yapeng Tian

نُشر 2026-03-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xin Jin, Yichuan Zhong, Yapeng Tian

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك محرر صور سحرياً يمكنه تغيير أي شيء في الصورة بمجرد كتابة جملة. يمكنك أن تقول له، "حول الفارس إلى روبوت"، وسيفعل ذلك. ولكن ماذا لو أردت القيام بشيء أكثر تعقيداً؟ ماذا لو أردت دمج فارس وروبوت في مخلوق واحد متجانس، ثم رسم هذا المخلوق الجديد بأسلوب لوحة زيتية لفان جوخ؟

الأدوات الحالية تشبه الطهاة المبتدئين: يمكنهم استبدال مكون (استبدال الفارس)، ولكن إذا طلبت منهم خلط مكونين تماماً وإضافة نكهة توابل معينة في آن واحد، فإن الطبخة عادة ما تخرج فوضوية. قد يبدو الروبوت كأنه فارس، أو قد يطمس أسلوب اللوحة الزيتية تفاصيل الروبوت.

إليك TP-Blend (اقتران انتباه المطالب النصية - Textual-Prompt Attention Pairing). فكر في هذا كـ مطبخ رئيسي طاهٍ محترف يمكنه التعامل مع ثلاث مهام معقدة في وقت واحد دون الحاجة إلى إعادة تدريبه أو تعليمه وصفات جديدة. إنه يأخذ تعليمتين منفصلتين: واحدة لـ الشيء الذي تريد إنشاءه، والأخرى لـ الأسلوب الذي تريد تطبيقه، ويمزجهما معاً بشكل مثالي.

إليك كيف يعمل، مقسماً إلى استعارات بسيطة:

1. العقل ذو الرأسين (آلية المطالب المزدوجة)

تحاول معظم المحررات القيام بكل شيء بعقل واحد، مما يسبب لها الارتباك. يستخدم TP-Blend عقلاً ذا رأسين.

  • الرأس (أ) (الشيء): يركز بحت على ماهية الشيء (مثلاً: "اصنع فارساً").
  • الرأس (ب) (الأسلوب): يركز بحت على كيفية مظهره (مثلاً: "اجعله يبدو كلوحة فن البوب - Pop Art").
    هذان الرأسان يتحدثان مع بعضهما البعض لكنهما لا يعيقان بعضهما البعض. هذا يضمن بقاء الشيء قابلاً للتمييز مع تطبيق الأسلوب بشكل مثالي.

2. الناقل الذكي (دمج الكائنات عبر الانتباه المتقاطع - CAOF)

تخيل أنك تحاول دمج مجموعتين من قطع الليغو: المجموعة الأولى هي "كلب" والثانية هي "قطة". أنت لا تريد مجرد سحقهم معاً؛ بل تريد أن تستقر آذان الكلب تماماً فوق رأس القطة.

يستخدم TP-Blend تقنية تسمى النقل الأمثل (Optimal Transport). فكر في هذا كـ شاحنة نقل فائقة الذكاء.

  • بدلاً من لصق أجزاء "الكلب" بأجزاء "القطة" عشوائياً؛ تقوم الشاحنة بحساب أفضل مكان لكل قطعة بدقة.
  • تنظر إلى قطع "الكلب" وتسأل: "أي من هذه القطع تناسب هيكل 'القطة' بشكل أفضل؟"
  • ثم تنقل ميزات "الكلب" إلى تلك المواضع المحددة.
  • النتيجة: تحصل على هجين "قط-كلب" حيث تندمج الميزات بسلاسة، وليس مجرد كومة فوضوية من القطع. إنها تحافظ على شكل ومنطق المخلوق الجديد.

3. فنان الملمس (دمج الأسلوب عبر الانتباه الذاتي - SASF)

الآن، تخيل أن لديك منحوتة "القط-الكلب" المثالية، لكنها تبدو كأنها لعبة بلاستيكية ناعمة. تريدها أن تبدو كلوحة زيتية خشنة وذات ملمس بارز مع ضربات فرشاة واضحة.

الطرق القديمة ستحاول الرسم فوق الشيء بأكم، مما يؤدي غالباً إلى طمس التفاصيل أو جعل "القط-الكلب" يبدو كلوحة عامة. يستخدم TP-Blend مرشحاً حساساً للتفاصيل:

  • مرشح التردد المنخفض (صانع السموذي): يقوم بفصل الأجزاء "الناعمة" من الصورة (الأشكال الكبيرة، الوضعية) عن الأجزاء "الخشنة" (ضربات الفرشاة، الحبيبات).
  • الحقن: يأخذ الملمس الخشن عالي التردد من أسلوب "اللوحة الزيتية" ويحقن تلك الأجزاء الخشنة فقط في "القط-الكلب".
  • السحر: الأشكال الكبيرة (وضعية القط-الكلب) تبقى في مكانها تماماً، لكن السطح يبدو فجأة وكأنه رُسم بيد بشرية باستخدام فرشاة. إنه يلتقط "روح" الأسلوب دون تدمير الشيء.

4. خدعة الاستبدال (استبدال المفتاح/القيمة)

للتأكد من ثبات الأسلوب، يقوم TP-Blend بخدعة صغيرة مع ذاكرة الكمبيوتر.

  • تخيل أن الكمبيوتر يكتب قصة عن "القط-الكلب".
  • يقوم TP-Blend سراً باستبدال "بطاقات الذاكرة" (مصفوفات المفتاح والقيمة) المستخدمة لوصف الملمس ببطاقات من مطالب "اللوحة الزيتية".
  • هذا يجبر الكمبيوتر على كتابة القصة باستخدام مفردات اللوحة الزيتية، مما يضمن أنه في كل مرة يرسم فيها خطاً، يفكر: "يجب أن يبدو هذا كطلاء سميك"، بدلاً من "يجب أن يبدو هذا كصورة فوتوغرافية".

لماذا يعد هذا أمراً هاماً؟

  • لا حاجة للتدريب: لا تحتاج لتغذية البرنامج بآلاف الصور ليتعلم كيفية القيام بذلك. إنه يعمل مباشرة مع أي وصف نصي.
  • الدقة: هو لا "يخمن" فحسب. بل يحسب رياضياً مكان كل بكسل يجب أن يذهب ليجعل الدمج يبدو حقيقياً.
  • السرعة: يقوم بكل هذا في تمريرة واحدة، مما يجعله سريعاً بما يكفي للاستخدام في الأدوات الإبداعية في الوقت الفعلي.

باختصار: TP-Blend يشبه امتلاك خيميائي رقمي يمكنه أخذ "فارس"، و"باتمان"، وأسلوب "فن البوب"، وخلطهم جميعاً في كأس واحد، ثم استخراج صورة مثالية عالية الدقة لـ "باتمان-فارس" مرسوم بأسلوب فن البوب، دون فوضى أو أخطاء. إنه يحل مشكلة "الخليط المستحيل" التي حيرت محررات الذكاء الاصطناعي الأخرى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →