MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
يقدم MergeTok مُجزئاً بصرياً موحداً يربط بين المشفرات التلقائية التباينية (VAEs) المستمرة ونماذج التكميم المتجهي (VQ) المنفصلة عبر الاستفادة من دمج الرموز لإنشاء أسبقية هيكلية، مما يحقق إعادة بناء عالية الدقة، وتدريباً مستقراً، وتمثيلات منظمة دلالياً مناسبة لكل من التوليد الصوري بالانتشار والتوليد الصوري بالتسلسل التكراري.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية رسم الصور. للقيام بذلك، يحتاج الروبوت إلى "قاموس" ليفهم مما تتكون الصورة. في عالم توليد الصور بالذكاء الاصطناعي، يُسمى هذا القاموس "المُجزئ" (Tokenizer).
لفترة طويلة، كان على الباحثين الاختيار بين نوعين مختلفين تمامًا من القواميس، ولم يكن أي منهما مثاليًا:
- القاموس "الناعم" (المستمر/VAE): فكر في الأمر كلوحة مائية. إنها دقيقة للغاية وناعمة، تلتقط كل تفصيل دقيق. ومع ذلك، فإن الألوان كلها مختلطة معًا في بركة كبيرة. إذا أردت من الروبوت تغيير "السماء" فقط دون إفساد "العشب"، فسيكون الأمر صعبًا لأن المعلومات كلها متشابكة.
- القاموس "المُجزأ" (المنفصل/VQ): فكر في الأمر كمجموعة "ليجو" (LEGO). إنه يقسم الصورة إلى قطع أو رموز متميزة ومنفصلة. هذا أمر رائع لجعل الروبوت يتعلم الأنماط ويبني الأشياء خطوة بخطوة (مثل كتابة قصة). ولكن، هذه القطع غالبًا ما تكون غير مستقرة؛ فأحيانًا ينسى الروبوت كيفية استخدام بعض القطع، أو تتكدس القطع معًا بطريقة تجعل الصورة تبدو ضبابية أو "منهارة".
الفكرة الكبرى: MergeTok
تساءل مؤلفو هذه الورقة البحثية، MergeTok: "لماذا لا يمكننا الحصول على نعومة الألوان المائية وهيكلية قطع الليجو في نفس القاموس؟"
لقد بنوا نظامًا جديدًا يعمل مثل مترجم ثنائي اللغة يتحدث لغتي "النعومة" و"التجزئة" في آن واحد. لم يقوموا بمجرد لصق نظامين معًا؛ بل أنشأوا جسرًا بينهما باستخدام خدعة ذكية تسمى "دمج الرموز" (Token Merging).
كيف يعمل: تشبيه "التجميع"
تخيل أنك تنظم حفلة ضخمة تضم 1000 ضيف (بكسلات الصورة).
- المشكلة: إذا حاولت التحدث إلى كل ضيف على حدًا، فسيكون الأمر فوضويًا وغير فعال. وإذا قمت بتجميعهم عشوائيًا، فستفقد التفاصيل المهمة.
- حل MergeTok: يمتلك النظام "حارسًا ذكيًا" (خوارزمية دمج الرموز) ينظر إلى الضيوف ويقول: "أنتم الثلاثة تبدون وكأنكم ترتدون قمصانًا حمراء وتتحدثون عن الرياضة. دعونا نجمعكم معًا كوحدة واحدة تسمى 'فريق رياضي'".
يحدث هذا التجميع بطريقتين لمساعدة الروبوت على التعلم:
- للجانب الناعم (VAE): يخبر النظام رسام الألوان المائية: "مهلاً، هؤلاء الثلاثة هم 'فريق رياضي'. عندما ترسمهم، تأكد من أنهم يبدون كفريق متماسك، وليس مجرد بقع حمراء عشوائية". هذا يجبر الرسم الناعم على تنظيم نفسه منطقيًا، مما يسهل التحكم فيه لاحقًا.
- للجانب المُجزأ (VQ): يخبر النظام باني الليجو: "بما أننا نعرف أن هؤلاء الثلاثة هم فريق، أعطهم ثلاث قطع ليجو مختلفة حتى لا يبدو الجميع متشابهين، ولكن تأكد من عدم حصول أي فريق آخر على تلك القطع المحددة". هذا يمنع قطع الليجو من الانهيار أو التكرار المفرط.
الجسر السحري
السر يكمه في أن قائمة "الفريق الرياضي" (التي تسمى خريطة المصدر - Source Map) يتم إنشاؤها مرة واحدة ويتم مشاركتها.
- تساعد الجانب الناعم على أن يكون منظمًا.
- تساعد الجانب المُجزأ على أن يكون مستقرًا ومتنوعًا.
الأمر الأفضل؟ الروبوت الذي يرسم الصور فعليًا (المولد) لا يعرف حتى أن هذا التجميع قد حدث. هو فقط يرى قائمة مرتبة من 256 رمزًا، جاهزة للاستخدام. الأمر يشبه قيام الحارس بكل العمل الشاق خلف الكوالما، ليتفرغ الفنان للتركيز على الرسم فقط.
ما توصلوا إليه
اختبر الباحثون هذا النظام على مجموعة ضخمة من الصور (ImageNet). وإليك ما حدث:
- صور أفضل: أعاد النظام بناء الصور بجودة أعلى (درجات "rFID" أقل) من أفضل الأنظمة "الناعمة" أو "المُجزأة" السابقة وحدها.
- تنظيم أذكى: كانت الرموز التي أنشأها أفضل بكثير في فهم معنى الصورة (مثل التمييز بين قط وكلب) مقارنة بالطرق القديمة.
- متعدد الاستخدامات: نظرًا لأنه نظام موحد، فهو يعمل بشكل مثالي مع نوعين مختلفين من فناني الذكاء الاصطناعي: أولئك الذين يبنون الصور خطوة بخطوة (Autoregressive)، وأولئك الذين يبنونها عن طريق تنظيف الضجيج (Diffusion).
الخلاصة
MergeTok هو مثل منظم بارع يأخذ حشدًا فوضويًا، ويجمعهم بشكل منطقي، ثم يسلم النتيجة إلى فنان. إنه يحل المشكلة القديمة المتمثلة في الاضطرار للاختيار بين "ناعم ولكن فوضوي" و"هيكلي ولكن غير مستقر". من خلال دمج الأجزاء المتشابهة من المعلومات معًا أثناء عملية التعلم، فإنه يخلق قاموسًا واحدًا فائق الكفاءة، وهو عالي الجودة وسهل التحكم فيه من قبل الذكاء الاصطناعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.