AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
يقدم AlignTok استراتيجية محاذاة ثلاثية المراحل تعمل على تكييف المشفرات البصرية التأسيسية سابقة التدريب لتصبح أجهزة ترميز غنية دلالياً، مما يسرع بشكل كبير من تقارب نماذج الانتشار ويحسن جودة توليد الصور مقارنة بمشفرات VAE التقليدية.