PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle
تُعد PixVL إطار عمل للتدريب اللاحق ذاتي الإشراف يعالج ندرة أزواج القناع-النص والتداخل التحسيني في النماذج اللغوية الكبيرة متعددة الوسائط على مستوى البكسل، وذلك من خلال تقديم دورة اتساق القناع-النص موحدة تتميز بالتحقق الدلالي المدرك للمُربك، والاتساق عبر الرؤى، والتعلم ثنائي الاتجاه المقترن بالجودة لتعزيز قدرات فهم المناطق وتقسيمها بشكل متبادل.