Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
تُعد عائلة نماذج Molmo2 عائلة جديدة من النماذج اللغوية البصرية ذات الأوزان المفتوحة التي تحقق أداءً رائدًا في فهم الفيديو والتحديد الدقيق على مستوى البكسل، وذلك عبر الاستفادة من سبع مجموعات بيانات فيديو جُمعت حديثًا ووصفة تدريب مبتكرة، جرى تطويرها جميعًا دون الاعتماد على نماذج مملوكة لجهات أخرى.