Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
Este artículo presenta Honey-Data-15M, un conjunto de datos de alta calidad con 15 millones de pares y enriquecimiento de Cadena de Pensamiento a dos niveles, junto con el pipeline de curación HoneyPipe y el modelo Bee-8B, demostrando colectivamente que las mejoras de calidad de datos basadas en principios pueden permitir que los modelos de lenguaje grandes multimodales totalmente abiertos alcancen un rendimiento de vanguardia competitivo con sus contrapartes semiabiertas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.