Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
Ce papier présente Honey-Data-15M, un jeu de données de haute qualité de 15 millions de paires enrichi par une chaîne de pensée à deux niveaux, ainsi que le pipeline de curation HoneyPipe et le modèle Bee-8B, démontrant collectivement que des améliorations de la qualité des données fondées sur des principes peuvent permettre aux grands modèles de langage multimodaux entièrement ouverts d'atteindre des performances de pointe compétitives par rapport à leurs homologues semi-ouverts.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.