Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
Este artigo apresenta o Honey-Data-15M, um conjunto de dados de alta qualidade com 15 milhões de pares e enriquecimento de Cadeia de Pensamento em dois níveis, juntamente com o pipeline de curadoria HoneyPipe e o modelo Bee-8B, demonstrando coletivamente que melhorias de qualidade de dados baseadas em princípios podem permitir que modelos de linguagem grandes multimodais totalmente abertos alcancem desempenho de última geração competitivo com contrapartes semi-abertas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.