Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
Questo articolo introduce Honey-Data-15M, un dataset di alta qualità composto da 15 milioni di coppie con arricchimento a due livelli della catena di pensiero, insieme alla pipeline di curatela HoneyPipe e al modello Bee-8B, dimostrando collettivamente che miglioramenti principiati della qualità dei dati possono consentire ai grandi modelli linguistici multimodali completamente open di raggiungere prestazioni all'avanguardia competitive con le controparti semi-open.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.