Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
Dit artikel introduceert Honey-Data-15M, een hoogwaardige dataset van 15 miljoen paren met dubbel niveau Chain-of-Thought-verrijking, samen met de HoneyPipe-curatieroute en het Bee-8B-model, die gezamenlijk aantonen dat principiële verbeteringen van de datakwaliteit volledig open multimodale grote taalmodellen in staat kunnen stellen state-of-the-art prestaties te behalen die concurreren met die van semi-open tegenhangers.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.