Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
Dieser Beitrag stellt Honey-Data-15M vor, einen hochwertigen Datensatz mit 15 Millionen Paaren und einer zweistufigen Chain-of-Thought-Anreicherung, sowie die HoneyPipe-Kuratierungspipeline und das Bee-8B-Modell, die gemeinsam belegen, dass prinzipiengeleitete Verbesserungen der Datenqualität vollständig offene multimodale Large Language Models in die Lage versetzen, eine State-of-the-Art-Leistung zu erzielen, die mit semi-offenen Gegenstücken konkurrieren kann.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.