Carbon: Decoding the Language of Life
Der Artikel stellt Carbon vor, eine Familie effizienter, domainspezifisch angepasster generativer DNA-Sprachmodelle, die eine nicht-überlappende 6-Mer-Tokenisierung und spezialisierte Trainingsziele nutzen, um eine wettbewerbsfähige Leistung und eine deutlich schnellere Inferenz im Vergleich zu bestehenden großskaligen genomischen Modellen zu erreichen und damit die Bedeutung einer Ausrichtung des Modelldesigns auf die einzigartigen statistischen und biologischen Eigenschaften der DNA unterstreichen.