HuggingFaceBio/carbon-pretraining-corpus download history

HuggingFaceBio/carbon-pretraining-corpus is a text generation dataset on the Hugging Face Hub. In the last 30 days it was downloaded 2,484 times (482 in the last 7 days), and 23,377 times in total. It ranks #9,615 among datasets by monthly downloads.

🧬 Carbon Pretraining Corpus Description 173M DNA & RNA sequences · 1.1 trillion nucleotides — the DNA pretraining mixture used to train Carbon, a genomic foundation model. This dataset is a collection of data sources intended for training genomic foundation models, su

Models trained on carbon-pretraining-corpus

4 models list it as training data.

Open HuggingFaceBio/carbon-pretraining-corpus on Hugging Face