superAVTR/wikipedia_en_512_for_pretraining download history
superAVTR/wikipedia_en_512_for_pretraining is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 212 times (54 in the last 7 days), and 212 times in total. It ranks #64,470 among datasets by monthly downloads.
Cleaned Wikipedia 512 Pretraining Dataset Dataset Description This dataset is a cleaned version of the Hugging Face dataset lucadiliello/wikipedia_512_pretraining. The original dataset contains English Wikipedia text prepared for language-model pretraining. This deriva
Models trained on wikipedia_en_512_for_pretraining
1 models list it as training data.
- superAVTR/tinizong-46M_v1.1 707 downloads in 30 days
Open superAVTR/wikipedia_en_512_for_pretraining on Hugging Face