salyamq/kk-corpus-v1 download history

salyamq/kk-corpus-v1 is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 37 times (3 in the last 7 days), and 101 times in total. It ranks #232,531 among datasets by monthly downloads.

github repo: https://github.com/salyamq/kaz-datasets Kazakh Corpus v1 salyamq/kk-corpus-v1 is a cleaned and deduplicated Kazakh-language corpus for language-model pretraining, tokenizer development, and Kazakh NLP research. The corpus is derived from stukenov/sozkz-corpus-clean-v3, wh

Models trained on kk-corpus-v1

2 models list it as training data.

Open salyamq/kk-corpus-v1 on Hugging Face