salyamq/kk-corpus-v1 download history
salyamq/kk-corpus-v1 is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 37 times (3 in the last 7 days), and 101 times in total. It ranks #232,531 among datasets by monthly downloads.
github repo: https://github.com/salyamq/kaz-datasets Kazakh Corpus v1 salyamq/kk-corpus-v1 is a cleaned and deduplicated Kazakh-language corpus for language-model pretraining, tokenizer development, and Kazakh NLP research. The corpus is derived from stukenov/sozkz-corpus-clean-v3, wh
Models trained on kk-corpus-v1
2 models list it as training data.
- salyamq/smqBERT-kk-small 503 downloads in 30 days
- salyamq/smq-tokenizer-kz 0 downloads in 30 days