stukenov/sozkz-corpus-segmented-kk-v1 download history
stukenov/sozkz-corpus-segmented-kk-v1 is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 5 times (3 in the last 7 days), and 420 times in total. It ranks #779,199 among datasets by monthly downloads.
sozkz-corpus-segmented-kk-v1 55.5M Kazakh texts with morpheme boundaries marked by a BiLSTM neural segmenter. Built for training morpheme-aware tokenizers. Quick Start from datasets import load_dataset ds = load_dataset("stukenov/sozkz-corpus-segmented-kk-v1", split="t
Open stukenov/sozkz-corpus-segmented-kk-v1 on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.