CMLI-NLP/CUTE-Datasets download history
CMLI-NLP/CUTE-Datasets is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 428 times (95 in the last 7 days), and 91,641 times in total. It ranks #37,407 among datasets by monthly downloads.
CUTE Dataset CUTE (Chinese, Uyghur, Tibetan, English) 是一个大规模多语言数据集,专门设计用于增强低资源语言的跨语言知识迁移。数据集包含平行语料和非平行语料两部分,总规模约50GB。 数据集组成 平行语料 (24.70GB) 中文:2.62GB 英语:3.49GB 维吾尔语:7.37GB 藏语:11.22GB 非平行语料 (25.80GB) 中文:2.64GB 英语:3.49GB 维吾尔语:7.77GB 藏语:11.9
Models trained on CUTE-Datasets
1 models list it as training data.
- CMLI-NLP/CUTE-Llama – downloads in 30 days