papluca/language-identification download history
papluca/language-identification is a text classification dataset on the Hugging Face Hub. In the last 30 days it was downloaded 4,967 times (998 in the last 7 days), and 94,534 times in total. It ranks #5,731 among datasets by monthly downloads.
Dataset Card for Language Identification dataset Dataset Summary The Language Identification dataset is a collection of 90k samples consisting of text passages and corresponding language label. This dataset was created by collecting data from 3 sources: Multilingual Amazon Rev
Models trained on language-identification
24 models list it as training data.
- papluca/xlm-roberta-base-language-detection 394.9K downloads in 30 days
- sileod/deberta-v3-base-tasksource-nli 11K downloads in 30 days
- tasksource/deberta-small-long-nli 9.1K downloads in 30 days
- dominguesm/xlm-roberta-base-lora-language-detection 3.3K downloads in 30 days
- tasksource/deberta-base-long-nli 1.7K downloads in 30 days
- sileod/deberta-v3-large-tasksource-nli 1.1K downloads in 30 days
- onnx-community/xlm-roberta-base-language-detection-ONNX 288 downloads in 30 days
- mradermacher/GEFS-language-detector-GGUF 210 downloads in 30 days
- sileod/mdeberta-v3-base-tasksource-nli 164 downloads in 30 days
- sileod/deberta-v3-xsmall-tasksource-nli 64 downloads in 30 days
- zeroMN/SHMT 42 downloads in 30 days
- geoovn/xlm-roberta-base-language-detection-Q4_K_M-GGUF 32 downloads in 30 days