marin-community/wikipedia-markdown download history
marin-community/wikipedia-markdown is a text generation dataset on the Hugging Face Hub. In the last 30 days it was downloaded 358 times (153 in the last 7 days), and 9,941 times in total. It ranks #42,850 among datasets by monthly downloads.
Marin Markdownified Wikipedia Markdownified Wikipedia is a large-scale, pre-processed version of the English Wikipedia Enterprise HTML dump consisting of 8.59B tokens. The corpus has been converted to clean, section-aware Markdown for language-model training. Value Tokens 8 58
Models trained on wikipedia-markdown
10 models list it as training data.
- marin-community/marin-8b-base 1.8K downloads in 30 days
- mradermacher/marin-8b-base-i1-GGUF 1.5K downloads in 30 days
- mradermacher/marin-8b-base-GGUF 487 downloads in 30 days
- marin-community/marin-32b-base 466 downloads in 30 days
- KnutJaegersberg/marin-32b-base-fp16 85 downloads in 30 days
- tensorblock/marin-community_marin-8b-base-GGUF 66 downloads in 30 days
- KnutJaegersberg/marin-32b-base-Q8_0-GGUF 21 downloads in 30 days
- Bhavesh-G/AI25-3 19 downloads in 30 days
- ChipHolmes/marin-32b-base-archive 16 downloads in 30 days
- jessicata/marin-8b-base-Q8_0-GGUF 12 downloads in 30 days
Open marin-community/wikipedia-markdown on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.