jingyaogong/minimind_dataset download history
jingyaogong/minimind_dataset is a text generation dataset on the Hugging Face Hub. In the last 30 days it was downloaded 4,316 times (883 in the last 7 days), and 53,511 times in total. It ranks #6,398 among datasets by monthly downloads.
📌 数据介绍 Ⅰ Tokenizer 分词器可以粗略理解成 LLM 使用的一本“词典”,负责把自然语言映射成 token id,再把 token id 解码回文本;项目中也提供了train_tokenizer.py作为词表训练示例。不建议重新训练 tokenizer,因为词表和切分规则一旦变化,模型权重、数据格式、推理接口与社区生态的兼容性都会下降,也会削弱模型的传播性。同时,tokenizer 还会影响 PPL 这类按 token 统计的指标,因此跨 tokenizer 比较时,BPB(Bi
Models trained on minimind_dataset
30 models list it as training data.
- jingyaogong/minimind-3 1.8K downloads in 30 days
- zhoumiaosen/minimind-64m-sft 628 downloads in 30 days
- jingyaogong/minimind-3-gguf 621 downloads in 30 days
- zhoumiaosen/minimind-64m-pretrain 572 downloads in 30 days
- SnifferCaptain/YModel2-s0 275 downloads in 30 days
- SnifferCaptain/YModel2-s-2 258 downloads in 30 days
- jingyaogong/minimind-3-moe 216 downloads in 30 days
- PP12546/MiniPolaris-64M-Dense 191 downloads in 30 days
- diverWayne/mikky-64m 102 downloads in 30 days
- Yeeee1211/hyBird-100M 77 downloads in 30 days
- scikit-plots/minimind-3 36 downloads in 30 days
- HighCWu/Embformer-MiniMind-0.1B 21 downloads in 30 days
Open jingyaogong/minimind_dataset on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.