jingyaogong/minimind_dataset download history

jingyaogong/minimind_dataset is a text generation dataset on the Hugging Face Hub. In the last 30 days it was downloaded 4,316 times (883 in the last 7 days), and 53,511 times in total. It ranks #6,398 among datasets by monthly downloads.

📌 数据介绍 Ⅰ Tokenizer 分词器可以粗略理解成 LLM 使用的一本“词典”,负责把自然语言映射成 token id,再把 token id 解码回文本;项目中也提供了train_tokenizer.py作为词表训练示例。不建议重新训练 tokenizer,因为词表和切分规则一旦变化,模型权重、数据格式、推理接口与社区生态的兼容性都会下降,也会削弱模型的传播性。同时,tokenizer 还会影响 PPL 这类按 token 统计的指标,因此跨 tokenizer 比较时,BPB(Bi

Models trained on minimind_dataset

30 models list it as training data.

Open jingyaogong/minimind_dataset on Hugging Face

Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.