RobinChen2001/TinyStories-Zh-2M download history
RobinChen2001/TinyStories-Zh-2M is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 126 times (18 in the last 7 days), and 965 times in total. It ranks #97,060 among datasets by monthly downloads.
原始数据来源为 roneneldan/TinyStories 原工作探索的问题是语言模型(LM)在文本连贯性上的表现。像早期的一些语言模型如 GPT-2,即使在一些 Common Craw 这样的语料库上大量预训练后,也很难生成长的、连贯的文本。比如前几年有一种 AI 玩具类型是做文本续写,例如彩云小梦,可以写写作文、小说什么的,如果大家玩过就知道效果其实一言难尽,和今天的大模型完全没法比,其实这就是 GPT-2 level 的续写能力。 作者就在想,会不会是因为训练的语料库太多、太宽泛,需要学习各种语法元素、词汇、知识、推理等等,才导致小语言模型(SLM)没法有一个很好的表现。作者决定专注于
Open RobinChen2001/TinyStories-Zh-2M on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.