divelab/opdlm_train_data download history
divelab/opdlm_train_data is a text generation dataset on the Hugging Face Hub. In the last 30 days it was downloaded 66 times (13 in the last 7 days), and 699 times in total. It ranks #154,071 among datasets by monthly downloads.
General-Purpose OPDLM Post-Training Dataset Post-training data used to convert autoregressive language models (ARLMs) into block diffusion language models (DLMs) via on-policy distillation, as described in OPDLM. arXiv report: arxiv.org/abs/2606.06712 Overview The corpu
Models trained on opdlm_train_data
4 models list it as training data.
- divelab/OPDLM-0.6B 203 downloads in 30 days
- divelab/OPDLM-4B 93 downloads in 30 days
- divelab/OPDLM-1.7B 63 downloads in 30 days
- divelab/OPDLM-8B 56 downloads in 30 days
Open divelab/opdlm_train_data on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.