xinlai/Math-Step-DPO-10K download history
xinlai/Math-Step-DPO-10K is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 578 times (20 in the last 7 days), and 19,043 times in total. It ranks #29,502 among datasets by monthly downloads.
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs 🖥️Code | 🤗Data | 📄Paper This repo contains the Math-Step-DPO-10K dataset for our paper Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs, Step-DPO is a simple, effective, and data-effic
Models trained on Math-Step-DPO-10K
18 models list it as training data.
- mradermacher/Qwen3-Nemotron-14B-BRRM-i1-GGUF 1.4K downloads in 30 days
- mradermacher/Qwen3-Nemotron-8B-BRRM-i1-GGUF 1.1K downloads in 30 days
- mradermacher/Gilded-Arsenic-12B-i1-GGUF 1.1K downloads in 30 days
- mradermacher/Qwen3-Nemotron-8B-BRRM-GGUF 789 downloads in 30 days
- mradermacher/Qwen3-Nemotron-14B-BRRM-GGUF 649 downloads in 30 days
- mradermacher/Gilded-Arsenic-12B-GGUF 309 downloads in 30 days
- nvidia/Qwen3-Nemotron-8B-BRRM 308 downloads in 30 days
- nvidia/Qwen3-Nemotron-14B-BRRM 159 downloads in 30 days
- Lambent/Gilded-Arsenic-12B 73 downloads in 30 days
- HenryShan/Qwen2.5-Math-7B-DPO-10K 49 downloads in 30 days
- rasdani/qwen2-math-7b-step-dpo 32 downloads in 30 days
- Lambent/Gilded-Arsenic-12B-Q4_K_M-GGUF 28 downloads in 30 days
Open xinlai/Math-Step-DPO-10K on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.