RLHFlow on Hugging Face: downloads and rankings
RLHFlow has 37 tracked models, downloaded 23,939 times in the last 30 days and 1,097,738 times in total; 88 datasets, downloaded 5,280 times in the last 30 days. RLHFlow Wrapped: the last 12 months.
Models by downloads in the last 30 days
- RLHFlow/ArmoRM-Llama3-8B-v0.1 16.1K downloads, text classification
- RLHFlow/Llama3.1-8B-PRM-Deepseek-Data 5.3K downloads, text generation
- RLHFlow/LLaMA3-SFT-v2 557 downloads, text generation
- RLHFlow/LLaMA3-SFT 461 downloads, text generation
- RLHFlow/pair-preference-model-LLaMA3-8B 335 downloads, text generation
- RLHFlow/LLaMA3-iterative-DPO-final 289 downloads, text generation
- RLHFlow/Llama3.1-8B-PRM-Mistral-Data 170 downloads, text generation
- RLHFlow/Llama3.1-8B-ORM-Mistral-Data 146 downloads, text generation
- RLHFlow/RewardModel-Mistral-7B-for-DPA-v1 144 downloads, text classification
- RLHFlow/Llama3-v2-iterative-DPO-iter3 75 downloads, text generation
- RLHFlow/Llama3.1-8B-ORM-Deepseek-Data 42 downloads, text generation
- RLHFlow/Qwen2.5-Math-7B-Zero-RAFTpp 26 downloads, text generation
- RLHFlow/Decision-Tree-Reward-Llama-3.1-8B 26 downloads, text classification
- RLHFlow/Llama3-SFT-v2.0-epoch2 25 downloads, text generation
- RLHFlow/LLaMA3.2-3B-SFT 23 downloads, text generation
- RLHFlow/DPA-v1-Mistral-7B 22 downloads, text generation
- RLHFlow/Qwen2.5-7B-PPO-Zero 20 downloads, model
- RLHFlow/Llama3-v2-iterative-DPO-iter1 20 downloads, text generation
- RLHFlow/Qwen2.5-7B-DPO-Zero 19 downloads, model
- RLHFlow/Llama3-v2-iterative-DPO-iter2 19 downloads, text generation
- RLHFlow/LLaMA3.2-1B-SFT 18 downloads, text generation
- RLHFlow/Llama3-SFT-v2.0-epoch3 18 downloads, text generation
- RLHFlow/Decision-Tree-Reward-Gemma-2-27B 18 downloads, text classification
- RLHFlow/Qwen2.5-7B-DPO 17 downloads, model
- RLHFlow/Qwen2.5-Math-7B-Zero-Reinforce-Rej 17 downloads, text generation
- RLHFlow/Qwen2.5-7B-SFT 15 downloads, model
- RLHFlow/Llama3-SFT-v2.0-epoch1 13 downloads, text generation
- RLHFlow/Qwen2.5-7B-RAFT-Zero 13 downloads, model
- RLHFlow/Qwen2.5-Math-7B-Reinforce-Ada-balance-hard 12 downloads, model
- RLHFlow/Llama-3.2-3B-Instruct-Reinforce-Ada-balance-hard 10 downloads, model
- RLHFlow/Qwen3-4B-Instruct-2507-Reinforce-Ada-balance-hard 9 downloads, model
- RLHFlow/Qwen2.5-Math-7B-Reinforce-Ada-balance-easy 8 downloads, model
- RLHFlow/Qwen2.5-Math-1-5B-Reinforce-Ada-balance-easy 7 downloads, model
- RLHFlow/Qwen2.5-Math-1.5B-DAPO-easy 7 downloads, model
- RLHFlow/Qwen2.5-Math-1-5B-Reinforce-Ada-balance-hard 6 downloads, model
- RLHFlow/Qwen2.5-Math-1.5B-GRPO-n8-easy 6 downloads, model
- RLHFlow/Qwen2.5-7B-DPO-NLL-Zero 3 downloads, model
Datasets by downloads in the last 30 days
- RLHFlow/HH-RLHF-Helpful-standard 609 downloads
- RLHFlow/UltraFeedback-preference-standard 549 downloads
- RLHFlow/Helpsteer-preference-standard 269 downloads
- RLHFlow/PKU-SafeRLHF-30K-standard 220 downloads
- RLHFlow/prompt-collection-v0.1 218 downloads
- RLHFlow/Argilla-Math-DPO-standard 205 downloads
- RLHFlow/CodeUltraFeedback-standard 194 downloads
- RLHFlow/UltraInteract-filtered-standard 193 downloads
- RLHFlow/Capybara-distibalel-Filter-standard 193 downloads
- RLHFlow/Orca-distibalel-standard 177 downloads
- RLHFlow/RLHFlow-SFT-Dataset-ver2 166 downloads
- RLHFlow/Prometheus2-preference-standard 138 downloads
- RLHFlow/Deepseek-PRM-Data 118 downloads
- RLHFlow/SHP-standard 103 downloads
- RLHFlow/Mistral-PRM-Data 86 downloads
- RLHFlow/pair_data_v2_80K_wsafety 78 downloads
- RLHFlow/iterative-prompt-v1-iter1-20K 65 downloads
- RLHFlow/pair-preference-dataset-mix1 58 downloads
- RLHFlow/iterative-prompt-v1-iter2-20K 58 downloads
- RLHFlow/SFT-OpenHermes-2.5-Standard 55 downloads
- RLHFlow/Deepseek-MATH500-Test 53 downloads
- RLHFlow/Deepseek-ORM-Data 49 downloads
- RLHFlow/pair_preference_model_dataset 49 downloads
- RLHFlow/Mistral-ORM-Data 47 downloads
- RLHFlow/prm80k-phase2 46 downloads
- RLHFlow/pair-preference-dataset-700K 44 downloads
- RLHFlow/LLM-Preferences-HelpSteer2 44 downloads
- RLHFlow/iterative-prompt-v1-iter3-20K 42 downloads
- RLHFlow/reinforce_ada_hard_prompt 39 downloads
- RLHFlow/HH-RLHF-Harmless-and-RedTeam-standard 39 downloads
- RLHFlow/Deepseek-ORM-Data-Pairwise 39 downloads
- RLHFlow/numia_prompt_dpo3 37 downloads
- RLHFlow/self_rewarding_sft_prompt 36 downloads
- RLHFlow/Mistral-MATH500-Test 33 downloads
- RLHFlow/self_rewarding_ift_example_raw_data1 33 downloads
- RLHFlow/pair_data_v2_80K_wsafety_short 31 downloads
- RLHFlow/Mistral-GSM8K-Test 30 downloads
- RLHFlow/qwq_gen_sft_15k 29 downloads
- RLHFlow/Deepseek-GSM8K-Test 27 downloads
- RLHFlow/self_rewarding_rl_prompt 27 downloads
- RLHFlow/numia_prompt_dpo_test 27 downloads
- RLHFlow/iterative-prompt-v1-iter6-20K 26 downloads
- RLHFlow/iterative-prompt-v1-iter7-20K 26 downloads
- RLHFlow/reinforce_ada_hard_prompt_1-5b 26 downloads
- RLHFlow/self_rewarding_turn1_with_rewards_example 26 downloads
- RLHFlow/DS-and-Mistral-PRM-Data 25 downloads
- RLHFlow/reinforce_ada_hard_prompt_llama 24 downloads
- RLHFlow/numia_prompt_ppo 24 downloads
- RLHFlow/numia_prompt_dpo6 24 downloads
- RLHFlow/ArmoRM-Multi-Objective-Data-v0.2 23 downloads
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.