hahayhe/prm800k-step-reward-dedup-balanced download history
hahayhe/prm800k-step-reward-dedup-balanced is a dataset on the Hugging Face Hub. In the last 30 days it was downloaded 21 times (15 in the last 7 days), and 156 times in total. It ranks #361,848 among datasets by monthly downloads.
📊 PRM800K Step Reward 平衡数据集 本数据集是 PRM800K 的一个平衡且去重的版本,专为训练数学推理任务中的步骤级奖励模型(step-level reward model)而设计。它有效解决了原始数据中存在的类别不平衡、长尾分布以及重复样本等问题。 🎯 构建目标 本数据集旨在构建一个高质量、结构合理的训练集,满足以下四个核心原则: 正负样本对平衡:确保每个问题中正确与错误的最终步骤数量均衡; 保留全部长尾样本:对于样本稀少的问题(pair 数量 ≤ 300),全部保留; 长度分布均衡:在不同推理步长(completion 长度)之间进行均衡采样; 去除重复样本:同一问
Open hahayhe/prm800k-step-reward-dedup-balanced on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.