inference-optimization on Hugging Face: model downloads
inference-optimization has 467 tracked models, downloaded 121,625 times in the last 30 days and 577,649 times in total. inference-optimization Wrapped: the last 12 months.
Models by downloads in the last 30 days
- inference-optimization/Llama-3.2-0.5B-Instruct 21.9K downloads, text generation
- inference-optimization/Qwen3-1.6B-A0.9B 15.3K downloads, text generation
- inference-optimization/Qwen3-8B-from-Qwen3-8B_regen-speculators.eagle3-qwen3arch-ckpt1 8K downloads, model
- inference-optimization/Qwen3-8B-speculators.peagle-qwen3arch-ckpt4 8K downloads, model
- inference-optimization/Qwen3-Coder-Next.w4a16 6.7K downloads, text generation
- inference-optimization/DeepSeek-V3-debug-empty-FP8_DYNAMIC 5.6K downloads, model
- inference-optimization/GLM-5.2-0.8B-A0.8B 5.3K downloads, text generation
- inference-optimization/DSV4-tiny-empty 5.2K downloads, model
- inference-optimization/Qwen3.8-1.0B-A0.6B 4.8K downloads, text generation
- inference-optimization/NemotronH-0.3B-A0.3B 3.6K downloads, text generation
- inference-optimization/Kimi-K3-0.40B-MXFP4 3.3K downloads, model
- inference-optimization/qwe3-8B-selfdistill-v3-fresh3ep_ckpt0 2.1K downloads, model
- inference-optimization/GLM-5.3-Flash-0.1B-A0.1B 1.7K downloads, image text to text
- inference-optimization/Qwen3-8B-speculator.dspark.swa.dpace.fullvocab.muon.2048anc.combdatav4-q235b-instr-v1-ckpt2 1.4K downloads, model
- inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.2048anc.combdatav3-q235b-instr-v9-ckpt19 1.4K downloads, model
- inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.2048anc.combdatav3-q235b-instr-v9-ckpt16 1.4K downloads, model
- inference-optimization/gemma-4-1B-0.8B-tiny 1.3K downloads, model
- inference-optimization/Qwen3.8-Flash-Next-0.2B-A0.2B 1.1K downloads, image text to text
- inference-optimization/Qwen3.6-8B-A1.6B 1K downloads, image text to text
- inference-optimization/DeepSeek-V3-debug-empty 1K downloads, model
- inference-optimization/Kimi-K3-0.40B 959 downloads, feature extraction
- inference-optimization/GLM-5.3-0.6B-A0.4B 860 downloads, text generation
- inference-optimization/Inkling-0.6B-A0.6B 821 downloads, image text to text
- inference-optimization/Qwen3-VL-Reranker-0.1B-tiny 820 downloads, model
- inference-optimization/DeepSeek-V4-Pro-0.5B-A0.37B 799 downloads, text generation
- inference-optimization/Phi-3.5-MoE-0.8B-A0.2B 796 downloads, text generation
- inference-optimization/Qwen3-VL-1.0B-A0.4B-Instruct 795 downloads, image text to text
- inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.2048anc.combdatav3-q235b-instr-v9-ckpt12 788 downloads, model
- inference-optimization/Llama-4-Scout-1.7B-0.4B-Instruct 779 downloads, image text to text
- inference-optimization/gpt-oss-2.5B-A1.3B 743 downloads, model
- inference-optimization/gemma-4-unified-0.8B-tiny 743 downloads, model
- inference-optimization/granite-vision-4.1-0.2B-tiny 734 downloads, model
- inference-optimization/Llama-3.2-1B-Instruct-FP8-Block 645 downloads, model
- inference-optimization/Qwen3-0.6B-W4A16-G128 466 downloads, model
- inference-optimization/DeepSeek-V3-debug-empty-NVFP4A16 429 downloads, model
- inference-optimization/Nemotron-3.5-Lightning-1.4B-A0.1B-MTP 296 downloads, text generation
- inference-optimization/Qwen3-30B-A3B-Thinking-2507-REAP-25-uniform 257 downloads, text generation
- inference-optimization/Qwen3-0.6B-FP8_BLOCK 234 downloads, model
- inference-optimization/ZAYA1-74B-preview-NVFP4 218 downloads, text generation
- inference-optimization/GLM-5.3-Flash-0.1B-A0.1B-MTP 174 downloads, model
- inference-optimization/Qwen3-30B-A3B-Thinking-2507-REAP-25-nonuniform 163 downloads, text generation
- inference-optimization/Qwen3.8-27B-DSpark-PerfectBlend-NVFP4-W4A4 154 downloads, text generation
- inference-optimization/sarvam-30b-NVFP4 154 downloads, text generation
- inference-optimization/Qwen3.8-27B-DSpark-Gauss-NVFP4-W4A4 153 downloads, text generation
- inference-optimization/Qwen3-8B-DFlash-Gauss-NVFP4-W4A4 112 downloads, text generation
- inference-optimization/GLM-5.3-Flash-MEP50 109 downloads, model
- inference-optimization/Qwen3-8B-DFlash-PerfectBlend-NVFP4-W4A4 108 downloads, text generation
- inference-optimization/Kimi-K3-0.40B-NVFP4 105 downloads, model
- inference-optimization/Qwen3.8-Flash-Next-MEP50 104 downloads, model
- inference-optimization/Qwen3.8-1.0B-A0.6B-NVFP4-FP8-REAP-25 96 downloads, model
- inference-optimization/Qwen3-Coder-Next.w8a8 94 downloads, text generation
- inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.v2.epoch1_end 88 downloads, model
- inference-optimization/DeepSeek-R1-Distill-Llama-8B-NVFP4 86 downloads, text generation
- inference-optimization/dspark-inkling-small 74 downloads, model
- inference-optimization/dflash-DeepSeek-V4-Flash-all-swa-muon-speculators-50k 71 downloads, model
- inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.1536anc.codemultilang.v3-v7-ckpt2 65 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.regencollection.selfdistill-v3-epoch2 60 downloads, model
- inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.epoch1_step93171 55 downloads, model
- inference-optimization/Qwen3.8-Flash-Next-0.2B-A0.2B-MTP 54 downloads, model
- inference-optimization/thinkingmachines-Inkling-speculator.dflash 54 downloads, model
- inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp4 50 downloads, model
- inference-optimization/Qwen3.8-27B-DSpark-GPTQ-IMatrix-PerfectBlend-NVFP4-W4A4 50 downloads, text generation
- inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.1536anc.nemotron.v2v3-v8-ckpt19 49 downloads, model
- inference-optimization/Qwen3.8-27B-DSpark-FP8-DYNAMIC 48 downloads, text generation
- inference-optimization/Qwen3-235B-A22B-Thinking-2507-quantized.w4a16 48 downloads, text generation
- inference-optimization/Qwen3.8-27B-DSpark-GPTQ-PerfectBlend-NVFP4-W4A4 47 downloads, text generation
- inference-optimization/Qwen3.8-27B-DSpark-GPTQ-IMatrix-Gauss-NVFP4-W4A4 47 downloads, text generation
- inference-optimization/Qwen3.8-27B-DSpark-PerfectBlend-FP8-W8A8 45 downloads, text generation
- inference-optimization/Qwen3.8-1.0B-A0.6B-NVFP4-FP8 45 downloads, model
- inference-optimization/Qwen3.8-27B-DSpark-Gauss-FP8-W8A8 45 downloads, text generation
- inference-optimization/Qwen3.8-27B-DSpark-GPTQ-Gauss-NVFP4-W4A4 45 downloads, text generation
- inference-optimization/dflash-DeepSeek-V4-Flash-speculators-50k 43 downloads, model
- inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp2 41 downloads, model
- inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp3 41 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.regencollection.selfdistill-v3-epoch0 40 downloads, model
- inference-optimization/Qwen3.8-27B-DSpark-FP8-BLOCK 40 downloads, text generation
- inference-optimization/Qwen3-8B-DFlash-FP8-DYNAMIC 39 downloads, text generation
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.regencollection.selfdistill-v3-epoch1 39 downloads, model
- inference-optimization/Qwen3-8B-DFlash-GPTQ-IMatrix-PerfectBlend-NVFP4-W4A4 38 downloads, text generation
- inference-optimization/qwen38-dspark-pretrain-fineweb 36 downloads, model
- inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp0 36 downloads, model
- inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp1 36 downloads, model
- inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.v2.epoch1_step107505 35 downloads, model
- inference-optimization/ctest-Qwen3-8B-speculator.dspark-fp8ablation-fp8 35 downloads, model
- inference-optimization/Qwen3-8B-DFlash-GPTQ-IMatrix-Gauss-NVFP4-W4A4 34 downloads, text generation
- inference-optimization/ctest-Qwen3-8B-speculator.dspark-fp8ablation-bf16 34 downloads, model
- inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.1536anc-v3-ckpt7 33 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt4 32 downloads, model
- inference-optimization/DeepSeek-V3-debug-multiply-FP8_DYNAMIC 32 downloads, model
- inference-optimization/DeepSeek-V3-debug-multiply 31 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt1 31 downloads, model
- inference-optimization/Qwen3-8B-DFlash-FP8-BLOCK 31 downloads, text generation
- inference-optimization/Qwen3-8B-DFlash-Gauss-FP8-W8A8 31 downloads, text generation
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt3 30 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt7 30 downloads, model
- inference-optimization/Qwen3-8B-DFlash-GPTQ-Gauss-NVFP4-W4A4 30 downloads, text generation
- inference-optimization/Qwen3-8B-speculator.dflash2.v1.fullvocab.muon.dpace-preresume-epoch2 30 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.2048anc.muon.combdatav4-qwen235b-instr-v1-ckpt2 30 downloads, model
- inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt8 29 downloads, model
- inference-optimization/Qwen3-8B-DFlash-GPTQ-PerfectBlend-NVFP4-W4A4 29 downloads, text generation