inference-optimization on Hugging Face: model downloads

inference-optimization has 467 tracked models, downloaded 121,625 times in the last 30 days and 577,649 times in total. inference-optimization Wrapped: the last 12 months.

Models by downloads in the last 30 days

  1. inference-optimization/Llama-3.2-0.5B-Instruct 21.9K downloads, text generation
  2. inference-optimization/Qwen3-1.6B-A0.9B 15.3K downloads, text generation
  3. inference-optimization/Qwen3-8B-from-Qwen3-8B_regen-speculators.eagle3-qwen3arch-ckpt1 8K downloads, model
  4. inference-optimization/Qwen3-8B-speculators.peagle-qwen3arch-ckpt4 8K downloads, model
  5. inference-optimization/Qwen3-Coder-Next.w4a16 6.7K downloads, text generation
  6. inference-optimization/DeepSeek-V3-debug-empty-FP8_DYNAMIC 5.6K downloads, model
  7. inference-optimization/GLM-5.2-0.8B-A0.8B 5.3K downloads, text generation
  8. inference-optimization/DSV4-tiny-empty 5.2K downloads, model
  9. inference-optimization/Qwen3.8-1.0B-A0.6B 4.8K downloads, text generation
  10. inference-optimization/NemotronH-0.3B-A0.3B 3.6K downloads, text generation
  11. inference-optimization/Kimi-K3-0.40B-MXFP4 3.3K downloads, model
  12. inference-optimization/qwe3-8B-selfdistill-v3-fresh3ep_ckpt0 2.1K downloads, model
  13. inference-optimization/GLM-5.3-Flash-0.1B-A0.1B 1.7K downloads, image text to text
  14. inference-optimization/Qwen3-8B-speculator.dspark.swa.dpace.fullvocab.muon.2048anc.combdatav4-q235b-instr-v1-ckpt2 1.4K downloads, model
  15. inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.2048anc.combdatav3-q235b-instr-v9-ckpt19 1.4K downloads, model
  16. inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.2048anc.combdatav3-q235b-instr-v9-ckpt16 1.4K downloads, model
  17. inference-optimization/gemma-4-1B-0.8B-tiny 1.3K downloads, model
  18. inference-optimization/Qwen3.8-Flash-Next-0.2B-A0.2B 1.1K downloads, image text to text
  19. inference-optimization/Qwen3.6-8B-A1.6B 1K downloads, image text to text
  20. inference-optimization/DeepSeek-V3-debug-empty 1K downloads, model
  21. inference-optimization/Kimi-K3-0.40B 959 downloads, feature extraction
  22. inference-optimization/GLM-5.3-0.6B-A0.4B 860 downloads, text generation
  23. inference-optimization/Inkling-0.6B-A0.6B 821 downloads, image text to text
  24. inference-optimization/Qwen3-VL-Reranker-0.1B-tiny 820 downloads, model
  25. inference-optimization/DeepSeek-V4-Pro-0.5B-A0.37B 799 downloads, text generation
  26. inference-optimization/Phi-3.5-MoE-0.8B-A0.2B 796 downloads, text generation
  27. inference-optimization/Qwen3-VL-1.0B-A0.4B-Instruct 795 downloads, image text to text
  28. inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.2048anc.combdatav3-q235b-instr-v9-ckpt12 788 downloads, model
  29. inference-optimization/Llama-4-Scout-1.7B-0.4B-Instruct 779 downloads, image text to text
  30. inference-optimization/gpt-oss-2.5B-A1.3B 743 downloads, model
  31. inference-optimization/gemma-4-unified-0.8B-tiny 743 downloads, model
  32. inference-optimization/granite-vision-4.1-0.2B-tiny 734 downloads, model
  33. inference-optimization/Llama-3.2-1B-Instruct-FP8-Block 645 downloads, model
  34. inference-optimization/Qwen3-0.6B-W4A16-G128 466 downloads, model
  35. inference-optimization/DeepSeek-V3-debug-empty-NVFP4A16 429 downloads, model
  36. inference-optimization/Nemotron-3.5-Lightning-1.4B-A0.1B-MTP 296 downloads, text generation
  37. inference-optimization/Qwen3-30B-A3B-Thinking-2507-REAP-25-uniform 257 downloads, text generation
  38. inference-optimization/Qwen3-0.6B-FP8_BLOCK 234 downloads, model
  39. inference-optimization/ZAYA1-74B-preview-NVFP4 218 downloads, text generation
  40. inference-optimization/GLM-5.3-Flash-0.1B-A0.1B-MTP 174 downloads, model
  41. inference-optimization/Qwen3-30B-A3B-Thinking-2507-REAP-25-nonuniform 163 downloads, text generation
  42. inference-optimization/Qwen3.8-27B-DSpark-PerfectBlend-NVFP4-W4A4 154 downloads, text generation
  43. inference-optimization/sarvam-30b-NVFP4 154 downloads, text generation
  44. inference-optimization/Qwen3.8-27B-DSpark-Gauss-NVFP4-W4A4 153 downloads, text generation
  45. inference-optimization/Qwen3-8B-DFlash-Gauss-NVFP4-W4A4 112 downloads, text generation
  46. inference-optimization/GLM-5.3-Flash-MEP50 109 downloads, model
  47. inference-optimization/Qwen3-8B-DFlash-PerfectBlend-NVFP4-W4A4 108 downloads, text generation
  48. inference-optimization/Kimi-K3-0.40B-NVFP4 105 downloads, model
  49. inference-optimization/Qwen3.8-Flash-Next-MEP50 104 downloads, model
  50. inference-optimization/Qwen3.8-1.0B-A0.6B-NVFP4-FP8-REAP-25 96 downloads, model
  51. inference-optimization/Qwen3-Coder-Next.w8a8 94 downloads, text generation
  52. inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.v2.epoch1_end 88 downloads, model
  53. inference-optimization/DeepSeek-R1-Distill-Llama-8B-NVFP4 86 downloads, text generation
  54. inference-optimization/dspark-inkling-small 74 downloads, model
  55. inference-optimization/dflash-DeepSeek-V4-Flash-all-swa-muon-speculators-50k 71 downloads, model
  56. inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.1536anc.codemultilang.v3-v7-ckpt2 65 downloads, model
  57. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.regencollection.selfdistill-v3-epoch2 60 downloads, model
  58. inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.epoch1_step93171 55 downloads, model
  59. inference-optimization/Qwen3.8-Flash-Next-0.2B-A0.2B-MTP 54 downloads, model
  60. inference-optimization/thinkingmachines-Inkling-speculator.dflash 54 downloads, model
  61. inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp4 50 downloads, model
  62. inference-optimization/Qwen3.8-27B-DSpark-GPTQ-IMatrix-PerfectBlend-NVFP4-W4A4 50 downloads, text generation
  63. inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.1536anc.nemotron.v2v3-v8-ckpt19 49 downloads, model
  64. inference-optimization/Qwen3.8-27B-DSpark-FP8-DYNAMIC 48 downloads, text generation
  65. inference-optimization/Qwen3-235B-A22B-Thinking-2507-quantized.w4a16 48 downloads, text generation
  66. inference-optimization/Qwen3.8-27B-DSpark-GPTQ-PerfectBlend-NVFP4-W4A4 47 downloads, text generation
  67. inference-optimization/Qwen3.8-27B-DSpark-GPTQ-IMatrix-Gauss-NVFP4-W4A4 47 downloads, text generation
  68. inference-optimization/Qwen3.8-27B-DSpark-PerfectBlend-FP8-W8A8 45 downloads, text generation
  69. inference-optimization/Qwen3.8-1.0B-A0.6B-NVFP4-FP8 45 downloads, model
  70. inference-optimization/Qwen3.8-27B-DSpark-Gauss-FP8-W8A8 45 downloads, text generation
  71. inference-optimization/Qwen3.8-27B-DSpark-GPTQ-Gauss-NVFP4-W4A4 45 downloads, text generation
  72. inference-optimization/dflash-DeepSeek-V4-Flash-speculators-50k 43 downloads, model
  73. inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp2 41 downloads, model
  74. inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp3 41 downloads, model
  75. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.regencollection.selfdistill-v3-epoch0 40 downloads, model
  76. inference-optimization/Qwen3.8-27B-DSpark-FP8-BLOCK 40 downloads, text generation
  77. inference-optimization/Qwen3-8B-DFlash-FP8-DYNAMIC 39 downloads, text generation
  78. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.regencollection.selfdistill-v3-epoch1 39 downloads, model
  79. inference-optimization/Qwen3-8B-DFlash-GPTQ-IMatrix-PerfectBlend-NVFP4-W4A4 38 downloads, text generation
  80. inference-optimization/qwen38-dspark-pretrain-fineweb 36 downloads, model
  81. inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp0 36 downloads, model
  82. inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.ckp1 36 downloads, model
  83. inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.v2.epoch1_step107505 35 downloads, model
  84. inference-optimization/ctest-Qwen3-8B-speculator.dspark-fp8ablation-fp8 35 downloads, model
  85. inference-optimization/Qwen3-8B-DFlash-GPTQ-IMatrix-Gauss-NVFP4-W4A4 34 downloads, text generation
  86. inference-optimization/ctest-Qwen3-8B-speculator.dspark-fp8ablation-bf16 34 downloads, model
  87. inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon.1536anc-v3-ckpt7 33 downloads, model
  88. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt4 32 downloads, model
  89. inference-optimization/DeepSeek-V3-debug-multiply-FP8_DYNAMIC 32 downloads, model
  90. inference-optimization/DeepSeek-V3-debug-multiply 31 downloads, model
  91. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt1 31 downloads, model
  92. inference-optimization/Qwen3-8B-DFlash-FP8-BLOCK 31 downloads, text generation
  93. inference-optimization/Qwen3-8B-DFlash-Gauss-FP8-W8A8 31 downloads, text generation
  94. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt3 30 downloads, model
  95. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt7 30 downloads, model
  96. inference-optimization/Qwen3-8B-DFlash-GPTQ-Gauss-NVFP4-W4A4 30 downloads, text generation
  97. inference-optimization/Qwen3-8B-speculator.dflash2.v1.fullvocab.muon.dpace-preresume-epoch2 30 downloads, model
  98. inference-optimization/Qwen3-8B-speculator.dspark.swa.2048anc.muon.combdatav4-qwen235b-instr-v1-ckpt2 30 downloads, model
  99. inference-optimization/Qwen3-8B-speculator.dspark.swa.gammatv.2048anc.muon.combdatav4-q235b-instr-v2-ckpt8 29 downloads, model
  100. inference-optimization/Qwen3-8B-DFlash-GPTQ-PerfectBlend-NVFP4-W4A4 29 downloads, text generation