-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 22 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 10 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 22 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 22
Inference Optimization
community
AI & ML interests
None defined yet.
Recent Activity
View all activity
-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 22 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 10 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 22 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 22
Tiny models used for testing
models 247
inference-optimization/DeepSeek-V4-Pro-0.5B-A0.37B-NVFP4-FP8
0.4B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt7
2B • Updated
inference-optimization/DeepSeek-V4-Pro-0.5B-A0.37B
Text Generation • 0.5B • Updated
inference-optimization/Qwen3.5-397B-A17B-FP8-dynamic-mtp
Image-Text-to-Text • 397B • Updated
inference-optimization/temporary-3-layer-Qwen3-VL-1.0B-A0.4B-Instruct
Image-Text-to-Text • 1B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt6
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-v2-ckpt0
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-v2-ckpt8
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt5
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt4
2B • Updated
datasets 28
inference-optimization/qwen3-test-model
Updated
inference-optimization/dflash-qwen3-8b-qwen235b-instruct-bs16-prepared-data
Preview • Updated • 50
inference-optimization/every-eval-ever-demo
Viewer • Updated • 1 • 17
inference-optimization/DeepSeek-V4-Flash-responses
Viewer • Updated • 508k • 54
inference-optimization/Qwen3.5-4B-responses
Viewer • Updated • 7.47k • 37
inference-optimization/Qwen3.5-0.8B-responses
Viewer • Updated • 7.47k • 136
inference-optimization/Qwen3.5-9B-responses
Viewer • Updated • 7.67k • 67
inference-optimization/Qwen3-8B-Regenerated-Collection
Preview • Updated • 207
inference-optimization/Qwen3-30B-A3B-responses
Preview • Updated • 85
inference-optimization/gpt-oss-120b-responses
Preview • Updated • 84