3-bit VLM base + 4-bit MTP drafter. Pair both for accelerated instruct decode. reasoning_effort baked to low.
Jorge Leon
leonsarmiento
AI & ML interests
AI for Environment
Recent Activity
updated a model about 17 hours ago
leonsarmiento/Ornith-1.5-35B-A3B-6bit-XL-mlx updated a collection about 18 hours ago
Ornith-35B-A3B updated a collection about 18 hours ago
Local SOTA for 48GB MacsOrganizations
Notable, Niche or just weird
One-off MLX quantizations that didn't fit into a model-family collection.
-
leonsarmiento/Aella-Qwen3-14B-8bit-mlx
Text Generation • 15B • Updated • 22 -
leonsarmiento/Assistant_Pepe_8B-8bit-mlx
Text Generation • 8B • Updated • 22 -
leonsarmiento/Domyn-Small-v1.0-8bit-mlx
Text Generation • 10B • Updated • 19 -
leonsarmiento/Llama-3.3-8B-Instruct-128K_Abliterated-8bit-mlx
Text Generation • 8B • Updated • 40
Agents-A1 MLX Quantizations
MLX quantizations of Agents-A1 (Qwen3.5 MoE, ~3B active). BaseQuant_XL variants.
Qwen3.6-35B-A3B MLX Quantizations
Qwen3.6-35B-A3B MoE (35B/~3B active). Vanilla + Huihui-abliterated + heretic. BaseQuant_XL recommended.
Nex-N2-mini MLX Quantizations
MLX quantizations based on Nex-N2-mini (35B MoE, ~3B active, Qwen3.5). Includes vanilla and Huihui-abliterated variants. BaseQuant_XL recommended.
GLM-4.7-Flash MLX Quantizations
MLX quantizations of zai-org/GLM-4.7-Flash (31B MoE, ~3B active). BaseQuant_XL recommended over standard variants.
Local SOTA for 48GB Macs
Best local MLX-quantized LLMs fitting 48GB unified memory. 6-bit XL variants are data-agnostic honest kings; oQ4e-XL for RAM-desperate coders.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 867 • 3 -
leonsarmiento/Qwen3.6-35B-A3B-6bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 235 -
leonsarmiento/Qwen3.6-35B-A3B-oQ4e-mtp-XL-mlx
Image-Text-to-Text • 7B • Updated • 709 • 1 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 307
Ornith-Agents-A1-merge
DARE-TIES merge of Ornith-1.0-35B and Agents-A1 (Qwen3.5-35B-A3B MoE) — BaseQuant_XL MLX quantizations
Qwen3.6-27B MLX Quantizations
MLX quantizations based on Qwen3.6-27B dense architecture. Includes vanilla and uncensored-heretic variants.
Ornith-35B-A3B
Ornith-1.0-35B MoE (35B/~3B active). Vanilla + uncensored-heretic. BaseQuant_XL recommended.
-
leonsarmiento/Ornith-1.0-35B-5bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 1.98k • 11 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 307 -
leonsarmiento/Ornith-1.0-35B-5bit-mlx
Image-Text-to-Text • 7B • Updated • 977 • 6 -
leonsarmiento/Ornith-1.0-35B-uncensored-heretic-5bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 1.85k • 3
Gemma 4 26B A4B MLX Quantizations
Gemma-4-26B-A4B QAT MoE (25.2B/3.8B active). Vanilla + Huihui-abliterated. BaseQuant_XL recommended.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 867 • 3 -
leonsarmiento/gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 71 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 106 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 175
Qwen3.8-27B MLX Quantizations
3-bit VLM base + 4-bit MTP drafter. Pair both for accelerated instruct decode. reasoning_effort baked to low.
Local SOTA for 48GB Macs
Best local MLX-quantized LLMs fitting 48GB unified memory. 6-bit XL variants are data-agnostic honest kings; oQ4e-XL for RAM-desperate coders.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 867 • 3 -
leonsarmiento/Qwen3.6-35B-A3B-6bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 235 -
leonsarmiento/Qwen3.6-35B-A3B-oQ4e-mtp-XL-mlx
Image-Text-to-Text • 7B • Updated • 709 • 1 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 307
Notable, Niche or just weird
One-off MLX quantizations that didn't fit into a model-family collection.
-
leonsarmiento/Aella-Qwen3-14B-8bit-mlx
Text Generation • 15B • Updated • 22 -
leonsarmiento/Assistant_Pepe_8B-8bit-mlx
Text Generation • 8B • Updated • 22 -
leonsarmiento/Domyn-Small-v1.0-8bit-mlx
Text Generation • 10B • Updated • 19 -
leonsarmiento/Llama-3.3-8B-Instruct-128K_Abliterated-8bit-mlx
Text Generation • 8B • Updated • 40
Ornith-Agents-A1-merge
DARE-TIES merge of Ornith-1.0-35B and Agents-A1 (Qwen3.5-35B-A3B MoE) — BaseQuant_XL MLX quantizations
Agents-A1 MLX Quantizations
MLX quantizations of Agents-A1 (Qwen3.5 MoE, ~3B active). BaseQuant_XL variants.
Qwen3.6-27B MLX Quantizations
MLX quantizations based on Qwen3.6-27B dense architecture. Includes vanilla and uncensored-heretic variants.
Qwen3.6-35B-A3B MLX Quantizations
Qwen3.6-35B-A3B MoE (35B/~3B active). Vanilla + Huihui-abliterated + heretic. BaseQuant_XL recommended.
Ornith-35B-A3B
Ornith-1.0-35B MoE (35B/~3B active). Vanilla + uncensored-heretic. BaseQuant_XL recommended.
-
leonsarmiento/Ornith-1.0-35B-5bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 1.98k • 11 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 307 -
leonsarmiento/Ornith-1.0-35B-5bit-mlx
Image-Text-to-Text • 7B • Updated • 977 • 6 -
leonsarmiento/Ornith-1.0-35B-uncensored-heretic-5bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 1.85k • 3
Nex-N2-mini MLX Quantizations
MLX quantizations based on Nex-N2-mini (35B MoE, ~3B active, Qwen3.5). Includes vanilla and Huihui-abliterated variants. BaseQuant_XL recommended.
Gemma 4 26B A4B MLX Quantizations
Gemma-4-26B-A4B QAT MoE (25.2B/3.8B active). Vanilla + Huihui-abliterated. BaseQuant_XL recommended.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 867 • 3 -
leonsarmiento/gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 71 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 7B • Updated • 106 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 8B • Updated • 175
GLM-4.7-Flash MLX Quantizations
MLX quantizations of zai-org/GLM-4.7-Flash (31B MoE, ~3B active). BaseQuant_XL recommended over standard variants.