measured on the reference box · rebuilt on every sweep
benchmarks
26 models measured end to end on one Strix Halo box: decode and prefill throughput, time to first token, speculative accept rate, and what each run cost in memory, watts and degrees.
hardware
- SoC
- AMD Ryzen AI Max+ 395 — Strix Halo (Zen 5, 16C/28T)
- iGPU
- Radeon 8060S — RDNA 3.5, gfx1151 · Vulkan-capable
- NPU
- AMD XDNA — amdxdna driver
- Memory
- 128 GB unified LPDDR5X · ~96 GB GPU-addressable (GTT) · UMA
- Host
- Proxmox LXC · Ubuntu 24.04 · kernel 7.0.6
- Model store
- /mnt/ai-models · ZFS
binary
- hal0
- v0.5.0a1 · llama-server provider (OpenAI /v1/*)
- Container
- ghcr.io/hal0ai/amd-strix-halo-toolboxes:rocm-7.2.4-rocmfp4-server
- llama.cpp
- build b9219-1faa48eef · rocmfp4 fork (draft-mtp speculative)
- ROCm
- 7.2.4
leaderboardsnapshot from 2026-06-19
| caps | kv · spec | trend | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| chadrock-35b-ace-saberjcbtc/chadrock-35b-ace-saber-rocmfp4-mtp | 35B-A3B | f16 · draft-mtp | rocm | 100.5fast | 903 | — | — | 83.1% | 19 | — | |
| qwen3.6-35b-a3b-crown-halo-mtp-dynamicjcbtc/qwen3.6-35b-a3b-crown-halo-mtp-dynamic | 35B-A3B | f16 · draft-mtp | rocm | 84.4fast | 873 | — | — | 90.9% | 22.6 | — | |
| chadrock3.6-27b-pi-agent-rocmfp4-mtpjcbtc/chadrock3.6-27b-pi-agent-rocmfp4-mtp | 27B dense | q8 · draft-mtp | rocm | 35.5mid | 301 | — | — | 79.8% | 14.8 | — | |
| qwopus3-6-27b-v2-mtp-bf16-to-rocmfp4-strix-leanlocal / auto-scan | 27B dense | q4 · draft-mtp | rocm | 31.6mid | 310 | — | — | 70.3% | 14.8 | — | |
| gemma-4-12B-agentic-fable5yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF | 12B dense | q4 · — | rocm | 22.7slow | 689 | — | — | — | 7.4 | — | |
| qwen3-coder-next-q4kxlunsloth/Qwen3-Coder-Next-GGUF | — | q4 · — | rocm | 37.8mid | 716 | — | — | — | 49.6 | — | |
| qwen3-coder-next-reap-40b-a3b-q4kxllovedheart/Qwen3-Coder-Next-REAP-40B-A3B-GGUF | 40B MoE | q4 · — | rocm | 26.8mid | 756 | — | — | — | 28.5 | — | |
| Qwopus3.6-27B-Coder-MTPJackrong/Qwopus3.6-27B-Coder-MTP-GGUF | 27B | q4 · draft-mtp | rocm | 19.8slow | 225 | — | — | 60.5% | 22.4 | — | |
| qwen3.6-35b-a3b-q4kxlunsloth/Qwen3.6-35B-A3B-GGUF | — | 35B MoE | q4 · — | rocm | 46.1mid | 1300 | — | — | — | 22.4 | — |
| qwen3.6-27bunsloth/Qwen3.6-27B-GGUF | 27B | q4 · — | rocm | 10.1slow | 300 | — | — | — | 20 | — | |
| chadrock3-6-35b-uncensored-mtp-strix-leanlocal / auto-scan | 35B MoE | q4 · draft-mtp | rocm | 102.1fast | 890 | — | — | 86% | 19 | — | |
| qwen3-coder-reap-25b-a3b-q5kmbartowski/cerebras_Qwen3-Coder-REAP-25B-A3B-GGUF | 25B MoE | q4 · — | rocm | 54.7mid | 1368 | — | — | — | 17.7 | — | |
| gemma-4-26b-a4b-it-q4kxlunsloth/gemma-4-26B-A4B-it-GGUF | — | 26B MoE | q4 · — | rocm | 40.9mid | 1336 | — | — | — | 17.1 | — |
| qwen3.6-27b-heretic-q4kmDavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF | 27B | q4 · — | rocm | 11.6slow | 295 | — | — | — | 16.9 | — | |
| chadrock3-6-27b-pi-agent-mtp-rocmfp4-strix-leanlocal / auto-scan | 27B | q4 · draft-mtp | rocm | 34.9mid | 308 | — | — | 79.8% | 14.8 | — | |
| hermes-4-14b-q5kmbartowski/NousResearch_Hermes-4-14B-GGUF | 14B | q4 · — | rocm | 20.3slow | 614 | — | — | — | 10.5 | — | |
| qwen3.5-9b-deepseek-v4-flash-mtpJackrong/Qwen3.5-9B-DeepSeek-V4-Flash-MTP-GGUF | 9B | q4 · draft-mtp | rocm | 51.3mid | 613 | — | — | 69.7% | 7.6 | — | |
| qwopus3-5-9b-coder-mtp-q6-klocal / auto-scan | 9B | q4 · draft-mtp | rocm | 44.6mid | 618 | — | — | 56% | 7.6 | — | |
| gemma-4-12b-itunsloth/gemma-4-12b-it-GGUF | — | 12B | q4 · — | rocm | 22.7slow | 687 | — | — | — | 7.4 | — |
| gemma4-v2-q4-k-mlocal / auto-scan | — | — | q4 · — | rocm | 22.6slow | 680 | — | — | — | 7.4 | — |
| qwen3.5-9b-q4kxlunsloth/Qwen3.5-9B-GGUF | — | 9B | q4 · — | rocm | 33.0mid | 1045 | — | — | — | 6 | — |
| qwopus3-5-4b-coder-mtp-q6-klocal / auto-scan | 4B | q4 · draft-mtp | rocm | 85.0fast | 889 | — | — | 76.7% | 3.6 | — | |
| qwen3.5-4b-q4kxlunsloth/Qwen3.5-4B-GGUF | — | 4B | q4 · — | rocm | 52.7mid | 1695 | — | — | — | 2.9 | — |
| qwen3-4b-q4-k-mlocal / auto-scan | — | 4B | q4 · — | rocm | 61.9fast | 1849 | — | — | — | 2.5 | — |
| qwen3-zero-coder-v2-0.8b-f16DavidAU/Qwen3-Zero-Coder-Reasoning-V2-0.8B-NEO-EX-GGUF | 0.8B | q4 · — | rocm | 76.3fast | 4827 | — | — | — | 1.6 | — | |
| qwen3.5-0.8bunsloth/Qwen3.5-0.8B-GGUF | — | 0.8B | q4 · — | rocm | 169.8fast | 6248 | — | — | — | 0.6 | — |
≥60 t/s25–60<25·MTP speculativeVisionTool-callingCodingReasoning·Click any header to sort.
evals · task accuracy against decode speed0–1 per task
Eval scores come from the live API — snapshot mode shows throughput only.
No runs for this combination.
The June sweep covers tg only; other workloads land in the next one. Drop back to the default view, or ask for it in the forum.