# Perf mesurée SM8750/V79 (prefill HTP ngl99/t8/b512, decode CPU t8) | Modèle | prefill | decode | RAM | |---|---|---|---| | Qwen3.5-4B | 55 | 15 | 2.4 | | Qwen3.5-9B | 41 | 8.4 | 5.0 | | Qwen3-4B dense | 103 | 17 | 2.2 | vs ExecuTorch 4B: 14-21 dec/3.3GB pte. Engine -30% RAM, decode equal. decode=BW plafond (~25GB/s). 9B max prefill via GDN HVX chunkwise (futur). cascade tour ~9s.