Kazeia-engine/dist/PERF.md

387 B

Perf mesurée SM8750/V79 (prefill HTP ngl99/t8/b512, decode CPU t8)

Modèle prefill decode RAM
Qwen3.5-4B 55 15 2.4
Qwen3.5-9B 41 8.4 5.0
Qwen3-4B dense 103 17 2.2
vs ExecuTorch 4B: 14-21 dec/3.3GB pte. Engine -30% RAM, decode equal. decode=BW plafond (~25GB/s). 9B max prefill via GDN HVX chunkwise (futur). cascade tour ~9s.