# Perf mesurée SM8750/V79 — MAJ 26/05 (fork ql=qualcomm/llama.cpp) Decode optimum = **ngl99 / t4 / fa1** (PAS t8: contention, 3.5-4B chute à 2.3). Prefill optimum = t8 / b512 / fa1. | Modèle | prefill (t8/b512) | decode (t4+fa) | RAM | |---|---:|---:|---:| | Qwen3-4B dense | 285 | 14 (15.5 KVq8) | 2.2 | | Qwen3.5-4B | 93 | 8.5 (9.8 KVq8) | 2.4 | | Qwen3.5-9B | 70 | 5.7 | 5.0 | Dense 4B decode 14 = parité .pte (15) à RAM −30%. NPU 9.82=CPU 9.8: 77GB/s injoignable au decode (GEMV M=1 latency-bound, ~32 réel). Fork ql ~2x prefill vs ancien tree (50→93). RAM = GGUF mmap pageable + ~3.3GB ION/session NPU. Sortie FR cohérente prefill HTP. KV q8_0 (quasi-lossless) = +16% decode, dense 15.5 > pte, bridge l'active. Leviers morts: spec-decode net-négatif, ngram idem (M=k coûteux GDN), IQ4_NL=même octets, fusion GDN compute-bound. >10 decode 3.5 = kernel GDN-HMX (frontière). t8/9.8/50 obsolètes.