Prefill: HMX/batch satures, GDN scalaire ancre, plafond ~103 via HVX chunkwise
This commit is contained in:
parent
ce5d91946e
commit
e1a6d4e764
|
|
@ -72,3 +72,6 @@ prefill HTP=55.5 / decode CPU=15.3 t/s. ~512tok prefill 9s + 64tok 4s = 13s repo
|
||||||
|
|
||||||
## Comparatif 4B Q4_0 (24/05)
|
## Comparatif 4B Q4_0 (24/05)
|
||||||
Qwen3-4B Engine: prefill HTP 103 / decode CPU 17. Qwen3.5-4B: 55/15. ExecuTorch Q3-4B: ~451/14-21 pte 3.3GB. Engine GGUF 2.2-2.4GB. Decode = ExecuTorch sans pte+mem-. GDN coute 2x prefill (55 vs 103) = cible HVX. Qwen3.5 justifie par qualite+DDDA.
|
Qwen3-4B Engine: prefill HTP 103 / decode CPU 17. Qwen3.5-4B: 55/15. ExecuTorch Q3-4B: ~451/14-21 pte 3.3GB. Engine GGUF 2.2-2.4GB. Decode = ExecuTorch sans pte+mem-. GDN coute 2x prefill (55 vs 103) = cible HVX. Qwen3.5 justifie par qualite+DDDA.
|
||||||
|
|
||||||
|
## Prefill 3.5: leviers gratuits satures
|
||||||
|
HMX on/off=54.7 identique, b1024=54.7 -> GDN scalaire = ancre (pas matmul). Plafond=~103 (dense). Levier unique = GDN HVX chunkwise (semaines, bit-exact frontiere). state f16 modere. decode 15 fige (BW). B-2 phase2 = HVX.
|
||||||
|
|
|
||||||
Loading…
Reference in New Issue