Prefill: HMX/batch satures, GDN scalaire ancre, plafond ~103 via HVX chunkwise

This commit is contained in:
Richard Loyer 2026-05-24 18:29:46 +02:00
parent ce5d91946e
commit e1a6d4e764
1 changed files with 3 additions and 0 deletions

View File

@ -72,3 +72,6 @@ prefill HTP=55.5 / decode CPU=15.3 t/s. ~512tok prefill 9s + 64tok 4s = 13s repo
## Comparatif 4B Q4_0 (24/05)
Qwen3-4B Engine: prefill HTP 103 / decode CPU 17. Qwen3.5-4B: 55/15. ExecuTorch Q3-4B: ~451/14-21 pte 3.3GB. Engine GGUF 2.2-2.4GB. Decode = ExecuTorch sans pte+mem-. GDN coute 2x prefill (55 vs 103) = cible HVX. Qwen3.5 justifie par qualite+DDDA.
## Prefill 3.5: leviers gratuits satures
HMX on/off=54.7 identique, b1024=54.7 -> GDN scalaire = ancre (pas matmul). Plafond=~103 (dense). Levier unique = GDN HVX chunkwise (semaines, bit-exact frontiere). state f16 modere. decode 15 fige (BW). B-2 phase2 = HVX.