Comparatif: Q3-4B 103/17, Q3.5-4B 55/15, ExecuTorch 14-21. Engine egale decode sans pte

This commit is contained in:
Richard Loyer 2026-05-24 18:19:27 +02:00
parent eb72df4767
commit ce5d91946e
1 changed files with 3 additions and 0 deletions

View File

@ -69,3 +69,6 @@ GATED_DELTA_NET ABSENT du profil HTP = GDN 100% CPU confirme. HTP top: CONT(copi
## Mesure split reference (Qwen3.5-4B-Q4_0, GDN-HTP fixe) ## Mesure split reference (Qwen3.5-4B-Q4_0, GDN-HTP fixe)
prefill HTP=55.5 / decode CPU=15.3 t/s. ~512tok prefill 9s + 64tok 4s = 13s reponse. cli lent=mono-device; JNI bascule prefill HTP->decode CPU. B-2 etape1 bit-correct livre. prefill HTP=55.5 / decode CPU=15.3 t/s. ~512tok prefill 9s + 64tok 4s = 13s reponse. cli lent=mono-device; JNI bascule prefill HTP->decode CPU. B-2 etape1 bit-correct livre.
## Comparatif 4B Q4_0 (24/05)
Qwen3-4B Engine: prefill HTP 103 / decode CPU 17. Qwen3.5-4B: 55/15. ExecuTorch Q3-4B: ~451/14-21 pte 3.3GB. Engine GGUF 2.2-2.4GB. Decode = ExecuTorch sans pte+mem-. GDN coute 2x prefill (55 vs 103) = cible HVX. Qwen3.5 justifie par qualite+DDDA.