From e1a6d4e76460779ba943dd0b70031b89c9760030 Mon Sep 17 00:00:00 2001 From: Richard Loyer Date: Sun, 24 May 2026 18:29:46 +0200 Subject: [PATCH] Prefill: HMX/batch satures, GDN scalaire ancre, plafond ~103 via HVX chunkwise --- CLAUDE.md | 3 +++ 1 file changed, 3 insertions(+) diff --git a/CLAUDE.md b/CLAUDE.md index 5928171..8d6a160 100644 --- a/CLAUDE.md +++ b/CLAUDE.md @@ -72,3 +72,6 @@ prefill HTP=55.5 / decode CPU=15.3 t/s. ~512tok prefill 9s + 64tok 4s = 13s repo ## Comparatif 4B Q4_0 (24/05) Qwen3-4B Engine: prefill HTP 103 / decode CPU 17. Qwen3.5-4B: 55/15. ExecuTorch Q3-4B: ~451/14-21 pte 3.3GB. Engine GGUF 2.2-2.4GB. Decode = ExecuTorch sans pte+mem-. GDN coute 2x prefill (55 vs 103) = cible HVX. Qwen3.5 justifie par qualite+DDDA. + +## Prefill 3.5: leviers gratuits satures +HMX on/off=54.7 identique, b1024=54.7 -> GDN scalaire = ancre (pas matmul). Plafond=~103 (dense). Levier unique = GDN HVX chunkwise (semaines, bit-exact frontiere). state f16 modere. decode 15 fige (BW). B-2 phase2 = HVX.