Cascade 9B+Guard4B tient (7.5GB), Guard8B ok aussi; verdict gros modeles

This commit is contained in:
Richard Loyer 2026-05-24 19:21:08 +02:00
parent f82fa61281
commit 7f9dda4a75
1 changed files with 3 additions and 0 deletions

View File

@ -81,3 +81,6 @@ Mur = dependance serielle 512tok, pas calcul. HVX inner-dot ~0 gain. Cap 55 = re
## 9B + verdict gros modeles (24/05) ## 9B + verdict gros modeles (24/05)
Qwen3.5-9B-Q4_0: prefill HTP 41 / decode CPU 8.4 / 5GB. 30B-A3B Q3 13GB=OOM (11.7 dispo). 35B FP8/Int4 non-GGUF+ne tient pas. Plafond tablette: 9B seul ou 9B+4B parallele. MoE hors-jeu. Decode BW: 4B=15,9B=8.4. Fix GDN s applique au 9B. Qwen3.5-9B-Q4_0: prefill HTP 41 / decode CPU 8.4 / 5GB. 30B-A3B Q3 13GB=OOM (11.7 dispo). 35B FP8/Int4 non-GGUF+ne tient pas. Plafond tablette: 9B seul ou 9B+4B parallele. MoE hors-jeu. Decode BW: 4B=15,9B=8.4. Fix GDN s applique au 9B.
## Cascade 9B+Guard4B = PASSE (24/05)
Speaker 9B 5GB + Thinker Guard-4B 2.5GB = 7.5GB co-resident, 8GB libre. Guard-8B(4.5)+9B=9.5GB ok aussi. +TTS/STT 2GB OK. Guard=qwen3 dense pref22/dec11; 9B pref41/dec8.4. Cascade ~2s+5-8s. Tient sur 16GB. vs 30B/35B OOM.