15 lines
1001 B
Markdown
15 lines
1001 B
Markdown
# Statut & limites (MAJ 26/05) — à lire avant intégration
|
|
|
|
VALIDÉ device : load 4B, generate() bout-en-bout (test_native), decode CPU exact, FR cohérent,
|
|
thinking-off déterministe. Modèle tranché = `q35-lmq4` (éval qualité ../eval/VERDICT.md).
|
|
Perf : prefill clos côté kernel GDN (pas le goulot), decode au plafond CPU.
|
|
|
|
LIMITES / OUVERT :
|
|
1. **Bridge = CPU-only (ngl0)** : prefill sur CPU (~18-19 t/s), pas HTP. HTP (89.5) non câblé
|
|
(ping-pong mono-contexte). OK tours courts ; split HTP→CPU = non trivial, à faire si RAG/long.
|
|
2. **KV q8_0 à revérifier** sur batterie pleine (peut coûter au decode à court contexte).
|
|
3. `generate()` applique déjà ChatML + thinking-off. App fournit `sys`/`usr` (voir system_fr.txt).
|
|
4. TTS Talker GGUF chargeable mais **audio e2e non validé** (= intégration app).
|
|
5. STT inchangé (ORT-QAIRT). 9B/30B/35B écartés (lents/OOM).
|
|
6. Le tg/pp de ce soir étaient throttlés (batterie ~11%) — reconfirmer les chiffres sur batterie pleine.
|