# Statut & limites (MAJ 26/05) — à lire avant intégration VALIDÉ device : load 4B, generate() bout-en-bout (test_native), decode CPU exact, FR cohérent, thinking-off déterministe. Modèle tranché = `q35-lmq4` (éval qualité ../eval/VERDICT.md). Perf : prefill clos côté kernel GDN (pas le goulot), decode au plafond CPU. LIMITES / OUVERT : 1. **Prefill HTP CORRIGÉ** (27/05) : charabia = 1 op (SSM_CONV conv1d) cassée sur HTP en multi-token. Fix intégré au backend (`libggml-hexagon.so` : supported_ssm_conv n_t>1→CPU). Plus d'OPFILTER. Prefill HTP 110-180 t/s cohérent. JNI = option C (prefill HTP→transfert KV→decode CPU), validé multi-tour. Prebuilts `lib/` à jour (libkazeia_engine.so option C + libggml-hexagon.so fix) ; rebuild depuis jni/ recommandé (ABI). Options A/B/C dans HANDOFF.md déc.2. 2. **KV = f16 (résolu)** : f16=10.9 vs q8_0=6.5 au decode. `lib/libkazeia_engine.so` (27/05) déjà rebuildé f16, prêt. 3. `generate()` applique déjà ChatML + thinking-off. App fournit `sys`/`usr` (voir system_fr.txt). 4. TTS Talker GGUF chargeable mais **audio e2e non validé** (= intégration app). 5. STT inchangé (ORT-QAIRT). 9B/30B/35B écartés (lents/OOM). 6. Le tg/pp de ce soir étaient throttlés (batterie ~11%) — reconfirmer les chiffres sur batterie pleine.