Reconfirmé device froid 90% (les chiffres throttlés d'hier soir étaient faux): - KV f16 >> q8_0 au decode: q35-lmq4 f16=10.9 vs q8_0=6.5 (-40%, idem d=512). Le déquant KV flash-attn coûte plus que le BW. JNI corrigé type_k/v=F16 (rebuild .so requis avant ship; le .so livré=q8_0 validé, inchangé). - q35-lmq4 prefill HTP=189 ~= 2x Qwen3.5-Q4_0 (98): embeds/output Q4 restent sur NPU vs Q6_K fallback CPU. Argument fort de plus pour q35-lmq4 (+5% decode ET ~2x prefill HTP). - decode sain: q35-lmq4 10.9, dense 11.7. prefill CPU JNI=14 (t4). Decision KV résolue; decision prefill CPU-only vs HTP ouverte (189 motive le câblage). Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| EngineLlmEngine.kt | ||
| kazeia_engine_jni.cpp | ||
| test_engine.c | ||
| test_engine.cpp | ||
| test_native.cpp | ||